链接已复制!

芯片禁令悖论:制裁如何造就“精益人工智能”

DeepSeek V4 证明,美国的 санкции 并没有扼杀中国的人工智能,而是使其发生了变异。通过迫使工程师放弃蛮力扩展,转而追求效率,华盛顿意外地创造了一个强大的“精益人工智能”竞争对手,从而绕过了对受限硬件的需求。

🌐
机器翻译

本文由英文原文自动翻译而成。 阅读英文原文

深圳一个临时搭建的服务器机架的特写镜头,该机架采用消费级 GPU,并配有定制冷却装置和绿色 LED 状态指示灯。

这一战略在纸面上看似无懈可击。2022年10月,以及2023年底,美国政府实际上切断了中国接触硅芯片最前沿技术的机会。通过禁止出口Nvidia H100和A100 GPU,华盛顿试图通过切断算力供应来扼杀北京的AI雄心。

其理论很简单:现代AI是蛮力的函数。一个国家拥有的FLOPs(浮点运算)越多,其模型就越聪明。失去浮点运算,就失去未来。

三年之后,这一策略适得其反。

制裁非但没有削弱中国AI,反而施加了一种硅谷从未经历过的进化压力。当OpenAI和谷歌用10万张H100集群扩展基础设施,消耗吉瓦级电力以原始规模解决问题时,像DeepSeek这样的中国实验室被迫用数学手段解决问题。

DeepSeek V4于2026年初问世。该系统代表了一种新型的“精益AI”,它用算法上的优雅彻底绕过硬件封锁,与标准LLM显著不同。颇具讽刺意味的是,其效率创新——尤其是“Engram”架构——承诺可在像高端消费级工作站这样普及的硬件上执行推理任务。

封锁本想让这个行业挨饿。相反,它教会了工程师如何挨饿。

优化陷阱

要理解DeepSeek V4为何是范式转变,必须先了解西方AI的“懒惰时代”(2023-2025)。

在西方,算力实际上取之不尽。如果模型不够智能,无一例外的解决方案就是“把它做得更大”。这就是Scaling Law教条:参数越多、数据越多,智能越高。它有效,但效率低下。这相当于在高尔夫球车上安装一台V12发动机来提速。

中国没有这种奢侈。黑市H100的交易价高达$50,000到$120,000,是建议零售价(MSRP)的两到三倍,每一次浮点运算都必须证明自身价值。这种稀缺迫使工程师去研究Transformer架构本身的低效之处。

  • 为什么要反复重算相同的事实?
  • 为什么每个token都必须关注其他所有token?
  • 为什么神经网络如此不稳定,以至于需要大量冗余?

DeepSeek V4用三项具体技术回答了这些问题:EngramDSAmHC

1. Engram:O(1) 内存革命

V4中最激进的创新是Engram架构,它在2026年1月发布的一篇论文中亮相。

标准LLM患有一种数字健忘症。当被问及法国首都时,GPT-4通过处理神经网络权重来“思考”,实际上是在每次推理过程中重新推导答案。这一过程计算成本高昂。

Engram对知识的处理方式截然不同。它将推理(流体智力)与事实(晶体记忆)分离开来。它将静态知识卸载到一个巨大的只读查找表中,该表位于系统RAM(主板上的标准DDR5内存)里,而非稀缺的GPU显存中。

用计算机科学的术语来说,这将知识检索的复杂度从深度神经网络遍历变成了**O(1)**查找。

CoststandardNlayers×Nparams\text{Cost}_{\text{standard}} \propto N_{\text{layers}} \times N_{\text{params}} CostengramC\text{Cost}_{\text{engram}} \approx C

通过将1000亿参数的知识表卸载到CPU内存,DeepSeek V4只需西方模型所需GPU显存的一小部分,就能处理巨大的上下文窗口。GPU被解放出来专注于推理,而CPU则处理死记硬背。这一架构专门绕过了受制裁显卡的显存瓶颈。

2. DSA:稀疏注意力机制物理学

第二项支柱是DeepSeek Sparse Attention(DSA)

在标准Transformer中,“注意力机制”是二次的(O(n2)O(n^2))。如果输入文档长度加倍,处理它所需的计算量就会变为四倍。每个词都要分析其他所有词。

DSA改变了这一物理规则。它假设,对于任意给定词,文档中绝大多数其他词都是无关的。通过实现动态稀疏掩码,DSA将复杂度降低到**O(nk)O(n \cdot k)**,其中kk是相关token的一个小常数。

Attention(Q,K,V)=softmax(QKTdk)V\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V

在DSA中,QKTQK^T矩阵从未被完整计算。相反,top-k路由预测哪些文本块相关,并只对这些块计算注意力。这让DeepSeek模型能在连同规模标准Llama-3模型都无法运行的硬件上处理128k+的上下文窗口。

3. mHC:稳定技术栈

最后一块拼图详见2025年12月发表的**Manifold-Constrained Hyper-Connections(mHC)**论文,它解决了深度网络的稳定性问题。

随着模型加深(层数增多),流经它们的信号往往会退化,要么爆炸(变为无穷大),要么消失(变为零)。西方实验室用“层归一化(Layer Normalization)”解决此问题,即在每一步进行暴力统计调整。

mHC采用了几何方法。它强制连接矩阵停留在一个称为Birkhoff Polytope(双随机矩阵)的数学对象上。

iMij=1,jMij=1\sum_{i} M_{ij} = 1, \quad \sum_{j} M_{ij} = 1

通过在数学上保证信号范数被保留,DeepSeek省去了昂贵的归一化步骤。这使得网络可以更深、更窄,训练更快、运行更稳定。

达尔文式的代价标签

要充分理解这种架构分野,必须审视驱动它的经济学。

在硅谷,一个“糟糕想法”的代价很低。如果工程师进行一次效率低10%的训练,成本会被支撑整个行业的巨额风险投资补贴所吸收。算力被当作水一样,可以随意取用。

在深圳,一个“糟糕想法”的代价关乎生死存亡。在黑市上H100售价高达$100,000,10%的低效不是一笔账目,而是足以扼杀整个项目的开销。这种极度膨胀的算力成本起到了达尔文过滤器的作用。只有最高效的代码才能存活。

臃肿的架构、懒惰的内存管理和冗余计算被以残酷效率淘汰。结果是,其软件栈比西方同行更精简、更彪悍,也优化得多。当美国开发者学习提示工程时,中国开发者却在学习重写注意力机制的基础数学,只为节省1GB显存。

这种经济压力造成了永久性的分野。即使制裁明天解除,中国实验室也不会回到“西方”的模型构建方式。他们已经找到了更好的方法。

消费级硬件的幻象?

GitHub和HuggingFace上流传着一种说法,称DeepSeek V4“能在双RTX 4090上运行”。这种说法准确吗?

部分属实。

V3架构的完整6710亿参数密度(V4预计与之相当或更高)要以商业可行速度运行,需要近400GB显存,这对消费级显卡来说不可能实现(两块4090只有48GB)。

然而,Engram架构试图改变这一等式。由于大部分“知识”被卸载到系统内存(用户可以轻松花不到$1000安装256GB DDR5),GPU理论上只需承载“推理核心”。

这意味着,深圳的研究者或俄亥俄的爱好者,只要有一台高端工作站,就能运行一个行为上堪比万亿参数巨兽的模型,只是事实查找的延迟更高。这可能打破数据中心的垄断。用户不再需要H100集群来运行SOTA AI;他们只需要大量廉价内存和一个聪明的架构。

汽车行业的类比

历史总是重演。上世纪70年代,美国汽车行业沉迷于排量。大排量V8发动机靠纯粹的气缸容积产生马力。石油危机爆发时,底特律措手不及。

资源匮乏、燃油税重的日本,花了数十年完善小巧高效的直列四缸发动机。当油价上涨,本田思域不仅与福特野马竞争,还主导了市场。

**美国AI就是70年代的V8发动机。**它强劲、轰鸣,且极其浪费。 **中国AI就是80年代的本田思域。**它精简、高效,且越来越能够以零头的成本完成同样的工作。

美国制裁本意是要构筑封锁。结果却起到了碳税的作用。通过抬高算力成本,美国政策迫使对手发明出智能领域的混合动力引擎。如今,随着西方数据中心的电力需求让电网开始承压,这种迫于需求而生的“精益AI”,或许将成为唯一能够真正规模化的架构。

资料来源 (5)

Advertisement

🦋 Bluesky 讨论

在 Bluesky 上讨论

正在搜索帖子...