这一战略在纸面上看似无懈可击。2022年10月,以及2023年底,美国政府实际上切断了中国接触硅芯片最前沿技术的机会。通过禁止出口Nvidia H100和A100 GPU,华盛顿试图通过切断算力供应来扼杀北京的AI雄心。
其理论很简单:现代AI是蛮力的函数。一个国家拥有的FLOPs(浮点运算)越多,其模型就越聪明。失去浮点运算,就失去未来。
三年之后,这一策略适得其反。
制裁非但没有削弱中国AI,反而施加了一种硅谷从未经历过的进化压力。当OpenAI和谷歌用10万张H100集群扩展基础设施,消耗吉瓦级电力以原始规模解决问题时,像DeepSeek这样的中国实验室被迫用数学手段解决问题。
DeepSeek V4于2026年初问世。该系统代表了一种新型的“精益AI”,它用算法上的优雅彻底绕过硬件封锁,与标准LLM显著不同。颇具讽刺意味的是,其效率创新——尤其是“Engram”架构——承诺可在像高端消费级工作站这样普及的硬件上执行推理任务。
封锁本想让这个行业挨饿。相反,它教会了工程师如何挨饿。
优化陷阱
要理解DeepSeek V4为何是范式转变,必须先了解西方AI的“懒惰时代”(2023-2025)。
在西方,算力实际上取之不尽。如果模型不够智能,无一例外的解决方案就是“把它做得更大”。这就是Scaling Law教条:参数越多、数据越多,智能越高。它有效,但效率低下。这相当于在高尔夫球车上安装一台V12发动机来提速。
中国没有这种奢侈。黑市H100的交易价高达$50,000到$120,000,是建议零售价(MSRP)的两到三倍,每一次浮点运算都必须证明自身价值。这种稀缺迫使工程师去研究Transformer架构本身的低效之处。
- 为什么要反复重算相同的事实?
- 为什么每个token都必须关注其他所有token?
- 为什么神经网络如此不稳定,以至于需要大量冗余?
DeepSeek V4用三项具体技术回答了这些问题:Engram、DSA和mHC。
1. Engram:O(1) 内存革命
V4中最激进的创新是Engram架构,它在2026年1月发布的一篇论文中亮相。
标准LLM患有一种数字健忘症。当被问及法国首都时,GPT-4通过处理神经网络权重来“思考”,实际上是在每次推理过程中重新推导答案。这一过程计算成本高昂。
Engram对知识的处理方式截然不同。它将推理(流体智力)与事实(晶体记忆)分离开来。它将静态知识卸载到一个巨大的只读查找表中,该表位于系统RAM(主板上的标准DDR5内存)里,而非稀缺的GPU显存中。
用计算机科学的术语来说,这将知识检索的复杂度从深度神经网络遍历变成了**O(1)**查找。
通过将1000亿参数的知识表卸载到CPU内存,DeepSeek V4只需西方模型所需GPU显存的一小部分,就能处理巨大的上下文窗口。GPU被解放出来专注于推理,而CPU则处理死记硬背。这一架构专门绕过了受制裁显卡的显存瓶颈。
2. DSA:稀疏注意力机制物理学
第二项支柱是DeepSeek Sparse Attention(DSA)。
在标准Transformer中,“注意力机制”是二次的()。如果输入文档长度加倍,处理它所需的计算量就会变为四倍。每个词都要分析其他所有词。
DSA改变了这一物理规则。它假设,对于任意给定词,文档中绝大多数其他词都是无关的。通过实现动态稀疏掩码,DSA将复杂度降低到****,其中是相关token的一个小常数。
在DSA中,矩阵从未被完整计算。相反,top-k路由预测哪些文本块相关,并只对这些块计算注意力。这让DeepSeek模型能在连同规模标准Llama-3模型都无法运行的硬件上处理128k+的上下文窗口。
3. mHC:稳定技术栈
最后一块拼图详见2025年12月发表的**Manifold-Constrained Hyper-Connections(mHC)**论文,它解决了深度网络的稳定性问题。
随着模型加深(层数增多),流经它们的信号往往会退化,要么爆炸(变为无穷大),要么消失(变为零)。西方实验室用“层归一化(Layer Normalization)”解决此问题,即在每一步进行暴力统计调整。
mHC采用了几何方法。它强制连接矩阵停留在一个称为Birkhoff Polytope(双随机矩阵)的数学对象上。
通过在数学上保证信号范数被保留,DeepSeek省去了昂贵的归一化步骤。这使得网络可以更深、更窄,训练更快、运行更稳定。
达尔文式的代价标签
要充分理解这种架构分野,必须审视驱动它的经济学。
在硅谷,一个“糟糕想法”的代价很低。如果工程师进行一次效率低10%的训练,成本会被支撑整个行业的巨额风险投资补贴所吸收。算力被当作水一样,可以随意取用。
在深圳,一个“糟糕想法”的代价关乎生死存亡。在黑市上H100售价高达$100,000,10%的低效不是一笔账目,而是足以扼杀整个项目的开销。这种极度膨胀的算力成本起到了达尔文过滤器的作用。只有最高效的代码才能存活。
臃肿的架构、懒惰的内存管理和冗余计算被以残酷效率淘汰。结果是,其软件栈比西方同行更精简、更彪悍,也优化得多。当美国开发者学习提示工程时,中国开发者却在学习重写注意力机制的基础数学,只为节省1GB显存。
这种经济压力造成了永久性的分野。即使制裁明天解除,中国实验室也不会回到“西方”的模型构建方式。他们已经找到了更好的方法。
消费级硬件的幻象?
GitHub和HuggingFace上流传着一种说法,称DeepSeek V4“能在双RTX 4090上运行”。这种说法准确吗?
部分属实。
V3架构的完整6710亿参数密度(V4预计与之相当或更高)要以商业可行速度运行,需要近400GB显存,这对消费级显卡来说不可能实现(两块4090只有48GB)。
然而,Engram架构试图改变这一等式。由于大部分“知识”被卸载到系统内存(用户可以轻松花不到$1000安装256GB DDR5),GPU理论上只需承载“推理核心”。
这意味着,深圳的研究者或俄亥俄的爱好者,只要有一台高端工作站,就能运行一个行为上堪比万亿参数巨兽的模型,只是事实查找的延迟更高。这可能打破数据中心的垄断。用户不再需要H100集群来运行SOTA AI;他们只需要大量廉价内存和一个聪明的架构。
汽车行业的类比
历史总是重演。上世纪70年代,美国汽车行业沉迷于排量。大排量V8发动机靠纯粹的气缸容积产生马力。石油危机爆发时,底特律措手不及。
资源匮乏、燃油税重的日本,花了数十年完善小巧高效的直列四缸发动机。当油价上涨,本田思域不仅与福特野马竞争,还主导了市场。
**美国AI就是70年代的V8发动机。**它强劲、轰鸣,且极其浪费。 **中国AI就是80年代的本田思域。**它精简、高效,且越来越能够以零头的成本完成同样的工作。
美国制裁本意是要构筑封锁。结果却起到了碳税的作用。通过抬高算力成本,美国政策迫使对手发明出智能领域的混合动力引擎。如今,随着西方数据中心的电力需求让电网开始承压,这种迫于需求而生的“精益AI”,或许将成为唯一能够真正规模化的架构。
资料来源 (5)
- dataconomy.com DeepSeek Reveals MODEL1 Architecture in GitHub Update
- arxiv.org Manifold-Constrained Hyper-Connections (mHC)
- rewire.it Engram - How DeepSeek Added a Second Brain to LLMs
- infoq.com DeepSeek V3.2 and Sparse Attention
- subhadipmitra.com DeepSeek mHC and Stability
🦋 Bluesky 讨论
在 Bluesky 上讨论