AI行业一直基于一个昂贵的前提运转:规模是唯一的护城河,算力是唯一的货币。两年来,路线图清晰可见:先花 $100 million,再花 $1 billion,再花 $10 billion 购置 H100 集群,用蛮力堆出智能。
DeepSeek-V3 刚刚粉碎了这一前提。
一家中国研究实验室悄然发布了 DeepSeek-V3。据称,它在 MATH、LiveCodeBench 等关键基准上与 GPT-4o 和 Claude 3.5 Sonnet 不相上下。但真正的爆点不是性能,而是价格标签。DeepSeek 声称,训练这个拥有 6710 亿参数的庞然大物仅花费了约 $5.6 million 的算力额度。
如果这一数字属实,生成式 AI 行业的财务逻辑已被颠覆。业界正在见证大语言模型的“Linux 时刻”——架构上的精妙设计战胜纯粹的暴力堆料,硅谷巨头的专有护城河开始蒸发。
反抗史:从 LLaMA 到 DeepSeek
要理解这次发布的分量,需要把它放在 2023 年以来愈演愈烈的“开源与闭源”之战中来看。
第一阶段:泄露(LLaMA-1)
2023 年 2 月,Meta 的 LLaMA-1 模型被“泄露”到 4chan。研究人员首次能在自己的硬件上运行 GPT-3 级别的模型。这引发了微调的寒武纪大爆发(Alpaca、Vicuna),证明更小、更优化的模型也能越级打怪。但与 GPT-4 相比,它仍是个玩具。
第二阶段:挑战者(Mistral 与 Llama 3)
随后 Mistral Large 和 Llama 3 登场。这些模型缩小了差距,性能达到 GPT-3.5 甚至 GPT-4 Turbo 的水准。它们证明开放权重不只属于爱好者,也能支撑企业级应用。但它们仍依托庞大而传统的集群训练,训练成本仍高达数千万美元。
第三阶段:效率冲击(DeepSeek-V3)
DeepSeek-V3 标志着第三阶段。它不只是“对开放模型来说不错”;它宣称在各项指标上都达到了最先进(SOTA)水平。关键是,它做到这一点并没有依赖 Meta 或 Microsoft 的无限预算。通过直接优化架构本身,DeepSeek 证明了算法创新 > 原始算力规模。
效率悖论:打破“Scaling Law”
要理解 DeepSeek-V3 为何令闭源实验室胆寒,必须掀开引擎盖。如今大多数大语言模型要么是稠密模型,要么是标准混合专家模型(MoE)。它们消耗显存就像燃煤机车烧煤一样。
DeepSeek 不只是训练了一个更大的模型;他们改变了引擎的物理原理。
多头潜在注意力(MLA):内存压缩机
DeepSeek-V3 的杀手锏是 Multi-Head Latent Attention(MLA)。在传统 Transformer 模型中,Key-Value(KV)缓存是头“内存吸血鬼”。随着上下文窗口拉长(例如 128k token),存储特定“键”和“值”所需的内存会爆炸式增长,迫使研究人员购买更多 H100 才能做推理。
MLA 压缩了这个缓存。它不再存储完整的 Key 和 Value 头,而是把它们投影到一个低秩潜在向量中。
通过存储注意力数据的压缩“摘要”而非原始数据,MLA 将 KV 缓存大小相比标准架构减少了近 93%。这让 DeepSeek-V3 能在少得多的 GPU 上运行,同时保持长上下文性能。对于一个痴迷于“Token per Second”(TPS)成本的行业来说,这是圣杯。
DeepSeekMoE:专家蜂群
DeepSeek 还改进了混合专家模型(MoE)架构。标准 MoE 模型会把查询路由给 top-k 专家(例如“编程专家”或“历史专家”)。但传统 MoE 存在“expert collapse”问题:少数专家包揽所有任务,其他专家则闲置。
DeepSeek-V3 采用了更细粒度的方案:
- Fine-Grained Experts:不再使用 8 个巨型专家,而是把功能切分成更细的切片(例如 64 个 routed experts)。
- Shared Experts:将某些专家指定为“始终在线”的共享资源,用于捕捉通用知识,防止出现“knowledge island”——即专业专家与普通语法或逻辑脱节。
结果如何?一个拥有 671 billion parameters 的模型,每个 token 只激活 37 billion 参数。它拥有巨人的大脑体积,却只消耗幼儿的卡路里。
无辅助损失的负载均衡
最技术化但影响深远的一项创新,在于训练稳定性。通常,为了确保 MoE 中的所有“专家”被均衡使用,研究人员会加入“auxiliary loss”函数——当模型忽略某些专家时施加惩罚。
问题在哪?这种惩罚会损害模型的实际表现。它迫使模型为了完成配额而调用“次优”专家。DeepSeek-V3 引入了 Auxiliary-Loss-Free 负载均衡。它不再惩罚模型,而是动态调整每个专家的“bias”项。如果某个专家过载,调用它的“成本”会略微上升,自然而然地促使 router 选择其他专家,同时不会削弱梯度的聚焦。
FP8 混合精度:突破速度上限
$5.6 million 的训练成本数字,在很大程度上依赖于他们使用 FP8(8-bit Floating Point) 精度。
传统上,模型以 BF16(16 位)训练。FP8 专门针对矩阵乘法,将内存占用和带宽需求减半。虽然 NVIDIA H100 支持 FP8,但由于不稳定(数值溢出),很少有实验室能纯粹以 FP8 成功训练 frontier 模型。
DeepSeek 解决了这个问题。通过使用细粒度量化策略(将缩放因子分块到 1x16 的小块上),他们在保持收敛所需数值精度的同时,享受了 8 位数学带来的巨大加速。据称,这让他们的训练速度比同等的 BF16 运行快约 40%,直接大幅削减了 GPU 集群的租赁账单。
地缘政治漏洞
DeepSeek-V3 的存在直接挑战了美国的出口管制。拜登政府 10 月 7 日的芯片禁令旨在通过禁止中国获得 NVIDIA 尖端 H100,将中国 AI 发展冻结在 GPT-3 时代。
其逻辑是:没有每秒 3.2 太比特的互联带宽,就无法训练前沿模型。
DeepSeek 通过针对低带宽通信优化绕开了这一限制。通过激进压缩 GPU 之间传输的数据(使用 FP8 精度和双管道路由),他们在本应“过时”或技术上受限制的硬件上训练出了前沿模型。
他们没有打破封锁,而是造了一辆能用不同燃料跑的车。
性能现实检验
它真的能和 GPT-4o 媲美吗?基准测试给出的答案是“基本是的”。
以下是它在“三大”基准上的表现:
| Benchmark | 领域 | DeepSeek-V3 | GPT-4o (May 2024) | Claude 3.5 Sonnet |
|---|---|---|---|---|
| MATH | 高等数学 | 90.0% | 76.6% | 71.1% |
| LiveCodeBench | 编程(高难度) | 40.2% | 43.1% | 46.2% |
| MMLU | 通用知识 | 88.5% | 88.7% | 88.3% |
Data sourced from publicly reported Technical Reports and independent eval harnesses.
“数学”异常
MATH 上 90.0% 的分数令人震惊。这表明 DeepSeek 在推理数据集上过度优化,很可能是使用其他前沿模型生成的合成数据(distillation)。然而,在 Coding 方面,它略落后于 Claude 3.5 Sonnet——后者仍是开发者的心头好。
细微差别与“气质”
定性测试显示出明显差异。DeepSeek-V3 比 GPT-4o 更“机器人化”、更简洁。它缺少 OpenAI 出了名的通过 RLHF(Reinforcement Learning from Human Feedback)注入模型的那种“创意冗余”。在创意写作上,GPT-4o 仍然占优。但如果是严格从 PDF 中提取数据?DeepSeek 可能反而更好,因为它更少产生“客套话”式的幻觉。
寻租时代的终结?
行业正在远离“Model as a Service”时代。如果 $5.6 million 的训练跑就能有效复制 $100 million 训练跑的产出,OpenAI 和 Anthropic 的利润空间将面临危险。
Token 经济学
目前,OpenAI 对 GPT-4o 的定价约为 $2.50 / 1M input tokens。 DeepSeek API 对 V3 的定价约为 $0.14 / 1M input tokens。
这是 17 倍的价格差。
对于构建 RAG(Retrieval Augmented Generation)管道的创业公司来说,这不是边缘优化,而是商业模式的使能器。那些在 GPT-4o 上“太贵”而无法构建的应用(例如每次查询都读取整个法律文库)在 DeepSeek 上突然变得轻而易举。
未来展望:2026 年及以后
DeepSeek-V3 证明,造一个“神”不需要一万亿美元。你只需要更好的数学。
展望 2026 年,AI 公司的差异化因素将不再是“谁的模型最好?”——这一差距正在归零。真正的差异化因素将是集成能力与信任。
美国国防承包商能把他们的专有代码库托付给一个中国模型吗?答案是“不能”。但对于柏林一位白手起家的 SaaS 创始人来说,答案是“当然可以,绝对可以”。
护城河已经消失。闸门已经打开,水位正在快速上涨。
资料来源 (3)
- arxiv.org DeepSeek-V3 Technical Report
- github.com DeepSeek-V3 GitHub Repository
- llm-stats.com Comparisons: GPT-4o vs DeepSeek-V3
🦋 Bluesky 讨论
在 Bluesky 上讨论