关键要点
- 成本效益:Google的TPU v6(Trillium)在推理任务上比Nvidia H100/Blackwell提供4.7倍更好的每美元性能。
- 能效之王:Google的TPU在相同工作负载下消耗少67%的电力,随着数据中心能源需求飙升,这是一个关键因素。
- 新挑战者:Google的”Ironwood”(TPU v7)在保持卓越效率的同时,与Blackwell的原始性能相匹敌。
- 结论:Nvidia仍然统治训练领域,但Google正在赢得大规模AI推理的战争。
在过去三年里,“AI硬件”一直是一个名字的同义词:Nvidia。该公司的H100及后续的Blackwell芯片一直是黄金标准,为从ChatGPT到Gemini的一切提供动力。但随着AI行业从”训练”(构建模型)转向”推理”(运行模型),这个算计正在改变。
Google登场。当全世界都在争夺Nvidia的配额时,Google一直在悄悄完善自己的定制芯片:张量处理单元(TPU)。随着**Trillium(v6)和即将推出的Ironwood(v7)**架构的发布,Google不只是提供一个替代方案;他们声称在对超大规模计算商最重要的指标上占据优势:成本和能源。
这不仅仅是一场规格表之战。这是两种哲学的碰撞:通用灵活性(Nvidia)对专业化效率(Google)。这个选择将定义AI时代的经济学。
背景:来龙去脉
Nvidia的垄断
Nvidia的统治地位并非偶然。他们的CUDA软件生态系统创造了一条”护城河”,让开发者极难转换。如果你想训练一个前沿模型,你就用Nvidia GPU。就这样。这使Nvidia能够获得巨额利润,Blackwell机架的成本高达300万美元以上。
Google的持久战
Google走了一条不同的路。十多年前就意识到标准CPU和GPU无法跟上他们的AI需求,他们开始专门为自己的工作负载(搜索、地图,以及现在的Gemini)构建TPU。多年来,这些一直是内部机密。现在,它们是Google Cloud AI产品的支柱。
理解硬件
Nvidia Blackwell(B200/GB200)
Nvidia的Blackwell是一头猛兽。它被设计成”包办一切”的芯片。
- 优势:巨大的内存带宽、令人难以置信的原始计算能力,以及处理任何类型AI工作负载(训练、推理、科学模拟)的能力。
- 劣势:耗电且极其昂贵。这就像开一辆一级方程式赛车去杂货店,快,但对许多任务来说是杀鸡用牛刀。
Google Trillium(TPU v6)与Ironwood(TPU v7)
Google的TPU是精密仪器。它们剥离了GPU的图形渲染遗产,纯粹专注于矩阵数学(AI的核心)。
- 优势:极致的能源效率、光学互连(允许数千个芯片作为一台”超级计算机”协同工作),以及更低的成本。
- 劣势:编程难度更高(需要JAX/TensorFlow专业知识),对非AI任务的灵活性较差。
数据:用数字说话
这些数字为企业买家描绘了一幅鲜明的图景。
成本比较(3年TCO)
| 指标 | Nvidia H100/Blackwell集群 | Google TPU v6 Pod | 赢家 |
|---|---|---|---|
| 硬件成本 | ~$100M | ~$52M | TPU (-48%) |
| 电力成本 | ~$47M | ~$16M | TPU (-66%) |
| 总成本 | ~$147M | ~$68M | TPU (-54%) |
来源:AINewsHub、CloudOptimo
性能指标
- 推理:TPU v6比Nvidia当前一代提供4.7倍更好的每美元性能。
- 效率:在特定的transformer工作负载中,Google的芯片提供100%更好的每瓦性能。
行业影响
向推理的转变
随着Gemini 3和GPT-5等模型成为数十亿人使用的产品,行业支出正从训练(制造模型)转向推理(服务模型)。这正中Google下怀。Nvidia的芯片在训练方面非常出色,但对于每天服务数百万次查询来说,它们是昂贵的过度配置。
“围墙花园”效应
Google的TPU只能通过Google Cloud获得。你不能买一个TPU放在自己的数据中心里。这迫使公司做出选择:与Nvidia保持灵活性(在AWS、Azure或本地部署),还是为了更好的经济性锁定在Google的生态系统中。
挑战与限制
尽管有这些规格,Nvidia不会消失。
- CUDA护城河:Nvidia的软件生态系统仍然遥遥领先。大多数AI研究人员是在CUDA上学习的。将代码移植到Google的JAX或TensorFlow可能是一件头疼的事。
- 可用性:你几乎可以从任何云提供商那里租用Nvidia GPU。TPU只有Google提供。
- 多功能性:如果你的工作负载发生变化,GPU大概能应对。TPU是专家工具;如果你的模型架构不契合其优势,性能可能会下降。
这对你意味着什么
如果你是AI初创公司:
- 研发和训练坚持使用Nvidia。灵活性值这个价钱。
- 如果达到规模,考虑将部署转移到TPU。50%的成本节约可能是盈利与破产之间的差别。
如果你是投资者:
- 随着推理成为主导工作负载,Nvidia的利润率可能面临压力。
- Google Cloud拥有尚未被完全定价的巨大结构性成本优势。
底线
这场”硅之战”不是一个芯片杀死另一个的问题;而是关于专业化。Nvidia Blackwell仍然是训练领域无可争议的王者,是创新的引擎。但Google的TPU已经征服了推理,即经济的引擎。
进入2026年,预计将看到一个分叉的市场:Nvidia拥有企业和研究云,而Google、AWS(Trainium)和Meta(MTIA)拥有超大规模计算商的内部工作负载。就目前而言,Google已经打响了一记96亿美元的警告:效率,而不仅仅是原始算力,才是AI的未来。
资料来源 (3)
- ainewshub.org Nvidia vs Google TPU 2025 Cost Comparison
- theregister.com Google's Ironwood TPUs AI
- cloudoptimo.com TPU vs GPU: What's the Difference in 2025?
🦋 Bluesky 讨论
在 Bluesky 上讨论