链接已复制!

谷歌的核选项:出售TPU以打破英伟达的控制

谷歌正在打破其“围墙花园”规则,直接向Meta和苹果出售TPU。本分析涵盖了Trillium OCS架构、Meta的交易,以及为什么这种转变威胁到英伟达的垄断地位。

🌐
机器翻译

本文由英文原文自动翻译而成。 阅读英文原文

蓝色发光的谷歌TPU机架冲破玻璃墙,挑战绿色的英伟达巨石

“围墙花园”已经正式倒塌。十年来,谷歌的 Tensor Processing Units(TPU)一直是 AI 世界的禁果。你可以在 Google Cloud 里租用它们,在它们训练 AlphaGo 和 Gemini 时远远观望其威力,但你永远无法真正拥有它们。当然,更不可能把它们装进自己的数据中心。

这条规则刚刚被打破。

据报道,谷歌正在敲定协议,直接向 Meta 出租并最终出售 TPU,苹果也可能参与其中。这一举动标志着万亿美元 AI 市场的结构性转变。这不仅仅是供应商协议;这是 Nvidia 防线上的第一道真正裂痕,也是谷歌为挽救自家软件生态系统而做出的孤注一掷、却又高明的举措。

如果你持有 Nvidia 股票,或正在制定 AI 基础设施战略,你需要理解推动这一决定的物理原理、经济账,以及软件战争。

新闻:出人意料的盟友

战略意图很明显。Meta(Facebook)一直是全球对 Nvidia H100 最饥渴的买家,已囤积超过 600,000 片。但马克·扎克伯格已公开表示,他想摆脱“Nvidia Tax”:即为 CUDA 锁定和高利润硬件支付的溢价。

根据行业深处的传闻和报道:

  • 交易内容:Meta 将获得“bare metal”TPU 实例(可能是 Trillium v6)的访问权,最初由谷歌托管,但会与谷歌公有云完全隔离。
  • 路线图:到 2027 年,该框架允许 Meta 直接购买 TPU pod,安装到非谷歌自有的数据中心内。
  • 苹果因素:苹果也在进行类似谈判。苹果为“Apple Intelligence”需要海量算力,但向来不愿依赖微软等竞争对手,也不愿承担 Nvidia 的高额利润。

这在一夜之间改变了供需等式。如果 Meta 因为转向 TPU 而停止购买 Nvidia 20% 的供货量,支撑 Nvidia 定价权的稀缺性就会烟消云散。

技术深潜:光与铜的物理学

既然 Nvidia Blackwell B200 是“世界上最强大的芯片”,Meta 为什么还要 TPU?答案不在芯片本身,而在连线——或者说,在于没有连线。

OCS 优势(Optical Circuit Switching)

Nvidia 的 SuperPOD 依赖 InfiniBand,这是一种极快但传统的电交换网络。要连接 100,000 块 GPU,你需要数英里铜缆和主动式电交换机,不断地把电子信号转换成光信号,再转换回来。

谷歌自 TPU v4 起部署的秘密武器是 Palomar(以及现在的 Jupiter),基于 Optical Circuit Switches(OCS)

谷歌没有采用数字分组交换——即路由器读取数据包、缓存、决定去向再转发——而是使用 MEMS(Micro-Electro-Mechanical Systems)。它们是微小的微型镜片,通过物理旋转将一束光从一台服务器反射到另一台服务器。

物理层面的胜利:

  1. 光速:无需光电转换。光只是反射。
  2. 零功耗:镜片保持位置时消耗 zero 功率。它只在移动(重配置)时耗电。而电交换机为了维持端口活跃,必须 7×24 小时消耗大量电力。
  3. 拓扑无关:谷歌可以在毫秒级时间内物理重连网络。如果“Torus”拓扑更适合训练任务 A,“Dragonfly”拓扑更适合推理任务 B,镜片只需一倾斜,超级计算机就被物理重连了。

效率计算

当 Nvidia 追逐原始 FLOPs 时,谷歌追求的是 Performance/TCO。Trillium(v6)TPU 宣称相比 v5e 能效提升 67%,主要归功于这种互连效率。

我们来看看理论散热计算。电交换机发热,热量必须被冷却。OCS 交换机几乎不发热。

Total Power=Compute Power+Cooling Power+Networking Power\text{Total Power} = \text{Compute Power} + \text{Cooling Power} + \text{Networking Power}

在 Nvidia 集群中,网络功耗可能占总集群功耗的 15-20%。在 TPU pod 中,OCS 可将该网络功耗降低近 95%。在 100MW 的数据中心里,这一效率差距意味着你可以在同样的电力预算内多塞入 30% 的计算。对正在训练 Llama 5 的 Meta 来说,这价值数十亿美元。

软件战争:JAX 对阵 CUDA

这是华尔街忽略的部分。谷歌卖芯片不只是为了硬件收入,而是为了挽救 JAX

CUDA 护城河

Nvidia 的垄断不在硬件,而在软件。人人用 CUDA(通过 PyTorch)写代码。因为人人用 CUDA,所以人人买 Nvidia。这是一个自我强化的循环。

谷歌的 JAX

谷歌内部的语言 JAX,在高级物理和重数学运算上 arguably 更优。它能自动针对 XLA(Accelerated Linear Algebra)编译器进行优化。但除了 DeepMind 和部分专业研究者,它的采用率很低。

通过把 TPU 交到 Meta 手中,谷歌正迫使 Meta 的工程师——谷歌之外全球最顶尖的工程师——去优化 PyTorch for XLA

  • 如果 PyTorch 在 TPU 上(通过 XLA)完美运行,“CUDA Moat”就会被沙子填满。
  • 突然间,AMD 芯片(同样支持 XLA/ROCm)变得可行。
  • Intel Gaudi 也变得可行。
  • 整个生态系统将与 Nvidia 解耦。

背景历史:十年的秘密

谷歌在 2017 年发明了 Transformer 架构(GPT 中的“T”),并在 2015 年造出了第一颗 TPU。他们领先了好几年。为什么却输了?

  • 2016 年(TPU v1):纯粹为推理而建(用于运行 AlphaGo)。
  • 2018 年(TPU v2/v3):训练巨兽,液冷散热。但谷歌把它们锁在云端。“想要芯片,就得用云。”
  • 2020-2023 年(傲慢期):谷歌认为自己的硬件优势无穷无尽。他们没有出售芯片。
  • 2024 年(恐慌期):微软和 OpenAI 借助 Nvidia GPU 抢占了领先地位。AWS 打造了 Trainium。
  • 2025 年(转向期):谷歌意识到“Cloud Exclusivity”等于死刑。开发者跟着芯片走。如果芯片无处不在,开发者就会离开。

这次出售是对战略失败的承认,却也 recovery 的一步妙招。

财务分析:“Nvidia Tax”计算

我们来算算 Meta 为什么接受这笔交易。

Nvidia 的加价:

  • H100 制造成本(TSMC + CoWoS + HBM):~$3,000 - $4,000
  • H100 售价:~$25,000 - $30,000
  • 利润率:~85%

TPU 的经济账:

谷歌内部设计 TPU,并委托 Broadcom 做后端设计。它不必在 Meta 身上赚取 85% 的利润。它可以把 TPU 卖到 $15,000,获得可观的 50% 利润,同时仍能给 Meta 相对 Nvidia 50% 的折扣

对于一个 100,000 片芯片的集群:

  • Nvidia 成本:$3 Billion
  • TPU 成本:$1.5 Billion

节省:$1.5 Billion。这笔钱足以支付整座数据中心的冷却基础设施。

前瞻性分析:芯片联盟

此举实际上催生了一个“Anti-Nvidia Alliance”。

  1. Google:获得硬件收入 + 保住 JAX 的相关性 + 打击最大对手(Nvidia)。
  2. Meta/Apple:获得与 Nvidia 谈判更低价格的筹码,并提升供应链效率的多元化。
  3. Amazon:已有 Trainium,现在非 Nvidia 路线得到了验证。

市场影响:

行业正从垄断(Nvidia 占 90% 份额)转向寡头(Nvidia、Google、AWS、AMD)。

  • 短期(1-2 年):Nvidia 仍是王者。供应积压太长,软件移植也需要时间。
  • 中期(3-5 年):利润率被压缩。这条新闻 specifically 释放出信号:Nvidia 目前享有的 80% 毛利率很可能已经见顶。

结论:硬件是真实的。物理原理(OCS)在特定工作负载上更优越。如果谷歌能交付足够的供应,“Code Red”不再只属于谷歌——也属于 Jensen Huang。

资料来源 (4)

Advertisement

🦋 Bluesky 讨论

在 Bluesky 上讨论

正在搜索帖子...