「ウォールド・ガーデン」は正式に崩壊した。 10 年間、Google の Tensor Processing Unit (TPU) は AI の世界における禁断の果実でした。 Google Cloud 内でそれらをレンタルし、AlphaGo や Gemini を訓練するときにその力を遠くから観察することはできますが、それらを所有することはできません。確かに、自社のデータセンターにそれらをインストールすることはできません。
そのルールが壊れてしまったのです。
兆ドル規模の AI 市場の構造変化を示唆する動きとして、新たな報道によると、Google は TPU を Meta と、場合によっては Apple に直接レンタルし、最終的には販売する契約を締結しているとのことです。これは単なるサプライヤー契約ではありません。これは Nvidia の鎧の最初の本当のひび割れであり、Google が自社のソフトウェア エコシステムを救おうとした必死の素晴らしい行動です。
Nvidia 株を保有している場合、または AI インフラストラクチャ戦略を構築している場合は、この決定を引き起こした物理学、経済学、およびソフトウェア戦争を理解する必要があります。
ニュース: 奇妙なベッド仲間たち
戦略的な連携は明らかだ。 Meta (Facebook) は世界で最も貪欲な Nvidia H100 の消費者であり、600,000 台を超える Nvidia H100 を蓄積しています。しかし、マーク・ザッカーバーグ氏は、CUDA ロックインと利益率の高いハードウェアに支払われるプレミアムである「NVIDIA 税」から解放されたいという願望を公言しています。
業界の深い噂やレポートによると、次のようになります。
- 取引: Meta は、当初 Google によってホストされていたが、Google のパブリック クラウドから完全に分割されていた「ベアメタル」TPU インスタンス (おそらく Trillium v6) にアクセスできるようになります。
- ロードマップ: 2027 年までに、このフレームワークにより、Meta は TPU ポッドを完全に購入して、Google 以外の自社のデータ センターに設置できるようになります。
- Apple の要因: Apple についても同様の議論が行われています。Apple は、「Apple Intelligence」のために大規模なコンピューティングを必要としていますが、Microsoft などの競合他社に依存したり、Nvidia にマージンを支払ったりすることにアレルギーがあることで有名です。
これにより、需要と供給の関係が一夜にして変化します。 Meta が TPU に切り替えたことを理由に Nvidia の供給量の 20% の購入を中止した場合、Nvidia の価格決定力を支える希少性は蒸発します。
技術的な詳細: 光の物理学と銅の物理学
Nvidia Blackwell B200 が「世界で最も強力なチップ」であるにもかかわらず、Meta はなぜ TPU を必要とするのでしょうか?答えはチップ自体にあるのではなく、ワイヤーにあります。あるいはむしろ、それらが不足しているのです。
OCS の利点 (光回路スイッチング)
Nvidia の SuperPOD は、非常に高速だが従来型の電気スイッチング ネットワークである InfiniBand に依存しています。 100,000 個の GPU を接続するには、何マイルもの銅線と、電子を光子に変換し、またその逆に常に変換するアクティブな電気スイッチが必要です。
TPU v4 以降に導入された Google の秘密兵器は、光回路スイッチ (OCS) をベースにした Palomar (そして現在は Jupiter) です。
デジタル パケット スイッチングの代わりに、ルーターがパケットを読み取ってバッファリングし、送信先を決定して再送信します。Google は MEMS (Micro-Electro-Mechanical Systems) を使用します。これらは、物理的に回転して光ビームをあるサーバーから別のサーバーに反射する小さな微細なミラーです。
物理学の勝利:
- 光の速度: 光から電気への変換はありません。光が反射するだけです。
- 電力ゼロ: ミラーがその位置を保持するために必要な電力は ゼロ です。移動(再構成)するときのみ電力を消費します。電気スイッチは、ポートをアクティブに保つためだけに 24 時間年中無休で大量のワット数を消費します。
- トポロジに依存しない: Google はミリ秒単位でネットワークを物理的に再配線できます。トレーニング ジョブ A には「トーラス」形状が適しており、推論ジョブ B には「ドラゴンフライ」形状が適している場合、ミラーが傾くだけで、スーパーコンピューターは物理的に再配線されます。
効率の計算
Nvidia が生の FLOP を追いかける一方で、Google は パフォーマンス/TCO を追いかけています。 Trillium (v6) TPU は、主にこの相互接続効率により、v5e と比較して 67% エネルギー効率が向上すると主張しています。
理論的な冷却の計算を見てみましょう。電気スイッチは熱を発生します。その熱を冷やさなければなりません。 OCS スイッチはほとんど熱を発生しません。
Nvidia クラスターでは、ネットワーク電力がクラスター全体の消費量の 15 ~ 20% になる可能性があります。 TPU ポッドでは、OCS によりネットワーク消費電力がほぼ 95% 削減されます。 100MW データセンターでは、その効率デルタは、同じ電力エンベロープ内に 30% 多くのコンピューティングを適用できることを意味します。メタにとって、ラマ 5 を訓練することは数十億ドルの価値があります。
ソフトウェア戦争: JAX 対 CUDA
これはウォール街が見逃している部分だ。 Googleはハードウェア収入が欲しいからチップを売っているだけではない。 JAX を救うためにチップを販売しています。
CUDA 堀
Nvidia の独占はハードウェアではありません。それはソフトウェアです。全員が CUDA でコーディングします (PyTorch 経由)。誰もが CUDA を使用しているため、誰もが Nvidia を購入します。それは自己強化ループです。
Google の JAX
Google の内部言語である JAX は、高度な物理学や複雑な数学においては間違いなく優れています。 XLA (Accelerated Linear Algebra) コンパイラ用に自動的に最適化されます。しかし、DeepMind と専門の研究者以外では、採用率は低いです。
TPU を Meta の手に渡すことで、Google は、Google 以外では世界最高の Meta のエンジニアに PyTorch for XLA の最適化を強制しています。
- PyTorch が TPU 上で (XLA 経由で) 完全に動作する場合、「CUDA モート」は砂で埋められます。
- 突然、AMD チップ (XLA/ROCm も実行される) が実行可能になります。
- Intel Gaudi が実行可能になります。
- エコシステム全体が Nvidia から切り離されます。
文脈の歴史: 10 年間の秘密
Google は 2017 年に Transformer アーキテクチャ (GPT の「T」) を発明しました。彼らは 2015 年に最初の TPU を構築しました。彼らは何年も先を行っていました。なぜ彼らは負けたのでしょうか?
- 2016 (TPU v1): 純粋に推論用に構築されています (AlphaGo を実行)。
- 2018 (TPU v2/v3): 訓練中の獣。液体を冷却した。しかし、Google はそれらをクラウドに閉じ込めたままにしました。 「チップが欲しいなら、クラウドを使わなければなりません。」
- 2020-2023 (ハブリス): Google はハードウェアの優位性が無限であると想定していました。チップスは売っていませんでした。
- 2024 (パニック): Microsoft と OpenAI が Nvidia GPU を使用して主導権を握りました。 AWS は Trainium を構築しました。
- 2025 (ピボット): Google は、「クラウド独占」が死刑宣告であることを認識しました。開発者はチップがあるところへ行きます。チップがどこにもない場合、開発者は去ります。
今回の売却は戦略の失敗を認めたものの、回復においては天才的な一打だった。
財務分析: 「NVIDIA 税」の計算
なぜMetaがこの取引に応じたのか、数字を計算してみましょう。
Nvidia マークアップ:
- H100 製造コスト (TSMC + CoWoS + HBM): ~\3,000 - $4,000
- H100 販売価格: ~$25,000 - $30,000
- マージン: ~85%
TPU の経済学: Google は TPU を社内で設計し、バックエンドの設計には Broadcom を使用しています。メタに対して 85% のマージンを確保する必要はありません。彼らは TPU を \15,000 で販売し、50% の健全な利益を上げながら、Meta に Nvidia と比較して 50% 割引を提供できます。
100,000 チップのクラスターの場合:
- NVIDIA のコスト: 30 億ドル
- TPU コスト: 15 億ドル
節約: 15 億ドル。これにより、データセンターの冷却インフラストラクチャ全体の費用が賄えます。
将来を見据えた分析: チップ アライアンス
この動きは事実上「反NVIDIA同盟」を創設することになる。
- Google: ハードウェア収益をもたらし、JAX 関連性を節約し、最大のライバル (Nvidia) に損害を与えます。
- メタ/アップル: Nvidia との値下げ交渉の推進力を獲得し、サプライ チェーンの効率を多様化します。
- Amazon: すでに Trainium がありますが、非 Nvidia パスの検証が行われるようになりました。
市場への影響: 業界は 独占 (Nvidia が 90% シェア) から 寡占 (Nvidia、Google、AWS、AMD) に移行しつつあります。
- 短期 (1 ~ 2 年): Nvidia が王であり続けます。供給のバックログが長すぎるため、ソフトウェアの移植に時間がかかります。
- 中期 (3 ~ 5 年): 利益率は圧縮されます。この具体的なニュースは、Nvidia が享受している 80% の粗利益率がピークに達している可能性が高いことを示しています。
評決: ハードウェアは本物です。物理学 (OCS) は、特定のワークロードに対して優れています。 Google が供給できれば、「Code Red」はもはや Google だけのものではなく、ジェンセン ファンのものになります。
出典 (4)
- datacenterdynamics.com Google Offers TPUs to AI Cloud Providers
- cloud.google.com Google Trillium Architecture
- cloud.google.com TPU v4 Enables Performance, Energy, and CO2e Efficiency Gains
- newsletter.semianalysis.com Analysis: The Nvidia Tax and Custom Silicon
🦋 Bluesky での議論
Bluesky で議論する