リンクをコピーしました!

シリコン戦争:Google TPU対Nvidia Blackwell

Googleの新しいTrilliumおよびIronwood TPUは、優れた効率と低コストでNvidiaのBlackwellの優位性に挑戦しています。スペック、経済性、勝者を分析します。

🌐
機械翻訳

この記事は英語の原文から自動翻訳されています。 英語の原文を読む

Google TPUサーバーラック(左)とNvidia Blackwellラック(右)を示す分割画面

重要なポイント

  • コスト効率: Google の TPU v6 (Trillium) は、Nvidia H100/Blackwell と比較して、推論タスクで 1 ドルあたり 4.7 倍優れたパフォーマンスを提供します。
  • Energy King: Google の TPU は、同じワークロードで消費電力を 67% 削減します。これは、データセンターのエネルギー需要が急増する中で重要な要素です。
  • 新たな挑戦者: Google の「Ironwood」(TPU v7) は、優れた効率を維持しながら Blackwell の本来のパフォーマンスに匹敵します。
  • 評決: Nvidia が依然としてトレーニングを支配していますが、Google は大規模な AI 推論に関する戦争に勝利しつつあります。

過去 3 年間、「AI ハードウェア」の代名詞は Nvidia という 1 つの名前でした。同社の H100 以降の Blackwell チップはゴールド スタンダードであり、ChatGPT から Gemini まであらゆるものに搭載されています。しかし、AI 業界が「トレーニング」(モデルの構築) から「推論」(モデルの実行) に移行するにつれて、計算方法も変わりつつあります。

Google を入力してください。世界が Nvidia の割り当てを求めて争っている一方で、Google は独自のカスタム シリコンである Tensor Processing Unit (TPU) を密かに完成させていました。 Trillium (v6) と今後の Ironwood (v7) アーキテクチャのリリースにより、Google は単に代替案を提供するだけではありません。彼らは、ハイパースケーラーにとって最も重要な指標であるコストとエネルギーにおける優位性を主張しています。

これは単なるスペックシートの戦いではありません。これは、汎用的な柔軟性 (Nvidia) と特化した効率性 (Google) という哲学の衝突です。この選択が AI 時代の経済を定義することになります。

背景: コンテキスト

Nvidia モノポリー

Nvidia の優位性は偶然ではありませんでした。同社の CUDA ソフトウェア エコシステムは「堀」を生み出し、開発者が切り替えるのを非常に困難にしていました。最先端のモデルをトレーニングしたい場合は、Nvidia GPU を使用しました。期間。これにより、Nvidia は莫大な利益を得ることができ、Blackwell ラックの価格は 300 万円を超えました。

Google の長期戦

Google は別の道を選びました。 10 年以上前、標準の CPU と GPU では AI のニーズに対応できないことに気づき、自社のワークロード (検索、マップ、そして現在は Gemini) 専用の TPU の構築を開始しました。何年もの間、これらは内部秘密でした。現在、これらは Google Cloud の AI サービスのバックボーンとなっています。

ハードウェアを理解する

Nvidia ブラックウェル (B200/GB200)

Nvidia の Blackwell は野獣です。 「何でもできる」チップとして設計されています。

  • 強み: 大規模なメモリ帯域幅、驚異的な生の計算能力、あらゆる種類の AI ワークロード (トレーニング、推論、科学シミュレーション) を処理する能力。
  • 弱点: 電力を大量に消費し、非常に高価です。それは、食料品店まで F1 カーを運転するようなもので、速いですが、多くのタスクにはやりすぎです。

Google トリリウム (TPU v6) およびアイアンウッド (TPU v7)

Google の TPU は精密機器です。これらは、GPU のグラフィックス レンダリングのレガシーを取り除き、純粋に行列演算 (AI の中核) に焦点を当てます。

  • 強み: 極めて優れたエネルギー効率、光相互接続 (数千のチップを 1 つの「スーパーコンピューター」として動作させる)、および低コスト。
  • 弱点: プログラミングが難しく (JAX/TensorFlow の専門知識が必要)、非 AI タスクの柔軟性が低くなります。

データ: 数字で見る

この数字は、企業バイヤーにとって厳しい状況を示しています。

コストの比較 (3 年間の TCO)

メトリックNvidia H100/ブラックウェル クラスターGoogle TPU v6 ポッド勝者
ハードウェアコスト~1億ドル~\5,200万TPU (-48%)
電気代~\4,700万~\1600万TPU (-66%)
総費用~\1 億 4,700 万ドル~\6,800万TPU (-54%)

出典: AINewsHub、CloudOptimo

パフォーマンス指標

  • 推論: TPU v6 は、Nvidia の現行世代よりも 1 ドルあたり 4.7 倍優れたパフォーマンスを実現します。
  • 効率: Google のチップは、特定の変圧器ワークロードにおいて 100% 優れたワットあたりのパフォーマンスを実現します。

業界への影響

推論への移行

Gemini 3 や GPT-5 のようなモデルが数十億人に使用される製品になるにつれて、業界の支出はトレーニング (モデルの作成) から推論 (モデルの提供) に移行しています。これはGoogleの手に直接影響する。 Nvidia のチップはトレーニングには最適ですが、1 日に何百万ものクエリを処理するには高価すぎます。

「壁に囲まれた庭園」効果

Google の TPU は、Google Cloud 経由でのみ利用できます。 TPU を購入して独自のデータセンターに設置することはできません。このため企業は、Nvidia (AWS、Azure、またはオンプレミス) を柔軟に利用するか、経済性を高めるために Google のエコシステムに固定するかの選択を迫られます。

課題と限界

スペックにもかかわらず、Nvidia はどこにも行きません。

  1. CUDA 堀: Nvidia のソフトウェア エコシステムは依然として非常に優れています。ほとんどの AI 研究者は CUDA で学習しています。コードを Google の JAX または TensorFlow に移植するのは、頭痛の種となる場合があります。
  2. 可用性: Nvidia GPU は、ほぼすべてのクラウド プロバイダーからレンタルできます。 TPU は Google 専用です。
  3. 汎用性: ワークロードが変化しても、GPU はおそらくそれに対応できます。 TPU は専門ツールです。モデルのアーキテクチャがその強みに適合しない場合、パフォーマンスが低下する可能性があります。

これはあなたにとって何を意味しますか

AI スタートアップの場合:

  • 研究開発とトレーニングには Nvidia を使い続けてください。柔軟性にはコストに見合う価値があります。
  • 規模が拡大した場合は、展開 として TPU への移行を検討してください。 50% のコスト削減が利益と破産の分かれ目となる可能性があります。

あなたが投資家の場合:

  • 推論が主要なワークロードになると、Nvidia のマージンが圧迫される可能性があります。
  • Google Cloud には、構造的に大きなコスト上の利点がありますが、まだ完全には織り込まれていません。

結論

「シリコン戦争」は、一方のチップがもう一方のチップを殺すという話ではありません。それは専門化についてです。 Nvidia Blackwell は、イノベーションの原動力である トレーニング の誰もが認める王者であり続けています。しかし、Google の TPU は、経済の原動力である「推論」を克服しました。

2026 年に向けて、市場は二分化すると予想されます。Nvidia がエンタープライズ クラウドとリサーチ クラウドを所有し、Google、AWS (Trainium)、Meta (MTIA) がハイパースケーラーの内部ワークロードを所有します。現時点では、Google は AI の未来は単なるパワーではなく効率であるという 96 億ドルの警告を発砲しました。

出典 (3)

Advertisement

🦋 Bluesky での議論

Bluesky で議論する

投稿を検索中...