リンクをコピーしました!

西側の設備投資の罠:DeepSeekと効率のギャップ

西側のテクノロジー巨人がAIインフラストラクチャに4000億ドルを注ぎ込む一方で、DeepSeekはわずか560万ドルでトレーニングされたモデルで「コンピューティングの堀」を打ち破りました。この分析では、トレーニング効率のギャップの数学を分解します。

🌐
機械翻訳

この記事は英語の原文から自動翻訳されています。 英語の原文を読む

「CAPEX」と刻印された巨大な金メッキのデータセンターの金庫の未来的なハイパーリアリスティックな映画のショット。洗練された光るネオンデジタルキー(「DeepSeek」とラベル付け)がそれをバイパスし、精密なレーザーエネルギーで純金の壁を切り裂いています。

重要なポイント

  • 1 億ドルの幻想: OpenAI や Google などの西側の大手企業は、モデル トレーニングの実行ごとに 1 億ドル以上を費やしていますが、DeepSeek-V3 はわずか 560 万ドルでトレーニングされており、ブルート フォース コンピューティングは要件ではなく選択であることが証明されました。
  • スパース アクティベーション モート: DeepSeek は、クエリごとの合計 671B のうち 37.3B パラメータのみをアクティブにする Mixture-of-Experts (MoE) アーキテクチャを使用し、推論コストを大幅に削減する 1/18 の効率率を達成します。
  • RL-First Intelligence: 強化学習優先トレーニング (DeepSeek-R1-Zero) を先駆的に開発することで、チームは、高価な人間によるラベル付き教師付き微調整なしで推論能力を発現できることを実証しました。
  • 効率のギャップ: DeepSeek のような企業が、最新の H100/H200 クラスターの代わりに古い H800 ハードウェアを使用して最先端のパフォーマンスを達成するにつれて、「コンピューティングの堀」は急速に「効率の堀」に取って代わられています。

コンピューティングの堀が崩れつつある

この物語はよく知られています。世界クラスの AI を構築するには、国家規模のデータ センター、数百億の資本、NVIDIA ハードウェアへの直接パイプラインが必要です。 2025 年第 4 四半期、その物語は堅固な黄金の壁にぶつかりました。 Microsoft と Google が来年の AI 設備投資の合計が **\4000 億 ** を超えることを確認した中、中国の比較的効率的なチームが、数分の 1 のコストで推論パフォーマンスにおいて OpenAI の o1 に匹敵するモデルである DeepSeek-R1 をリリースしました。

これは単なる小さな最適化ではありません。それは AI 業界の経済構造の破壊です。 2 年間、「コンピューティング モート」理論​​が主流でした。つまり、最も多くの GPU と最も多くの電力を備えたエンティティがデフォルトで勝つという考えです。 DeepSeek は、アルゴリズムの効率性がハードウェア規模における 10 倍の不利を克服できることを証明し、その理論を打ち破りました。マンハッタンの中規模アパートの価格で GPT-4 クラスのモデルをトレーニングできるのであれば、シリコンバレーの既存企業にとって参入障壁はまさに消滅したことになります。

技術的な詳細: スパース アクティベーションの習得

560 万円のトレーニング予算で 6,710 億のパラメータはどのように実行されるのでしょうか?答えは、専門家混合 (MoE) と極度に希薄なアクティベーションにあります。オリジナルの GPT-3 や GPT-4o のような従来の「高密度」モデルは、生成される単一のトークンごとにすべての単一パラメーターをアクティブにします。これは、計算上、1 人に道を尋ねるために都市全体の人々を起こすのと同じことです。

DeepSeek-V3 および R1 は、特殊な MoE アーキテクチャを利用します。モデルには合計 6,710 億のパラメーターが含まれていますが、特定のトークンに対して特定のサブセット (約 373 億) のみがアクティブ化されます。

エキスパート ディスパッチャー

これは、1 人の図書館員がすべてを知ろうとするのではなく、何百人もの高度に専門化された研究者が対応する大規模な図書館のようなものだと考えてください。量子物理学に関する質問があると、「ディスパッチャー」(ゲート ネットワーク)は物理学の専門家にのみリクエストを送信します。計算は次のようになります。

Active Ratio=Active ParametersTotal Parameters=37.3B671B118\text{Active Ratio} = \frac{\text{Active Parameters}}{\text{Total Parameters}} = \frac{37.3 \text{B}}{671 \text{B}} \approx \frac{1}{18}

この 1/18 の比率は、DeepSeek が同等の合計サイズの高密度モデルが実行する作業の 5.5% のみを実行していることを意味します。モデルの大部分を常に「ダーク」に保つことで、システムは推論速度とトレーニングコストを管理可能な範囲に保ちながら、10 倍以上の知識をシステムに詰め込むことができます。

ハードウェアの最適化: H800 を歌うようにする

おそらく最も印象的な技術的偉業は、DeepSeek が NVIDIA H800 GPU (国際輸出規制によって制限されている H100 の修正バージョン) でこれらの結果を達成したことです。これらのチップは、西側のチップに比べて相互接続帯域幅が 50% 少ない (400GB/秒対 900GB/秒)。これを克服するために、DeepSeek チームは、GPU 間のデータ転送を最小限に抑え、優れたエンジニアリングによってハードウェアのボトルネックを効果的に「隠す」独自の通信カーネルを開発しました。

RL-First: 人間の法案を使わない推論

効率ギャップの 2 番目の柱は 強化学習 (RL) です。従来、AI モデルは教師あり微調整 (SFT) と呼ばれるプロセスを経ており、プロンプトに対する「完璧な」回答を書くために何千人もの人間が報酬をもらっています。これは時間がかかり、高価であり、人間の知性によって制限されます。

DeepSeek-R1-Zero は、純粋な RL という別の道を歩みました。モデルには、一連のルール、目標 (数学の問題を解く)、および「検証可能な報酬」システムが与えられました。モデルが正解すると報酬が与えられました。失敗した場合はペナルティが課せられました。

モデルは何千回もの反復を経て、人間が思考方法を教えることなく、独自の「思考連鎖」(CoT) を開発しました。論理、誤りの修正、さらには自己不信さえも完全に試行錯誤を通じて発見しました。この方法論は、可読性を向上させるための最終 R1 リリースの「コールド スタート」SFT フェーズと組み合わせることで、西側企業が必須のビジネスコストとみなしている数百万ドルの人的ラベル付けの請求を排除します。

コンテキストの歴史: ブルートフォース時代の終わり

これがなぜ重要なのかを理解するには、2020 年に研究者によって特定された「スケーリングの法則」を振り返ってください。その前提は、データとコンピューティングが 2 倍になれば、インテリジェンスは直線的に増加するということでした。 5 年間、業界は宗教的な熱意を持ってこのロードマップに従いました。

  • 2021: GPT-3 は、175B params が新しいフロアであることを証明しています。
  • 2023: GPT-4 により、予算が数億ドルに達します。
  • 2024: Meta Llama 3.1 は 16,000 台の H100 で運行され、費用は推定 1 億 2,000 万ドルです。

2025 年後半の DeepSeek のリリースは、このブルートフォース時代の終わりを告げるものです。歴史によれば、リソース (コンピューティング/GPU) が法外に高価になるたびに、市場は最終的にはそれをより安価なリソースで置き換える方法、つまり数学的賢さを見つけます。業界では、「ソフトウェア デファインド GPU」がリアルタイムで実行されるのを目の当たりにしています。

将来を見据えた分析: 設備投資の罠

業界は現在、「西洋資本支出の罠」 に入りつつあります。Microsoft、Amazon、Google などの企業は、コンピューティングが耐久性のある堀であるという前提に基づいて、すでに大規模な物理データセンターに数千億ドルを投入しています。

しかし、競合他社が 100 億ドルのクラスターとより優れた計算を使用して同じ結果を達成できる場合、1000 億ドルのクラスターの投資収益率 (ROI) はどうなるでしょうか?

マージン圧縮

DeepSeek は OpenAI o1 の 1/30 の価格で API アクセスを提供しているため、巨大なデフレ圧力が AI 市場を襲っています。企業は、推論タスクに対して「OpenAI税」を支払う必要がないことに気づき始めています。これにより、西側のプロバイダーは次の選択を迫られます。

  1. 価格を引き下げ、自社のマージンを破壊して競争します。
  2. 開発者がより効率的なオープンソースやより安価な代替品に移行するにつれて、市場シェアの損失を受け入れる

地政学的な変化

これは単なるビジネス上の問題ではありません。それは地政学的リセットです。輸出規制は中国のAIの計算能力を枯渇させるために設計された。中国のチームに劣等なハードウェアでの作業を強制することで、国際社会は意図せずして彼らを世界で最も効率的なアルゴリズムエンジニアになるよう奨励した。 「希少性の考え方」は、シリコンバレーで構築された「豊かさモデル」よりも根本的に現実世界に合わせて設計されたモデル世代を生み出しました。

これはあなたにとって何を意味しますか

開発者やビジネス リーダーにとって、「コンピューティング モート」はもはや AI 競争を無視する正当な理由ではありません。高度な推論 AI の参入障壁は、「主権国家」レベルから「中堅企業」レベルに下がりました。

開発者の場合:

  • 「最大の」モデルの最適化をやめて、R1 の蒸留バージョンで実験を開始します。
  • 1 つの巨大で高価なモデルではなく、複数の小規模で効率的な専門家が一緒に問題を解決する エージェント ワークフロー に焦点を当てます。

あなたが投資家の場合:

  • AI 保有の設備投資とインテリジェンスの比率を慎重に精査します。
  • 「彼らはシリコンの堀を築いているのでしょうか、それとも数学の堀を築いているのでしょうか?」と尋ねてください。シリコンの堀は、ヒーロー画像のデータセンターの金庫と同じくらい簡単に迂回できます。

評決: ブルートフォースよりも効率

2025 年第 4 四半期の DeepSeek-R1 のリリースは、AI 業界がテラフロップスでの電力測定をやめ、効率比で測定し始めた瞬間として記憶されるでしょう。西側設備投資の罠は、現在数十億ドル規模のコンピューティング要塞を構築しているすべての企業に対する警告です。効率ギャップの計算にはバランスシートは関係ありません。結局のところ、最もインテリジェントなシステムとは、最も多くの GPU を搭載したシステムではなく、最小限の GPU で最も多くのことを行うシステムです。


出典 (4)

Advertisement

🦋 Bluesky での議論

Bluesky で議論する

投稿を検索中...