リンクをコピーしました!

DeepSeek-V3 対 世界: 1億ドルの堀を打ち破る

DeepSeek-V3 は、報告されているトレーニングコストがわずか 560 万ドルで、GPT-4o の競合であるだけでなく、クローズドソースモデルの経済的非難でもあります。MLA および MoE アーキテクチャがインテリジェンスのルールをどのように書き換えているかを以下に示します。

🌐
機械翻訳

この記事は英語の原文から自動翻訳されています。 英語の原文を読む

石の壁を打ち破るデジタルブレイン、DeepSeek の破壊を象徴しています。

AI 業界は、スケールが唯一の堀であり、コンピューティングが唯一の通貨であるという、単一の高価な前提に基づいて運営されてきました。 2 年間、ロードマップは明確でした。ブルート フォース インテリジェンスを実現するために、H100 クラスターに 1 億円、次に 10 億円、そして 100 億円を費やします。

DeepSeek-V3 はまさにその思い込みを打ち破りました。

中国の研究機関によってひっそりとリリースされた DeepSeek-V3 は、表向きには、MATH や LiveCodeBench などの重要なベンチマークにおいて GPT-4o および Claude 3.5 Sonnet と一致します。しかし、パフォーマンスは見出しではありません。見出しは値札です。 DeepSeek は、この 6,710 億パラメータのモンスターを約 560 万円のコンピューティング クレジットでトレーニングしたと主張しています。

この数字が正確であることが証明されれば、生成 AI セクターの財務論理は覆されることになります。業界は LLM の「Linux モーメント」を目の当たりにしています。これは、アーキテクチャの優雅さがむき出しの暴力を打ち破り、シリコンバレーの巨人の独自の堀が蒸発し始める変化です。

反乱の歴史: LLaMA から DeepSeek まで

このリリースの重要性を理解するには、2023 年以来激化している「オープン対クローズド」戦争の中でこのリリースを文脈化する必要があります。

フェーズ 1: リーク (LLaMA-1)

2023 年 2 月、Meta の LLaMA-1 モデルが 4chan に「流出」しました。研究者は初めて、GPT-3 クラスのモデルを自分のハードウェア上で実行できるようになりました。これは微調整 (アルパカ、ビクーニャ) のカンブリア紀の爆発的な爆発を引き起こし、より小型で最適化されたモデルがその重量を超える性能を発揮できることを証明しました。しかし、GPT-4に比べればまだおもちゃでした。

フェーズ 2: コンテンダーズ (ミストラル & ラマ 3)

その後、Mistral Large と Llama 3 が登場しました。これらのモデルはギャップを埋め、GPT-3.5 または GPT-4 Turbo レベルのパフォーマンスを提供しました。彼らは、オープンウェイトが愛好家だけのものではなく、エンタープライズグレードのアプリケーションにも適していることを証明しました。ただし、彼らは依然として大規模な従来のクラスターでトレーニングされており、トレーニングコストは数千万ドルのままでした。

フェーズ 3: 効率のショック (DeepSeek-V3)

DeepSeek-V3 は第 3 フェーズを示します。これは単に「オープン モデルに適している」というだけではありません。全面的に最先端 (SOTA) パフォーマンスを謳っています。しかし重要なのは、メタやマイクロソフトの無限の予算を「使わずに」これを達成したことです。 DeepSeek は、アーキテクチャ自体を最適化することで、アルゴリズムの革新 > 生のコンピューティングのスケール を証明しました。

効率のパラドックス: 「スケーリングの法則」の打破

なぜ DeepSeek-V3 がクローズドソースのラボにとって恐ろしいのかを理解するには、その内部を調べなければなりません。現在のほとんどの LLM は、高密度モデルまたは標準の専門家混合 (MoE) です。石炭機関車のように VRAM を燃やします。

DeepSeek は、より大きなモデルをトレーニングしただけではありません。彼らはエンジンの物理学を変えました。

マルチヘッド潜在注意 (MLA): メモリ圧縮装置

DeepSeek-V3 のキラー機能は マルチヘッド潜在注意 (MLA) です。従来の Transformer モデルでは、Key-Value (KV) キャッシュはメモリの吸血鬼です。コンテキスト ウィンドウが大きくなるにつれて (たとえば、128,000 トークン)、特定の「キー」と「値」を保存するために必要なメモリが爆発的に増加し、研究者は推論を提供するためだけに H100 をさらに購入する必要があります。

MLA はこのキャッシュを圧縮します。完全なキーと値のヘッドを保存する代わりに、それらを低ランクの潜在ベクトルに投影します。

cKV=xWDKV\mathbf{c}_{KV} = \mathbf{x} W_{DKV}

MLA は、生データそのものではなく、アテンション データの圧縮された「概要」を保存することにより、標準アーキテクチャと比較して KV キャッシュ サイズを 93% 近く削減します。これにより、ロングコンテキストのパフォーマンスを維持しながら、DeepSeek-V3 を大幅に少ない GPU で実行できるようになります。 「1 秒あたりのトークン」(TPS)コストに夢中になっている業界にとって、これは聖杯です。

DeepSeekMoE: スペシャリストの群れ

DeepSeek は、Mixture-of-Experts (MoE) アーキテクチャも改良しています。標準的な MoE モデルは、クエリをトップ k の専門家 (たとえば、「コーディングの専門家」または「歴史の専門家」) にルーティングします。しかし、従来の教育省は「専門家の崩壊」に悩まされており、少数の専門家がすべての仕事を引き継ぎ、他の専門家は何もせずに座っています。

DeepSeek-V3 は次のような詳細なアプローチを使用します。

  1. きめ細かいエキスパート: 8 人の大規模なエキスパートの代わりに、機能をより細かいスライス (例: 64 人のルーティングされたエキスパート) に分割します。
  2. 共有エキスパート: 特定のエキスパートを、共通の知識を収集する「常時接続」の共有リソースとして指定し、専門の専門家が一般的な文法や論理に触れられなくなる「知識の島」問題を防ぎます。

結果? 6,710 億パラメータを持つモデルは、トークンあたり 370 億のみをアクティブにします。脳の大きさは巨人ほどですが、カロリー消費量は幼児程度です。

補助損失のないロード バランシング

最も技術的だが影響力のあるイノベーションの 1 つは、厳密にはトレーニングの安定性にあります。通常、MoE 機能内のすべての「エキスパート」が平等に使用されるようにするために、研究者は「補助損失」関数、つまりモデルが特定のエキスパートを無視した場合のペナルティを追加します。

問題?このペナルティは、モデルの実際のパフォーマンスに悪影響を及ぼします。これにより、モデルは割り当てを満たすためだけに「次善の」専門家を使用することが強制されます。 DeepSeek-V3 では、補助ロスフリー ロード バランシングが導入されています。モデルにペナルティを課すのではなく、各専門家の「バイアス」項を動的に調整します。エキスパートが過労になると、呼び出しの「コスト」がわずかに上昇し、当然のことながら、勾配フォーカスを低下させることなく、ルータが他の場所を探すようになります。

FP8 混合精度: 速度制限突破

560 万円のトレーニング費用という数字は、FP8 (8 ビット浮動小数点) 精度の使用に大きく依存しています。

歴史的に、モデルは BF16 (16 ビット) でトレーニングされていました。 FP8 は、特に行列乗算の場合に必要なメモリ フットプリントと帯域幅を半分に削減します。 NVIDIA の H100 は FP8 をサポートしていますが、不安定性 (数値オーバーフロー) のため、純粋に FP8 で フロンティア モデルをトレーニングすることに成功したラボはほとんどありません。

DeepSeek はこれを解読しました。きめの細かい量子化戦略 (小さな 1x16 タイルへのスケーリング係数のブロック) を使用することで、8 ビット演算の大幅な高速化を実現しながら、収束に必要な数値精度を維持しました。これにより、表向きには、同等の BF16 の実行よりも約 40% 高速にトレーニングできるようになり、GPU クラスターのレンタル料金が直接削減されました。

地政学的欠陥

DeepSeek-V3 の存在は、米国の輸出規制に対する直接の挑戦です。バイデン政権の10月7日のチップ禁止は、NVIDIAの最先端H100へのアクセスを拒否することで、GPT-3時代の中国のAI開発を凍結することを目的としたものだった。

理論的には、毎秒 3.2 テラビットの相互接続速度がなければ、フロンティア モデルをトレーニングすることはできないということでした。

DeepSeek は、低帯域幅通信を最適化することでこれを回避しました。 GPU 間で送信されるデータを (FP8 精度とデュアル パイプ ルーティングを使用して) 積極的に圧縮することで、「時代遅れ」または技術的に制限されていると想定されていたハードウェア上でフロンティア モデルをトレーニングすることに成功しました。

彼らは封鎖を突破しなかった。彼らは異なる燃料で動く車を設計した。

パフォーマンスの現実性チェック

実際のところGPT-4oと同じくらい優れているのでしょうか?ベンチマークは、「ほとんどの場合、はい」と示唆しています。

「ビッグ 3」ベンチマークとの比較は次のとおりです。

ベンチマークドメインディープシーク V3GPT-4o (2024 年 5 月)クロード 3.5 ソネット
数学高度な数学90.0%76.6%71.1%
ライブコードベンチコーディング (ハード)40.2%43.1%46.2%
MMLU一般知識88.5%88.7%88.3%

データは、公的に報告された技術レポートおよび独立した評価ハーネスから得られています。

「数学」の異常

MATH の 90.0% のスコアは驚異的です。これは、DeepSeek が推論データセット、おそらく他のフロンティア モデル (蒸留) によって生成された合成データに対して過剰なインデックスを作成したことを示唆しています。ただし、コーディングに関しては、依然として開発者の心強いクロード 3.5 ソネットにわずかに遅れをとっています。

ニュアンスと「雰囲気」

定性的テストでは明らかな違いが示されます。 DeepSeek-V3 は GPT-4o よりもはるかに「ロボット的」で簡潔です。これには、OpenAI がモデルに悪名高い RLHF (ヒューマン フィードバックからの強化学習) を組み込んだ「創造的な綿毛」が欠けています。クリエイティブなライティングでは、GPT-4o が依然として優れています。 PDF からデータを厳密に抽出するには? DeepSeek は、「丁寧な会話」の幻覚が少ないため、実際には優れている可能性があります。

レントシーカー時代の終わり?

業界は「サービスとしてのモデル」の時代から脱却しつつあります。 560 万ドルのトレーニング実行で 1 億ドルのトレーニング実行の出力を効果的に再現できる場合、OpenAI と Anthropic のマージンは危険にさらされます。

トークンエコノミクス

現在、OpenAI は GPT-4o に対して $2.50 / 100 万の入力トークン を請求しています。 DeepSeek API の V3 の価格は、およそ $0.14 / 100 万の入力トークンです。

これは17倍の価格差です。

RAG (Retrieval Augmented Generation) パイプラインを構築しているスタートアップにとって、これは限界最適化ではありません。それはビジネスモデルを可能にするものです。 GPT-4o で構築するには「コストが高すぎる」アプリケーション (クエリごとに法的リポジトリ全体を読み取るなど) が、DeepSeek では突然簡単になります。

今後の見通し: 2026 年以降

DeepSeek-V3 は、神を構築するのに 1 兆ドルも必要ないことを証明しています。より良い数学が必要なだけです。

2026 年に向けて、AI 企業を区別する要素はもはや「誰が最良のモデルを持っているか?」ではなくなり、その差はゼロに近づきます。差別化要因は 統合と信頼 です。

米国の防衛請負業者は、独自のコードベースを備えた中国モデルを信頼できるでしょうか?答えは「いいえ」です。しかし、ベルリンに住む自力で立ち上げた SaaS 創設者にとって、答えは「はい、もちろんです」です。

お堀がなくなってしまいました。水門は開いており、水位は急速に上昇している。

出典 (3)

Advertisement

🦋 Bluesky での議論

Bluesky で議論する

投稿を検索中...