リンクをコピーしました!

チップ禁止のパラドックス:制裁がどのように「リーンAI」を生み出したか

DeepSeek V4は、米国の制裁が中国のAIを殺したのではなく、変異させたことを証明しています。エンジニアに総当たり的なスケールを放棄して効率を追求させたことで、ワシントンは制限されたハードウェアの必要性を回避する、手ごわい「リーンAI」競争相手を誤って作り出してしまいました。

🌐
機械翻訳

この記事は英語の原文から自動翻訳されています。 英語の原文を読む

カスタム冷却と緑色のLEDステータスライトで配線されたコンシューマーGPUを搭載した、深センのハッキングされたサーバーラックのクローズアップ。

この戦略は机上では完璧に見えた。 2022年10月、そして2023年後半にも、米国政府はシリコンの最先端への中国のアクセスを事実上消去した。 NvidiaのH100およびA100 GPUの輸出を禁止することで、米国政府は中国政府の計算能力を枯渇させ、人工知能の野望を打ち砕くことを狙った。

理論は単純でした。現代の AI は総当たりの機能です。国家が保有する FLOP (浮動小数点演算) が増えるほど、そのモデルはより賢くなります。 FLOP を否定し、未来を否定します。

3年後、その戦略は裏目に出た。

この制裁は中国のAIを麻痺させる代わりに、シリコンバレーがこれまで直面したことのない進化的圧力を課した。 OpenAI と Google が 100,000 ユニットの H100 クラスターでインフラストラクチャを拡張し、生のスケールで問題を解決するためにギガワットの電力を消費する一方で、DeepSeek のような中国の研究所は数学で問題を解決することを余儀なくされました。

DeepSeek V4 は 2026 年初頭に登場しました。このシステムは、アルゴリズムの優雅さを使用してハードウェアのブロックを完全に回避する新種の「リーン AI」を表し、標準の LLM とは大きく異なります。皮肉なことに、その効率革新、特に「エングラム」アーキテクチャは、ハイエンドの消費者向けワークステーションと同じくらいアクセス可能なハードウェア上で推論タスクを実行することを約束します。

封鎖は業界を飢えさせることを目的としたものだった。代わりに、エンジニアに断食の方法を教えました。

最適化の罠

DeepSeek V4 がパラダイム シフトである理由を理解するには、西洋 AI の「怠惰な時代」(2023 ~ 2025 年) を理解する必要があります。

西洋では、コンピューティングへのアクセスは事実上無限でした。モデルにインテリジェンスが欠けている場合、その解決策は一般に「モデルを大きくする」ことでした。これは スケーリングの法則 の定説です。つまり、パラメーター数の増加とデータの増加は、知能の増加に相当します。機能しますが、非効率的です。これは、加速を向上させるためにゴルフ カートに V12 エンジンを搭載するのと同等の技術です。

中国にはそんな余裕はなかった。闇市場の H100 はメーカー希望小売価格の 2 倍または 3 倍である 50,000 ドルから 120,000 ドルで取引されており、あらゆる浮動小数点演算はその存在を正当化する必要がありました。この不足により、エンジニアは Transformer アーキテクチャ自体の非効率性を調査する必要がありました。

  • なぜ同じ事実を繰り返し再計算するのでしょうか?
  • なぜすべてのトークンが他のすべてのトークンに注意を払わなければならないのでしょうか?
  • ニューラル ネットワークはなぜ大規模な冗長性を必要とするほど不安定なのでしょうか?

DeepSeek V4 は、EngramDSAmHC という 3 つの特定のテクノロジーを使用してこれらの質問に答えます。

1. エングラム: O(1) 記憶革命

V4 の最も根本的なイノベーションは、2026 年 1 月にリリースされた論文で導入された Engram アーキテクチャです。

標準的な LLM は一種のデジタル記憶喪失に悩まされています。フランスの首都について尋ねられると、GPT-4 はニューラル ウェイトを処理することでそれについて「考え」、すべての推論パスで効果的に答えを再導出します。このプロセスは計算コストが高くなります。

エングラムは知識を異なる方法で扱います。 推論 (流動的な知性) と 事実 (結晶化された記憶) を分離します。静的な知識を、希少な GPU VRAM ではなく システム RAM (マザーボード上の標準 DDR5 メモリ) に常駐する大規模な読み取り専用ルックアップ テーブルにオフロードします。

コンピューター サイエンスの用語で言えば、これにより、知識検索の複雑さがディープ ニューラル パスから O(1) ルックアップに変わります。

CoststandardNlayers×Nparams\text{Cost}_{\text{standard}} \propto N_{\text{layers}} \times N_{\text{params}}

CostengramC\text{Cost}_{\text{engram}} \approx C

DeepSeek V4 は、1,000 億のパラメータ ナレッジ テーブルを CPU RAM にオフロードすることにより、欧米のモデルで必要とされる GPU メモリの一部で大規模なコンテキスト ウィンドウを操作します。 GPU は推理に集中できるようになり、CPU は丸暗記を処理します。このアーキテクチャは、特に認可されたカードの VRAM ボトルネックを回避します。

2. DSA: まばらな注意の物理学

2 番目の柱は DeepSeek スパース アテンション (DSA) です。

標準的な Transformer では、「アテンション メカニズム」は 2 次 (O(n2)O(n^2)) です。入力ドキュメントの長さが 2 倍になると、その処理に必要な計算量は 4 倍になります。すべての単語が他の単語ごとに分析されます。

DSA はこの物理学を変えます。どの単語に対しても、文書内の他の単語の大部分は無関係であると仮定します。動的なスパーシティ マスクを実装することにより、DSA は複雑さを O(nk)O(n \cdot k) に軽減します。ここで、kk は関連するトークンの小さな定数です。

Attention(Q,K,V)=softmax(QKTdk)V\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V

DSA では、QKTQK^T 行列が完全に計算されることはありません。代わりに、上位 k ルーターはテキストのどのブロックが関連するかを予測し、それらのブロックについてのみアテンションを計算します。これにより、DeepSeek モデルは、同じサイズの標準 Llama-3 モデルを実行できないハードウェア上で 128k 以上のコンテキスト ウィンドウを処理できるようになります。

3. mHC: スタックの安定化

多様体制約ハイパーコネクション (mHC) 論文 (2025 年 12 月) で詳述されているパズルの最後のピースは、ディープ ネットワークの安定性の問題を解決します。

モデルが深くなる (層が増える) と、モデルを通過する信号は劣化する傾向があり、爆発する (無限になる) か消滅する (ゼロになる) かのいずれかになります。欧米の研究機関は、すべてのステップで強引な統計調整を行う「レイヤー正規化」によってこの問題を解決しています。

mHC は幾何学的なアプローチを採用しています。これにより、接続行列は バーコフ ポリトープ (二重確率行列) と呼ばれる数学的オブジェクト上に強制的に保持されます。

iMij=1,jMij=1\sum_{i} M_{ij} = 1, \quad \sum_{j} M_{ij} = 1

DeepSeek は、信号ノルムが保持されることを数学的に保証することで、高価な正規化手順の必要性を排除します。これにより、より深く、より狭いネットワークが可能になり、より高速にトレーニングし、より安定して実行できます。

ダーウィンの値札

このアーキテクチャ上の相違を十分に理解するには、それを推進した経済学に目を向ける必要があります。

シリコンバレーでは、「悪いアイデア」のコストは低いです。エンジニアが 10% 非効率なトレーニングを実施した場合、そのコストは業界を支える巨額のベンチャーキャピタル補助金によって吸収されます。コンピューティングは水のように扱われます。それは自由に流れます。

深センでは、「悪いアイデア」の代償は実存に関わるものです。 H100 の価格は闇市場で 100,000 ドルを超えるため、10% の非効率はラインアイテムではありません。それはプロジェクトを潰す出費だ。この非常に膨れ上がったコンピューティングコストは、ダーウィン フィルターとして機能しました。最も効率的なコードだけが生き残りました。

肥大化したアーキテクチャ、怠惰なメモリ管理、冗長な計算は、残酷な効率性を考慮して選択されました。その結果、西側のソフトウェア スタックよりも無駄がなく、より意地悪で、はるかに最適化されたソフトウェア スタックが実現しました。米国の開発者がプロ​​ンプト エンジニアリングを学んでいたのに対し、中国の開発者は 1 ギガバイトの VRAM を節約するためにアテンション メカニズムの基本的な計算を書き直すことを学んでいました。

この経済的圧力により、永続的な乖離が生じています。たとえ明日制裁が解除されたとしても、中国の研究所はモデル構築の「西側」の方法には戻らないだろう。彼らはより良い方法を見つけました。

コンシューマ ハードウェアの蜃気楼?

GitHub と HuggingFace では、DeepSeek V4 が「デュアル RTX 4090 で動作する」という噂が広まっています。この主張は正確ですか?

部分的に。

V3 アーキテクチャの フル 6,710 億パラメータ密度 (V4 はこれを反映または超えると予想されています) を商業的に実行可能な速度で実行するには、ほぼ 400 GB の VRAM が必要ですが、これはコンシューマー カードでは不可能です (4090 のペアには 48 GB があります)。

ただし、Engram アーキテクチャは方程式を変更しようとしています。 「知識」の大部分はシステム RAM (ユーザーは 1,000 ドル未満で 256 GB の DDR5 を簡単にインストールできます) にオフロードされるため、GPU は理論的には「推論コア」を保持するだけで済みます。

これは、深センの研究者やオハイオ州の愛好家がハイエンドのワークステーションを使えば、事実の検索のレイテンシは高くても、1兆パラメータの巨大なモデルのように動作するモデルを実行できることを意味します。データセンターの独占を崩す恐れがあります。ユーザーは SOTA AI を実行するために H100 クラスターを必要としなくなりました。必要なのは、大量の安価な RAM とスマートなアーキテクチャだけです。

自動車業界のパラレル

歴史は繰り返されます。 1970 年代、米国の自動車産業は排気量に夢中になっていました。大きな V8 エンジンは、膨大な容積によって馬力を生み出しました。石油危機が発生すると、デトロイトは窮地に立たされました。

資源に制約があり、燃料税が課せられている日本は、小型で効率の良い直列4気筒エンジンの完成に数十年を費やしてきた。ガソリンが高価になったとき、ホンダ シビックはフォード マスタングと競合するだけではありませんでした。それは市場を支配しました。

米国の AI は 1970 年代の V8 です。 強力で、騒音が大きく、信じられないほど無駄が多いです。 中国の AI は 1980 年代のシビックです。 無駄がなく効率的で、数分の 1 のコストで同じ仕事を実行できる能力がますます高まっています。

米国の制裁は封鎖として機能することを目的としていた。代わりに、それらは炭素税として機能しました。米国の政策は、コンピューティングを高価にすることで、ライバルにインテリジェンスのハイブリッドエンジンの発明を強いた。現在、欧米のデータセンターの電力需要によって電力網が歪み始めているため、必要に迫られて生まれた「リーン AI」が、真に拡張できる唯一のアーキテクチャであることが判明するかもしれません。

出典 (5)

Advertisement

🦋 Bluesky での議論

Bluesky で議論する

投稿を検索中...