重要なポイント
- 変化: 業界は、AI モデルにおける「システム 1」思考 (高速で直感的なパターン マッチング) から「システム 2」思考 (ゆっくりとした意図的な推論) に移行しました。
- テスト時のコンピューティング: 新しいスケーリングの法則は、もはやトレーニング データのサイズだけを対象とするものではありません。それは、モデルが応答生成中にどれだけのコンピューティングを費やすかということです。
- プレイヤー: OpenAI の o1 と Google の Gemini 1.5 Pro がこの分野をリードしていますが、アーキテクチャ アプローチは根本的に異なります。
過去 5 年間、AI を改善するためのレシピはシンプルでした。AI を大きくする。
より多くのパラメーター、より多くのトレーニング データ、より多くの GPU。この強引なアプローチにより、GPT-4 と Claude 3 が生み出されました。しかし、2025 年には、「スケーリングの法則」(より多くのデータで AI がどの程度賢くなるかを予測する数学的曲線)が平坦になり始めました。フィールドは壁にぶつかっていました。モデルは幻覚マシンであり、自信に満ちたように聞こえるのは優れていましたが、論理的にはひどいものでした。
そして、「推理革命」が起こりました。
モデルを大きくすることではありませんでした。それは答えの方法を変えることについてでした。 OpenAI の o1 や Google の Gemini 1.5 Pro などの新しいモデルは、統計的に可能性のある最初のトークンを口走る代わりに、最終的な答えを提示する前に一時停止し、「考え」(隠れた思考連鎖を生成)、自己修正するようにトレーニングされました。
スケーリング法の崖
なぜこの変化が今起こったのかを理解するには、2024年の「スケーリング法の崖」を見なければなりません。
10 年間、カプラン スケーリングの法則 (Jared Kaplan の 2020 年の論文にちなんで命名) が真実でした: パフォーマンス = (データセット サイズ)^α * (コンピューティング)^β。基本的に、データと GPU を 2 倍にすると、エラー率は予測どおり低下します。
2024 年後半までに、この曲線は平坦になり始めました。
- データ不足: トレーニングの実行では高品質のインターネットが不足しました。企業はすでに、Wikipedia、Reddit、arXiv、および存在するすべてのデジタル化された書籍をスクレイピングしていました。残りのデータ (合成データまたは低品質のソーシャル メディア) は「モデルの崩壊」を引き起こし、AI が生成したスロップで訓練された AI が愚かになってしまいました。
- 収益逓減: 以前のバージョンよりわずか 2% 優れたモデルをトレーニングするのに 10 億円の費用がかかりました。経済は破綻しつつあった。
業界は存亡の危機に直面しました。モデルを大きくすることでモデルをよりスマートにできない場合、この分野はどうやって進むのでしょうか?
答えは、トレーニング前 (知識を詰め込む) の最適化をやめ、トレーニング後 (その知識について推論する) の最適化を始めることでした。 10 秒間「考える」小規模なモデルは、瞬時に応答する大規模なモデルよりも優れたパフォーマンスを発揮できることがわかりました。
技術的な変化: トレーニングから推論へ
これが画期的な理由を理解するには、コンピューティングについて話す必要があります。
事前トレーニングと推論
従来、計算コストの 99.9% は 事前トレーニング (モデルの学習) 中に発生していました。 推論 (質問への回答) は安くて早かったです。
新しい「システム 2」モデルは、この論理を反転させます。彼らは 「テストタイム コンピューティング」 の概念を導入しています。
- 古い方法: 質問 -> [即時の統計的推測] -> 回答
- 新しい方法: 質問 -> [推論ステップ 1] -> [批評] -> [推論ステップ 2] -> [検証] -> 回答
たとえば、OpenAI の o1 は、難しい数学の問題を解決するために、何千もの内部的な「思考」を生成します。それは、あなたに一言も表示する前に、アプローチを試み、行き止まりであることに気づき、後戻りし、再試行するかもしれません。この内部モノローグ (思考連鎖) により、モデルは標準 LLM の困難な問題を「推論」して解決することができます。
ブラック ボックスの内部: 「思考」トークンの仕組み
o1 に質問すると、o1 はただ黙ってそこに座っているわけではありません。内部では 「Hidden Chain of Thought」(CoT) トークンが生成されています。
- 世代: モデルは問題を細分化します。 「ステップ 1: ユーザーの意図を明確にするために変数を定義します。」
- 批評: 独自のステップをレビューします。このモデルは、潜在的な曖昧さまたはユーザーの意図の不一致にフラグを立てます。
- 改良: ステップを再生成します。 「ステップ 1 を改訂: Python の
asyncioライブラリを使用する。」
これらのトークンはユーザーからは隠されていますが (主に競合他社が推論データを盗むのを防ぐため)、実際の計算です。
重要なのは、この行動を訓練するために 強化学習 (RL) が使用されることです。トレーニング中に、モデルには難しい数学の問題が与えられます。正しい答えが得られれば、そこに至る思考の連鎖全体が報われます。失敗すると、チェーンにペナルティが課されます。モデルは、何十億サイクルにもわたって、どの思考パターン (問題の分析、エッジケースのチェック) が正しい答えにつながるかを「学習」します。
ケーススタディ: o1 対 Gemini 1.5 Pro
OpenAI が「推論」の誇大広告を開始した一方で、Google は大規模なコンテキストを伴う別のゲームをプレイしています。
OpenAI o1: 深く考える人
- 戦略: 推論のための強化学習。モデルはトレーニング中に、特に正しい思考連鎖を生成するために報酬を与えられました。
- 強み: 数学、コーディング、ロジック。人間の数学者のように動作し、作業を段階的にチェックするため、AIME (数学コンテスト) などのベンチマークで優位に立っています。
- 弱点: 遅いです。この「思考時間」により、複雑なコーディング タスクには必要ですが、チャットボットには通常許容できない遅延が生じます。
Google Gemini 1.5 Pro: コンテキストの王様
- 戦略: 広範なコンテキスト ウィンドウ (200 万以上のトークン) + インコンテキスト学習。
- 強み: 情報合成。 Gemini 1.5 Pro は、単に深く「考える」だけではありません。それは広く「読まれます」。コードベース全体、映画、書籍ライブラリを短期メモリにロードし、その特定のデータを推論することができます。
- ニュアンス: 最近の研究によると、ジェミニは検索と合成には優れていますが、思考連鎖 (CoT) の使用を明示的に促されない限り、o1 が粉砕する「純粋な論理」パズルに時々苦戦することが示されています。
思考のコスト
この革命には代償が伴います。
GPT-4 時代の価格設定はシンプルで、入力トークン (安価) + 出力トークン (高価) でした。 推論モデルでは、推論トークンという新しい隠れたコストが発生します。
- 標準プロンプト: 「フランスの首都はどこですか?」 -> 5 つのトークンが出力されます。費用: マイクロペニー。
- 推論プロンプト: 「有料道路を回避する 50 台のトラックの物流ルートを計画します。」 -> モデルは、パズルを解くために 5,000 個の「思考」トークンを生成する可能性がありますが、最終計画のトークンは 100 個しか出力されません。
あなたはその思考に対してお金を払います。これにより、AI の経済学が変化します。間違ったモデルを使用すると、単純なタスク (チャットボット、要約) のコストが高くなりますが、不可能なタスク (複雑なアプリのコーディング、法的証拠開示) が初めて可能になります。
市場には分岐点があります。
- 高速モデル (GPT-4o mini、Gemini Flash): 安価でインスタントな、UI インタラクション用の「システム 1」思考モデル。
- ディープ モデル (o1、Claude 3.5 Opus): 価値の高い仕事のための、高価で遅い、「システム 2」思考のモデル。
5 分の壁を突破する
なぜこれがあなたにとって重要なのでしょうか?
純粋に生成的な AI (「システム 1」タイプ) には限界があったからです。コードを書いたり、医学的アドバイスを提供したりすることを完全に信頼することはできません。なぜなら、それがいつ間違っているかを*認識していないからです。それは単なる推測でした。
推論モデルは、5 分間のタスク (最終的には 5 時間のタスク) のロックを解除します。
- 2023: 「フィボナッチ数を計算する Python 関数を作成します。」 (成功)
- 2025: 「この特定のアプリ アーキテクチャ用の Python バックエンドを作成し、セキュリティ上の欠陥がないか監査して、テスト スイートを作成します。」 (o1/Geminiでは可能)
推論時により多くのコンピューティングを費やすことで、速度と信頼性のトレードオフが生じます。 「暗記」に依存するAIから「演繹」に依存するAIへの移行です。
未来: エージェント ワークフロー
これは真の エージェント の前身です。アクション (Web の閲覧やファイルの書き込みなど) を実行するエージェントは、そのアクションを実行する前に、そのアクションの「結果」について推論する必要があります。
標準の LLM はこれには衝動的すぎました。確率分布がそうであると判断したため、彼らはファイルを削除するでしょう。 「考える」能力と自己修正能力を備えた推論モデルは、監督なしで何時間も働くことができる安全で自律的なエージェントに必要な脳細胞の欠如です。
その結果、チャットボットがより優れたものになるだけではありません。話す前に実際に考えるのはデジタル従業員です。
出典 (3)
- openai.com OpenAI o1 System Card
- blog.google Google DeepMind: Gemini 1.5 Pro Technical Report
- arxiv.org Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
🦋 Bluesky での議論
Bluesky で議論する