链接已复制!

推理革命:人工智能在“说话”之前先“思考”

人工智能不再只是预测下一个词。本文深入探讨了从模式匹配到真正推理的结构性转变,采用了 OpenAI 的 o1 和 Google 的 Gemini 1.5 Pro 等思维链模型。

🌐
机器翻译

本文由英文原文自动翻译而成。 阅读英文原文

数字大脑可视化,显示思维链神经通路依次亮起

要点

  • 范式转变:行业已从 AI 模型中的“系统1”思维(快速、直觉化的模式匹配)转向“系统2”思维(缓慢、审慎的推理)。
  • 测试时计算:新的缩放定律不再仅仅关乎训练数据规模,而是关于模型在生成答案过程中投入多少算力。
  • 主要玩家:OpenAI 的 o1 和 Google 的 Gemini 1.5 Pro 正在引领这一潮流,但两者采用了截然不同的架构路径。

过去五年,打造更优 AI 的秘诀很简单:把它做得更大。

更多参数、更多训练数据、更多 GPU。这种蛮力式方法催生了 GPT-4 和 Claude 3。但到了 2025 年,“缩放定律”(那些预测 AI 随数据增加而变聪明的数学曲线)开始趋于平缓。该领域撞上了天花板。模型成了“幻觉制造机”,听起来自信满满,逻辑上却一塌糊涂。

随后,“推理革命”到来了。

关键不在于把模型做得更大,而在于改变它如何作答。新的模型如 OpenAI 的 o1 和 Google 的 Gemini 1.5 Pro 不再脱口而出第一个统计上最可能的 token,而是被训练成先停顿一下、“思考”(生成隐藏的思维链),并在给出最终答案前自我纠正。

缩放定律的悬崖

要理解为何这一转变此刻发生,就必须看看 2024 年的“缩放定律悬崖”。

十年来,Kaplan 缩放定律(以 Jared Kaplan 2020 年的论文命名)一直成立:Performance = (Dataset Size)^α * (Compute)^β。基本上,如果你把数据和 GPU 都翻倍,错误率就会按预期下降。

到了 2024 年底,这条曲线开始变平。

  • 数据稀缺:训练用尽了高质量的互联网文本。各家公司已经抓取了 Wikipedia、Reddit、arXiv 以及所有已数字化的书籍。剩余的数据(合成数据或低质量社交媒体)引发了“模型崩塌”——用 AI 生成的垃圾内容训练出来的 AI 会变得更笨。
  • 收益递减:花 10 亿美元训练出的模型,只比上一代好 2%。经济账开始算不过来。

整个行业面临着生存危机:如果模型无法通过“做大”来变聪明,领域该如何前进?

答案是停止优化预训练(把知识硬塞进去),转而优化后训练(对这些知识进行推理)。事实证明,那些会“思考”10 秒钟的小模型,可以胜过即时作答的大模型。

技术转变:从训练到推理

要理解为何这是一场突破,有必要谈谈算力。

预训练 vs. 推理

传统上,99.9% 的计算成本发生在预训练阶段(教会模型)。推理(回答你的问题)则便宜又快。

新的“系统2”模型颠覆了这一逻辑。它们引入了**“测试时计算”**的概念。

  • 旧方式:问题 -> [即时统计猜测] -> 答案
  • 新方式:问题 -> [推理步骤 1] -> [审视] -> [推理步骤 2] -> [验证] -> 答案

例如,OpenAI 的 o1 在解决一道高难度数学题时,会生成数千个内部“想法”。它可能尝试一种方法,发现是死胡同,再回溯重试:所有这些都在向你展示一个字之前完成。这种内心独白(思维链)让模型能够“推理”出标准大语言模型束手无策的问题。

黑盒内部:“思考”Token 如何工作

当你向 o1 提问时,它并非只是静静地呆着。在底层,它正在生成**“隐藏思维链”(CoT)token**。

  1. 生成:模型把问题拆解。“第一步:定义变量以澄清用户意图。”
  2. 审视:它审视自己的步骤。模型会标记潜在歧义或用户意图不匹配之处。
  3. 修正:它重新生成该步骤。“修正后的第一步:使用 Python 的 asyncio 库。”

这些 token 对用户隐藏(主要是为了防止竞争对手窃取推理数据),但它们是真实的计算。

关键的是,这种能力是通过**强化学习(RL)**训练出来的。训练时,模型被给定一道高难度数学题。如果答对,导致正确答案的整条思维链都会得到奖励;如果失败,整条链则被惩罚。经过数十亿轮循环,模型“学会”了哪些思维模式(拆解问题、检查边界情况)会导向正确答案。

案例研究:o1 与 Gemini 1.5 Pro

当 OpenAI 开启了“推理”热潮,Google 一直在玩一场涉及海量上下文的不同的游戏。

OpenAI o1:深度思考者

  • 策略:面向推理的强化学习。模型在训练中被明确奖励生成正确的思维链。
  • 优势:数学、编程和逻辑。它在 AIME(数学竞赛)等基准测试中表现超群,因为它表现得像一位人类数学家,会逐步检查自己的推导。
  • 劣势:速度慢。这种“思考时间”带来了聊天机器人通常无法接受的延迟,尽管对于复杂的编程任务是必要的。

Google Gemini 1.5 Pro:上下文之王

  • 策略:超大上下文窗口(200 万+ token)+ 上下文内学习。
  • 优势:信息综合。Gemini 1.5 Pro 不仅“想”得深,还“读”得广。它可以把整个代码库、一部电影或一整图书馆的书加载进短期记忆,并跨这些特定数据进行推理。
  • 微妙之处:近期研究表明,尽管 Gemini 在检索和综合方面表现出色,但在面对 o1 能轻松攻克的“纯逻辑”谜题时仍显吃力,除非明确提示它使用思维链(CoT)。

思考的代价

这场革命是有价签的。

在 GPT-4 时代,定价很简单:输入 token(便宜)+ 输出 token(贵)。

到了推理模型时代,多了一项隐藏成本:推理 token

  • 普通提示:“法国的首都是哪里?” -> 5 个输出 token。成本:几分钱的零头。
  • 推理提示:“为 50 辆卡车规划一条避开收费站的物流路线。” -> 模型可能会生成 5,000 个“思考”token 来解这道题,但最终方案只输出 100 个 token。

你要为思考过程付费。这改变了 AI 的经济学。如果你用错模型,简单任务(聊天机器人、摘要)会变得更贵;但它也让过去不可能的任务(编写复杂应用、法律取证)首次成为可能。

市场正在分化:

  1. 快速模型(GPT-4o mini、Gemini Flash):便宜、即时、面向 UI 交互的“系统1”思考者。
  2. 深度模型(o1、Claude 3.5 Opus):昂贵、缓慢、面向高价值工作的“系统2”思考者。

打破 5 分钟之墙

这对你有什么意义?

因为纯生成式 AI(“系统1”型)存在天花板。你永远无法完全信任它来编写代码或提供医疗建议,因为它不知道自己何时出错。它只是在猜测。

推理模型解锁了5 分钟任务(最终还有5 小时任务)。

  • 2023:“写一个计算斐波那契数列的 Python 函数。”(成功)
  • 2025:“为这个特定的应用架构编写 Python 后端,审计安全漏洞,并编写测试套件。”(借助 o1/Gemini 可以实现)

通过在推理时投入更多算力,我们是在用速度换取可靠性。这场转变是从依赖记忆的 AI 转向依赖演绎推理的 AI。

未来:智能体工作流

这是真正**智能体(Agents)**的前奏。一个会执行操作(比如浏览网页或写入文件)的智能体,需要在行动之前推理该行为的后果。

标准大语言模型在这方面过于冲动。它们可能会因为概率分布显示应该这样做就删除一个文件。推理模型凭借其“思考”和自我纠正能力,正是打造安全、自主、可无人监管工作数小时的智能体所缺失的“脑细胞”。

结果不仅仅是更好的聊天机器人,而是真正在开口前先思考的数字员工

资料来源 (3)

Advertisement

🦋 Bluesky 讨论

在 Bluesky 上讨论

正在搜索帖子...