链接已复制!

2025年人工智能实力排行榜:OpenAI领跑,谷歌紧追

AI暂停期已结束。2025年12月带来了历史上最大规模的模型发布。本分析拆解了为什么OpenAI和Anthropic并列第一,以及为什么谷歌庞大的Gemini 3生态系统紧随其后,位列第三。

🌐
机器翻译

本文由英文原文自动翻译而成。 阅读英文原文

未来主义数字竞技场,展示了处于排行榜阵型中的OpenAI、Anthropic和谷歌AI实体

2025 年初“人工智能碰壁”的说法正式消亡。今年的大部分时间里,该行业都处于一种奇怪的困境:GPT-4.5 在 2 月份耸耸肩落地,扩容讨论变得悲观,“人工智能是泡沫”成为晚宴上安全的说法。

这种情绪在六周后就崩溃了。

11月12日至12月11日期间,“三巨头”接连放弃了核选项:OpenAI的GPT-5.1(11月12日)、谷歌的Gemini 3(11月18日)和Anthropic的Claude Opus 4.5(11月24日)。然后 OpenAI 回来了第二次:GPT-5.2 于 12 月 11 日到来——据报道,在一份关于 Gemini 势头的内部“红色代码”备忘录之后,该计划加速了 12 月底的窗口。尘埃尚未落定,但基准测试,更重要的是氛围检查,已经完成。

对于决定 2026 年订阅的开发者、战略家或专业人士来说,这是新层次结构的冷酷现实。

这几乎是平局,但原因却截然不同。

排名:分歧决定

自 2023 年 GPT-4 推出以来,这是第一次没有单一的“国王”。相反,功能性双头垄断存在于前沿,紧随其后的是一个巨大的巨头。

#1(并列):OpenAI 的 GPT-5.2

推理引擎

OpenAI 再次做到了这一点,但并不是以人们预期的方式。 GPT-5.2 不仅仅是“知识更丰富”。当谈到回答时的推理时,这是一个根本不同的野兽。

GPT-5.2 提供三种模式——即时、思考和专业——而思考层是重写排行榜的一层。在 ARC-AGI-2(为惩罚模式回忆和奖励真实规则归纳而建立的基准)上,GPT-5.2 思维得分为 52.9%,而 Claude Opus 4.5 为 37.6%,Gemini 3 Pro 为 31.1%。它在 AIME 2025 数学奥林匹克竞赛中获得了完美的 100% 成绩,并以 70.9% 的成绩领先 GDPval(OpenAI 真正专业知识工作的基准),而 Gemini 3 的成绩为 53.5%。

这种智能有一个价格标签:每百万个输入代币 1.75 美元,每百万个输出 14 美元——比 GPT-5.1 高出约 40%——其中 Pro 级别的价格大约比 Thinking 高出一个数量级。

它是无可争议的逻辑、数学和冷酷推理之王。

#1(并列):Anthropic 的 Claude Opus 4.5

降低自身价格的编码主力

如果说 GPT-5.2 是冷逻辑引擎,那么 Claude Opus 4.5 就是生产主力。

这里有两个数字很重要。第一个是 80.9% — Opus 4.5 在 SWE-bench Verified 上的得分,该基准衡量模型是否能够真正修复真实存储库中的真实错误。即使在 GPT-5.2 12 月发布之后,OpenAI 在同一测试中的最佳成绩也达到了 80.0%:两周前的模型仍然保持着编码桂冠,哪怕只有一点点差距。第二个数字是价格:每百万输入代币 5 美元,每百万输出 25 美元,比 Opus 4.1 的定价大约降低了三分之二——与占据编码排行榜榜首的时间相同。

权衡是上下文:20 万个代币窗口,只是 Gemini 3 的 100 万个代币的一小部分。 Anthropic 的赌注是,大多数专业工作——一下午的结对编程、合同审查、代理循环——都可以在 200k 内轻松完成,并且开发人员会很高兴以 2024 年的中端价格获得前沿编码能力。

它注重安全、简洁,是市场上最好的“结对程序员”——而且 Opus 级智能首次为日常工作定价。

#2:谷歌的 Gemini 3

生态系统巨人

谷歌排名第三,但不要将其排除在外。

在 11 月的六天内,Gemini 3 看起来就像是要击败的模型:它的 LMArena Elo 达到了创纪录的 1501,这是第一个超过 1500 线的模型,并且在关键推理基准测试中击败了 GPT-5.1。但 GPT-5.2 12 月的反击再次拉开了差距:ARC-AGI-2 为 31.1% 对比 52.9%,GDPval 为 53.5% 对比 70.9%。在最难的小说推理问题上,Gemini 3 现在明显落后于双寡头。

然而,双子座 3 拥有其他人没有的超能力:形态和影响力

它是三者中最强大的多模态模型(原生视频、音频和图像),具有一百万个令牌的上下文窗口,使 Claude 的 20 万个令牌相形见绌。谷歌正在大力推动与搜索和工作空间套件的集成。它不是最聪明的孤立大脑,但如果你生活在谷歌生态系统中,它是最有用的“助手”。

技术深度探究:智能架构

为什么会发生这种情况?为什么分裂?因为两位领导人在2025年的赌注不同。

“测试时计算”枢轴

OpenAI 将赌注押在推理时间推理上。他们不只是训练更大的模型(训练计算),而是优化模型,使其在回答之前“思考”更长时间(推理计算)。

Total ComputeTraining Ops+(Inference Ops×Reasoning Steps)\text{Total Compute} \approx \text{Training Ops} + (\text{Inference Ops} \times \text{Reasoning Steps})

这正是 GPT-5.2 的 Thinking 和 Pro 模式的作用:调节在回答时间花费多少推理。这就是为什么模型在回答难题之前会暂停——它不是滞后,而是思考——也是为什么 ARC-AGI-2 的分数恰恰在模式匹配模型不及格的新颖规则问题上跳跃。

效率赌注

另一方面,人择则押注于让前沿情报便宜到足以运行一整天

Opus 4.5 的标题不是基准,而是发票。将旗舰产品的价格降低大约三分之二,同时在 SWE-bench Verified 上名列前茅,这表明了 Anthropic 认为钱在哪里:不是在一个英雄的答案中,而是在每项任务进行数千次调用的代理和编码助理中。一款性能好 1% 但价格贵 3 倍的型号就会失去这个市场。

这就是为什么克劳德给人一种“工人”模式的感觉。它的设计和定价都是为了持续生产​​使用。

历史:该行业如何发展至今

要理解2025年12月,就得回顾2025年初的“不满的冬天”。

到 2025 年 2 月,缩放法则似乎遇到了障碍。 GPT-4.5——传闻已久的“猎户座”,许多人期望该模型是 GPT-5——尽管体积庞大且运行成本昂贵,但在日常任务中仅比其前身好不了多少。投资者变得紧张起来。叙述转向“人工智能是一个泡沫”。

打破这堵墙的并不是更大的预训练。这是推理。

思想链上的强化学习——训练模型“解决”问题并在答案验证时奖励它们——结果在原始预训练停滞的地方扩大了规模。 OpenAI 的 o 系列证明了这一概念; GPT-5 8 月份的发布使其成为旗舰产品;到 2025 年底,每个前沿实验室都围绕思维模式重建了阵容。

今年 12 月的发布周期是该支点的第一次全面收获。结果呢?墙被打破了。回报递减已不再是问题;分化是。

前瞻性分析:2026 年及以后

那么,这个行业将何去何从?

对于 CTO 或工程经理来说,2026 年的战略很明确:模型编排

选择“一种模式来统治一切”的日子已经结束了。您不能只购买 OpenAI 的企业许可证就到此为止。

“路由器”架构

2026 年的获胜筹码将如下所示:

  1. GPT-5.2 位于顶部,充当“架构师”。它接收用户查询,将其分解并计划执行。
  2. Claude Opus 4.5 作为“工人”。它采用计划并编写具体的代码或内容,确保安全性和风格上的细微差别。
  3. 双子座 3 作为“眼睛和耳朵”。它先处理所有传入的视频、音频和大型文档输入,然后再将上下文提供给其他人。

情报的成本正在下降,但专业情报的“价值”却在飙升。

成本瓶颈

唯一阻止这艘火箭飞船的是法案。 Peak Reasoning 现在是一款高端产品:GPT-5.2 的推出价格比 GPT-5.1 高出 40%,其 Pro 级别的运行速度大约比 Thinking 级别高出一个数量级。每个“思考”答案都会燃烧数倍于简单答案的代币——这正是 Anthropic 的降价举措如此激进的原因,也是计算稀缺不断推动向架构效率转变的原因。

预计 2026 年将是“小模型”(SLM) 在设备上运行以执行基本任务的一年,仅在复杂推理时才会服从三巨头。但请不要误会:玻璃天花板已经破碎。

OpenAI 和 Anthropic 在峰会上针锋相对。谷歌正在建造他们战斗的体育场。创新的步伐从未如此之快。

资料来源 (13)

Advertisement

🦋 Bluesky 讨论

在 Bluesky 上讨论

正在搜索帖子...