链接已复制!

Anthropic反击:Claude 4.5 vs. 世界

Anthropic 通过 Claude Opus 4.5 和 Haiku 4.5 重新夺回 AI 王座。本文分解了规格、基准,以及为什么这对开发者很重要。

🌐
机器翻译

本文由英文原文自动翻译而成。 阅读英文原文

Anthropic Claude 4.5 AI 模型的抽象可视化,带有发光神经节点

关键要点

  • Opus 4.5是新的编码之王:在SWE-bench Verified上获得80.9%的分数,超越了GPT-5.1和Gemini 3 Pro。
  • Haiku 4.5以小博大:这个”小”模型现在的编码性能可与上一代的Sonnet 4匹敌。
  • 价格战:Opus 4.5定价激进,输入token每百万5美元,大幅低于竞争对手。
  • 混合推理:两个模型都具有新的”可切换”推理能力,用于复杂任务。

就在OpenAI和Google似乎用他们的11月发布吸走了房间里所有氧气的时候,Anthropic以一记重拳予以回应。Claude Opus 4.5Claude Haiku 4.5的发布不仅仅是一次迭代更新;这是对开发者市场核心的精心一击。

在过去几周里,话题一直被GPT-5的推理能力和Gemini 3的生态系统集成所主导。但Anthropic坚持其核心理念:为严肃工作构建最有能力、最可靠、最可控的模型。通过这些新发布,他们有力地证明了在编码和复杂智能体工作流方面,Claude仍然是需要被击败的那个模型。

理解Claude Opus 4.5

Opus 4.5于2025年11月24日发布,是Anthropic的新旗舰。它取代了原来的Opus,成为产品线中”最聪明”的模型,为最苛刻的任务而设计。

规格

  • 上下文窗口:200,000个token
  • 定价:每百万输入token 5美元/每百万输出token 25美元
  • 关键特性:混合推理(在即时响应和扩展”思考”模式之间切换)

基准测试

这里的头条数字是在SWE-bench Verified上的80.9%。对于那些不深入研究AI评估细节的人来说,SWE-bench是测试AI解决现实世界软件工程问题能力的黄金标准。

  • Claude Opus 4.5:80.9%
  • GPT-5.1:~78%(估计)
  • Gemini 3 Pro:~76%(估计)

这不是误差范围内的胜利;这是在当前LLM最具商业价值的领域——编写代码——的决定性领先。

理解Claude Haiku 4.5

虽然Opus抢占头条,但Haiku 4.5(于10月15日悄然发布,现已全面推出)可能是对企业来说更重要的模型。

为什么这很重要

Haiku一直是那个”快速且便宜”的模型。但Haiku 4.5通过做到”快速、便宜、而且聪明”改变了这个等式。Anthropic声称它的编码性能可与Sonnet 4匹敌,而后者几个月前还是最先进的模型。

经济性

  • 定价:每百万输入token 1美元/每百万输出token 5美元
  • 用例:这是”智能体”工作流的引擎。如果你有一个需要运行数千个子任务的系统——比如分析日志、分流支持工单或编写单元测试——Haiku 4.5使其在经济上可行,且不牺牲质量。

对比:Claude vs. GPT-5 vs. Gemini 3

2025年末的AI格局是一场三驾马车的竞赛。以下是它们的对比:

特性Claude Opus 4.5GPT-5.1Gemini 3 Pro
主要优势编码与智能体控制通用推理与多模态Google生态系统集成
编码基准80.9%~78%~76%
定价(输入/输出)$5 / $25~$15 / $75~$10 / $50
上下文窗口200k128k128k

结论:如果你在构建消费者聊天机器人,GPT-5在”个性”方面可能仍有优势。如果你深度使用Google Workspace,Gemini 3是不二之选。但如果你在构建软件智能体复杂数据管道,Claude Opus 4.5客观上是目前最适合这项工作的工具——而且明显更便宜。

行业影响

“混合推理”的兴起

Opus 4.5中最有趣的特性之一是能够打开和关闭”推理”。与OpenAI的o1模型强制”思考”暂停不同,Claude让开发者自己选择。这种灵活性对于那些简单查询需要低延迟、复杂查询需要深度思考的应用至关重要。

企业安全

Anthropic继续大力倚重其”Constitutional AI”品牌。Opus 4.5配备企业级安全功能和”AI Safety Level 2”认证。对于银行、医疗服务提供者和政府机构来说,这种安全至上的方法往往是决定性因素。

接下来会发生什么?

Opus 4.5的发布完成了Anthropic的2025年产品线。现在的问题是:OpenAI和Google将如何回应?业界很可能在2026年初看到”GPT-5.5”或”Gemini 3 Ultra”来缩小编码差距。

但就目前而言,球在他们那边。Anthropic已经证明,你不需要最大的炒作机器来获胜;你只需要最好的代码。

底线

Claude Opus 4.5是专注工程的大师课。通过优先考虑编码能力、智能体可靠性和成本效益,Anthropic准确交付了开发者社区所要求的东西。它不仅是GPT-5的有力竞争者;对于许多用例来说,它是更优越的选择。

资料来源 (3)

Advertisement

🦋 Bluesky 讨论

在 Bluesky 上讨论

正在搜索帖子...