关键要点
- Opus 4.5是新的编码之王:在SWE-bench Verified上获得80.9%的分数,超越了GPT-5.1和Gemini 3 Pro。
- Haiku 4.5以小博大:这个”小”模型现在的编码性能可与上一代的Sonnet 4匹敌。
- 价格战:Opus 4.5定价激进,输入token每百万5美元,大幅低于竞争对手。
- 混合推理:两个模型都具有新的”可切换”推理能力,用于复杂任务。
就在OpenAI和Google似乎用他们的11月发布吸走了房间里所有氧气的时候,Anthropic以一记重拳予以回应。Claude Opus 4.5和Claude Haiku 4.5的发布不仅仅是一次迭代更新;这是对开发者市场核心的精心一击。
在过去几周里,话题一直被GPT-5的推理能力和Gemini 3的生态系统集成所主导。但Anthropic坚持其核心理念:为严肃工作构建最有能力、最可靠、最可控的模型。通过这些新发布,他们有力地证明了在编码和复杂智能体工作流方面,Claude仍然是需要被击败的那个模型。
理解Claude Opus 4.5
Opus 4.5于2025年11月24日发布,是Anthropic的新旗舰。它取代了原来的Opus,成为产品线中”最聪明”的模型,为最苛刻的任务而设计。
规格
- 上下文窗口:200,000个token
- 定价:每百万输入token 5美元/每百万输出token 25美元
- 关键特性:混合推理(在即时响应和扩展”思考”模式之间切换)
基准测试
这里的头条数字是在SWE-bench Verified上的80.9%。对于那些不深入研究AI评估细节的人来说,SWE-bench是测试AI解决现实世界软件工程问题能力的黄金标准。
- Claude Opus 4.5:80.9%
- GPT-5.1:~78%(估计)
- Gemini 3 Pro:~76%(估计)
这不是误差范围内的胜利;这是在当前LLM最具商业价值的领域——编写代码——的决定性领先。
理解Claude Haiku 4.5
虽然Opus抢占头条,但Haiku 4.5(于10月15日悄然发布,现已全面推出)可能是对企业来说更重要的模型。
为什么这很重要
Haiku一直是那个”快速且便宜”的模型。但Haiku 4.5通过做到”快速、便宜、而且聪明”改变了这个等式。Anthropic声称它的编码性能可与Sonnet 4匹敌,而后者几个月前还是最先进的模型。
经济性
- 定价:每百万输入token 1美元/每百万输出token 5美元
- 用例:这是”智能体”工作流的引擎。如果你有一个需要运行数千个子任务的系统——比如分析日志、分流支持工单或编写单元测试——Haiku 4.5使其在经济上可行,且不牺牲质量。
对比:Claude vs. GPT-5 vs. Gemini 3
2025年末的AI格局是一场三驾马车的竞赛。以下是它们的对比:
| 特性 | Claude Opus 4.5 | GPT-5.1 | Gemini 3 Pro |
|---|---|---|---|
| 主要优势 | 编码与智能体控制 | 通用推理与多模态 | Google生态系统集成 |
| 编码基准 | 80.9% | ~78% | ~76% |
| 定价(输入/输出) | $5 / $25 | ~$15 / $75 | ~$10 / $50 |
| 上下文窗口 | 200k | 128k | 128k |
结论:如果你在构建消费者聊天机器人,GPT-5在”个性”方面可能仍有优势。如果你深度使用Google Workspace,Gemini 3是不二之选。但如果你在构建软件、智能体或复杂数据管道,Claude Opus 4.5客观上是目前最适合这项工作的工具——而且明显更便宜。
行业影响
“混合推理”的兴起
Opus 4.5中最有趣的特性之一是能够打开和关闭”推理”。与OpenAI的o1模型强制”思考”暂停不同,Claude让开发者自己选择。这种灵活性对于那些简单查询需要低延迟、复杂查询需要深度思考的应用至关重要。
企业安全
Anthropic继续大力倚重其”Constitutional AI”品牌。Opus 4.5配备企业级安全功能和”AI Safety Level 2”认证。对于银行、医疗服务提供者和政府机构来说,这种安全至上的方法往往是决定性因素。
接下来会发生什么?
Opus 4.5的发布完成了Anthropic的2025年产品线。现在的问题是:OpenAI和Google将如何回应?业界很可能在2026年初看到”GPT-5.5”或”Gemini 3 Ultra”来缩小编码差距。
但就目前而言,球在他们那边。Anthropic已经证明,你不需要最大的炒作机器来获胜;你只需要最好的代码。
底线
Claude Opus 4.5是专注工程的大师课。通过优先考虑编码能力、智能体可靠性和成本效益,Anthropic准确交付了开发者社区所要求的东西。它不仅是GPT-5的有力竞争者;对于许多用例来说,它是更优越的选择。
资料来源 (3)
- anthropic.com Anthropic Opus 4.5 Announcement
- anthropic.com Anthropic Haiku 4.5 Announcement
- aboutamazon.com AWS Bedrock News
🦋 Bluesky 讨论
在 Bluesky 上讨论