链接已复制!

Google Gemini 3:代理时代的开始

Google刚刚推出了Gemini 3,它具有破纪录的基准分数和一个名为Antigravity的新编码平台。这是它对人工智能竞争的意义。

🌐
机器翻译

本文由英文原文自动翻译而成。 阅读英文原文

Google Gemini 3 发布视觉图,展示了新的 AI 模型品牌

发生了什么

Google于2025年11月18日正式推出了Gemini 3,距Gemini 2.5发布仅七个月。新模型立即通过Gemini应用、Google AI Studio、Vertex AI以及一个名为Google Antigravity的全新代理开发平台提供。

首席执行官Sundar Pichai称其为”世界上最适合复杂推理的模型”,而基准测试支持了这一说法。Gemini 3以突破性的1501 Elo评分登顶LMArena排行榜——第一个跨越1500门槛的大型语言模型。

这比Google之前的Gemini 2.5 Pro(徘徊在1450 Elo左右)跃升了约50分,并使其在正面人类偏好测试中领先于OpenAI的GPT-5.1和Anthropic的Claude 4.5 Sonnet。

关键细节

  • 发布日期:2025年11月18日
  • LMArena Elo评分:1501(第一个超过1500的模型)
  • 博士级推理:Humanity’s Last Exam上37.5%,GPQA Diamond上91.9%
  • 数学:MathArena Apex上23.4%(新的最先进水平)
  • 编码:WebDev Arena上1487 Elo,SWE-bench Verified上76.2%
  • 多模态:MMMU-Pro上81%,Video-MMMU上87.6%
  • 可用性:Gemini应用、AI Studio、Vertex AI、Google Antigravity

为什么重要

对消费者

Gemini 3增强的推理能力意味着该模型现在可以”可靠地完成10到15个连贯的逻辑步骤”,无需持续的人工监督。这转化为自主完成更复杂的任务,从多步骤研究项目到复杂的编码挑战,不会崩溃或需要手动干预。

该模型还引入了”生成式界面”,以类似数字杂志而非纯文本回复的格式提供某些答案。这使信息更易于消化且视觉上更吸引人。

对行业

Google的快速迭代——在2.5发布仅七个月后就推出Gemini 3——标志着一场愈演愈烈的AI军备竞赛。50分的Elo跃升意义重大;作为参照,Gemini 2.5与大多数竞争对手之间的差距通常为20-30分。

OpenAI和Anthropic可能会加速他们的发布计划作为回应。竞争正在从”谁能构建一个好的聊天机器人”转向”谁能构建最有能力的自主代理”。

对开发者

真正的游戏规则改变者可能是Google Antigravity,一个与Gemini 3一起发布的新代理开发平台。与传统IDE不同,Antigravity让AI代理”直接访问编辑器、终端和浏览器”,允许它们自主规划、执行和验证复杂的软件任务。

早期评论将其与Cursor AI相提并论,一些开发者称其为”Cursor杀手”。它现在以公开预览版形式在macOS、Windows和Linux上免费提供。

背景故事

自ChatGPT在2022年末的病毒式发布让Google措手不及以来,尽管其在transformer(GPT中的”T”)方面进行了开创性研究,该公司一直承受着压力。在Bard发布坎坷并随后更名为Gemini之后,Google一直在追赶。

2025年4月发布的Gemini 2.5缩小了大部分差距。但OpenAI的GPT-5.1和Anthropic的Claude 4.5 Sonnet最近几个月都推出了强大的模型,让竞争保持胶着。

Gemini 3似乎是Google的宣言:它不只是在追赶,而是在领跑。

专家反应

Sundar Pichai(Google首席执行官):

“Gemini 3是迄今为止最有能力的模型,将广泛的世界知识与深度推理相结合,“Pichai表示。

Constellation Research的行业分析师指出:

“Gemini 3的推理能力与Antigravity平台的结合标志着Google向’代理优先’开发的转变,AI系统不只是辅助,它们执行。”

接下来是什么

Google宣布Gemini 3 Deep Think模式,具有”更好的推理和多模态理解”,将在未来几周内面向AI Ultra订阅者推出。定价尚未披露。

该模型已通过Gemini Enterprise和Vertex AI向企业客户提供。通过Gemini应用的免费层访问本周正在全球推出。

时间线:

  • 现在:Gemini 3在Gemini应用、AI Studio、Vertex AI、Antigravity中可用
  • 未来几周:面向Ultra订阅者的Gemini 3 Deep Think模式
  • 未知:面向开发者的API定价(目前处于预览阶段)

分析

1501的Elo评分令人印象深刻,但数字只有转化为现实世界的效用才有意义。早期实机报告表明Gemini 3做到了,尤其是在编码任务中,强大的推理与工具使用(通过Antigravity)的结合创造了真正差异化的体验。

值得注意的是速度。从Gemini 2.5到Gemini 3只用了七个月,这很激进,如果Google能保持这种节奏,而OpenAI和Anthropic也在推进他们自己的前沿,行业正在迎来一个2026年:前沿模型的进步速度超过大多数企业甚至能部署它们的速度。

未知数是Antigravity。如果它获得开发者的采用,它可能会围绕Gemini创建一条护城河,类似于GitHub Copilot对OpenAI模型的助益——不只是通过能力,而是通过工作流集成。

底线

Google Gemini 3不仅仅是一次增量更新;这是一次宣言式的发布,让Google重回AI竞赛的最前沿。凭借创纪录的基准分数、能够处理复杂多步骤任务的增强推理,以及一个可能重塑开发者与AI协作方式的新编码平台,Gemini 3将话题从”AI能否与人类竞争”转向”如何围绕自主AI系统设计工作流”。

如果你是开发者,Antigravity值得立即测试。如果你是评估AI平台的企业,Gemini 3的推理能力和多模态性能值得重新审视。而如果你只是在观看AI战争的展开,系好安全带,2026年将会很疯狂。

资料来源 (4)

Advertisement

🦋 Bluesky 讨论

在 Bluesky 上讨论

正在搜索帖子...