链接已复制!

Fable 5 仅存活了3天。一封下午5:21的信件将其关停

美国政府利用一项出口管制指令,强迫 Anthropic 在6月12日(即发布三天后)关停 Fable 5 和 Mythos 5。Anthropic 声称的所谓“越狱”行为是:要求该模型修复软件漏洞。而就在两天前,Anthropic 还曾公开呼吁政府赋予其正是这种权力。

🌐
机器翻译

本文由英文原文自动翻译而成。 阅读英文原文

一只穿着深色西装的手正拉下一个巨大的红色工业断路器开关,玻璃后面巨大的数据中心大厅一排排地暗下去,象征着政府下令关停一个人工智能模型

要点

  • 华盛顿召回了一个实时人工智能模型:2026 年 6 月 12 日,美国政府发布了一项出口管制指令,迫使 Anthropic 在发布三天后为每位客户禁用 Claude Fable 5 和 Claude Mythos 5。
  • 触发器存在争议:Anthropic 表示,政府的证据是一次“狭隘的、非通用的”越狱,相当于要求模型读取代码库并修复错误,它表示其他公共模型已经具备这种能力。
  • 时机很残酷:在该指令发布前两天,Anthropic 发布了一份政策框架,认为政府应该拥有阻止危险人工智能部署的法律权力。它得到了它所要求的权力,但减去了它所要求的正当程序。
  • 真正的风险在于架构:《神鬼寓言 5》和《神话 5》是相同的底层模型,由安全包装器分隔。针对《神鬼寓言》的可信越狱主张是任何人都可以达到 Anthropic 所说的世界上最强大的网络安全模型。

下午 5:21 的一封信

6 月 12 日东部时间 (ET) 下午 5:21,一封信到达 Anthropic。到了晚上结束时,Anthropic 称其能力“超过其以往推出的任何模型”的人工智能 (AI) 模型消失了,对地球上的每个客户都关闭了。

这封信是美国政府根据国家安全部门发布的出口管制指令。它下令暂停“任何外国人,无论是在美国境内还是境外,包括 Anthropic 的外国员工”对《克劳德寓言 5》和《克劳德神话 5》的所有访问。该公司表示,该命令的最终影响迫使其“突然禁用所有客户的《神鬼寓言 5》和《神话 5》”。不难看出原因:没有公共人工智能服务在提示窗口检查护照。对所有其他 Anthropic 模型的访问仍然有效。

《神鬼寓言 5》于 6 月 9 日上线,仅存活了三天。

各国政府禁止境内应用程序、制裁芯片制造商并限制半导体出口。但一位 Anthropic 人士称,一项让一家公司关闭其全球旗舰产品的命令是针对“数亿人”的,这是一种真正的国家权力新工具。而接收端的公司正是在过去四个月里与特朗普政府发生公开冲突、在过去两天争论政府应该拥有这种权力的同一家公司。

该指令的实际作用

从机制开始,它比头条新闻所暗示的更奇怪。这不是法院命令或消费者保护法下的召回。 Anthropic 本身提议的封锁机构,用该公司的话说,将“超出现行法律或国会现有提案的范围”,这意味着没有专门针对人工智能的召回法规可供使用。相反,政府寻求的是出口管制指令,这是通常用于阻止芯片、武器设计和加密技术落入外国对手手中的一系列法律工具。

范围界定使其实际上完全关闭。通过禁止任何外国人进入任何地方,包括在美国境内和 Anthropic 内部,该指令使得过滤合规实际上变得不可能。 Anthropic 表示,这封信“没有提供其国家安全担忧的具体细节”。该公司表示,它只收到了政府认为其发现的问题的“口头证据”。

这对于接下来发生的事情很重要。正式的规则制定可以逐行进行诉讼。一项口头证明合理但未发表任何内容的指令,会让其目标对其无法完全理解的主张提出异议。你不必在这场斗争中站在人类一边,就会注意到这个过程与透明相反。

据称证明其合理性的越狱

据 Anthropic 称,政府认为它已经意识到一种绕过或“越狱”《神鬼寓言 5》安全系统的方法。越狱意味着制作提示,让模型去做其防护措施应该拒绝的事情。

人类对这一技巧的描述是故事走向荒谬的地方。该公司表示,所谓的越狱“本质上包括要求模型读取特定的代码库并修复任何软件缺陷”。这不是一种奇异的攻击。它是对日常防御安全工作的描述,全球每个公司安全团队每天都会执行这种工作。 Anthropic 表示,它审查了它认为是该指令基础的演示和报告,发现该技术暴露了“少量先前已知的小漏洞”,其他公共模型(包括 OpenAI 的 GPT-5.5)也可以在没有任何绕过的情况下找到这些漏洞。目前尚未公开针对任何竞争对手车型的类似订单。

有两个警告值得同等重视。首先,这完全是人择的表征。该指令不公开,报告也不公开,政府可能会根据 Anthropic 没有看到或不会描述的证据采取行动。其次,针对《神鬼寓言 5》的公开越狱指控在该指令出台之前确实存在。发布几天后,著名的人工智能红队成员解放者普林尼 (Pliny the Liberator) 公开表示,他的团队绕过了《神鬼寓言 5》的安全分类器,并发布了他所说的屏幕截图,显示该模型生成了应该拒绝的材料,包括有效的软件漏洞代码。 TechTimes 于 6 月 12 日报道了这些说法,但没有将其与政府行动联系起来,也没有公开证据将它们与该指令联系起来。

人择的对立面是过程,而不是否认。该公司表示,在发布前几周,它与美国政府、英国人工智能安全研究所 (UK AISI) 和私人第三方对《神鬼寓言》的安全措施进行了“总计数千小时”的红队测试,并且“尚未有测试人员能够找到通用的越狱方法”。值得注意的是,它还承认,对于任何提供商来说,完美的越狱抵抗可能都不存在,这就是为什么它将保护措施与监控和旨在检测和研究攻击的 30 天数据保留要求结合起来。

一个型号,两个名字

要了解为什么针对《神鬼寓言 5》的越狱声明会触发国家安全机制,您需要了解架构。 《神鬼寓言 5》和《神话 5》并不是兄弟姐妹。他们是相同的底层模型,穿着不同的衣服。

《神鬼寓言5》是公开版。它配备了安全分类器,可以检测与网络安全、生物和化学或模型蒸馏相关的请求,并将这些响应传递给下一个模型 Claude Opus 4.8,并在发生情况时通知用户。 Anthropic 表示,这些安全措施经过保守调整,平均“在不到 5% 的会话中”触发。在此上限上运行算术,规模就变得生动起来:对于每百万个会话,多达 50,000 个会话可能会发生重新路由。 Anthropic 在发布时就标记了这种权衡,其暂停声明承认保护措施足够强大,以至于“许多用户抱怨它们过于广泛”。

Mythos 5 是同一模型,“在某些领域取消了安全保护”,仅通过与美国政府合作运行的受控访问计划 Glasswing 项目向一小部分网络防御者和基础设施提供商发布。 Anthropic 称其为“世界上任何模型中网络安全能力最强的模型”。

这个设计就是整个游戏。寓言和神话之间的差距不是能力。它是一个分类器。因此,当有人声称已经越狱了《神鬼寓言 5》时,他们真正声称的是公众无需经过 Glasswing 项目的审查即可获得神话级的攻击性网络能力。如果属实,整个两层安全架构就会崩溃。 Anthropic 的辩护是,所披露的越狱事件“要么是完全良性的反应,要么是不提供神话特定提升的次要发现”。显然,政府并没有放心。

人类两天前请求了这种力量

这是政策课程中将教授的部分。 6 月 10 日,即该指令发布的前两天,Anthropic 发布了一份政策框架,主张美国政府应对前沿人工智能拥有新的法律权力。该提议很明确:当一个模型带来灾难性风险时,“政府应该拥有阻止或阻止其部署的法律权力”,并辅之以与全球年收入挂钩的民事处罚。该框架将适用于经过超过 1025 次浮点运算(FLOP,训练中使用的算术步骤的原始计数)训练的模型,并且由 AI 相关收入超过 5 亿美元或在 AI 研发上花费超过 10 亿美元的公司构建。绘制这些阈值是为了准确捕获《神鬼寓言 5》所属的模型类别。

同一篇文章警告了故障模式。 Anthropic 写道,政策制定者“还必须避免过于广泛或严厉的监管权力”,并提出了具体的保障措施,以防止封锁权力被滥用。

两天后,政府阻止了 Anthropic 的部署。不是通过该公司提议的法定程序、独立评估员、公布的测试和程序保护,而是通过带有口头提供证据的出口管制信函。 Anthropic 的声明中带着明显的不适:该公司重申,政府应该能够阻止不安全的部署,“作为透明、公平、明确且以技术事实为基础的法定程序的一部分”,然后猛烈抨击:“这一行动不符合这些原则。”

准确地说,这不是:没有公开证据表明该指令是对 Anthropic 文章的回应,并且将其解读为故意惩罚需要目前无人支持的假设。无聊的解释是,已经与该公司交战的政府收到了有关全新前沿模型的越狱报告,并伸手去拿抽屉里最钝的工具。但这种并置仅基于经过验证的日期。周三,Anthropic 要求通过正当程序进行终止开关。周五,它获悉政府已经有了一个,而且正当程序是可选的。

四个月的公开战争

这一切都不是凭空发生的。该指令是该网站自 2 月份以来追踪的最新一轮冲突,当时该公司拒绝允许 Claude 用于对美国人进行大规模监视或引导自主武器,而国防部的回应是宣布 Anthropic 对国家安全构成供应链风险,同时发布政府范围内的禁令

那场战斗的真实记录是公开的。 3 月初,Nextgov 报道称,在特朗普总统呼吁各机构停止使用 Anthropic 产品运营后,联邦机构已开始放弃 Anthropic 合同,财政部确认将停止使用 Anthropic 技术,国务院和卫生与公众服务部 (HHS) 正逐步将该公司的工具从其工作流程中剔除。随后法院介入。2026 年 3 月 26 日,美国加州北区地方法院发布初步禁令,暂停政府执行总统指令,4 月 3 日,美国总务管理局 (GSA) 宣布“将 Anthropic 技术恢复至 2026 年 2 月 27 日之前生效的状态”。

换句话说,人类正在法庭上赢得合同之争。出口管制指令开辟了禁令未涵盖的第二条战线,其目的不是政府购买克劳德,而是针对 Anthropic 的商业旗舰本身。这是巧合还是策略,这正是政府尚未回答的问题。它什么也没发表。

数据

经过验证的时间线压缩为残酷的一周:

日期 (2026)活动
6 月 9 日《神鬼寓言 5》和《神话 5》推出; Anthropic 表示《神鬼寓言》的功能超过了其已推出的任何型号
6 月 10 日Anthropic 发布其框架,要求政府当局阻止危险的人工智能部署
6 月 12 日(白天)TechTimes 报道了红队成员解放者普林尼的公开越狱声明
美国东部时间 6 月 12 日下午 5:21出口管制指令到来; Anthropic 禁用了这两种模型

刚刚陷入困境的经济学原理同样具体。 《神鬼寓言 5》和《神话 5》的定价为每百万个输入代币 10 美元,每百万个输出代币 50 美元,Anthropic 表示“不到前作《Claude Mythos Preview》价格的一半”。这一句话可以让你限制上周之前前沿网络能力的成本:

PMythosPreview>2×PFable5    PMythosPreview>20 (input)  /  100 (output)P_{\text{MythosPreview}} > 2 \times P_{\text{Fable5}} \;\Rightarrow\; P_{\text{MythosPreview}} > 20 \text{ (input)} \;/\; 100 \text{ (output)}

以每百万代币美元为单位。此次发布将世界上最强大的网络安全模型的价格降低了一半以上,并以打包形式向任何拥有 Claude 帐户的人开放。三天后,包装本身就成为一个国家安全问题。

接下来会发生什么

先例就是现在的故事,它对各个方向都有影响。

对于前沿实验室来说,部署计算刚刚发生了变化。 Anthropic 自己的警告是最尖锐的版本:如果“狭窄的潜在越狱”是召回的理由,那么该标准“将基本上停止所有前沿模型提供商的所有新模型部署”。旧金山的每位实验室顾问今晚都读了这封信,并开始为下午 5:21 写一封自己的信起草应急计划。

对于企业来说,教训更加惨痛。将生产工作负载转移到《神鬼寓言 5》上的公司一夜之间失去了供应商推荐的模型,这并不是供应商正常运行时间的错。预计企业人工智能合同中会有模型暂停条款,更多的多模型架构,以及在市场上存活数年而不是几天的模型的安静溢价。 Anthropic 表示,正在将这种情况视为“误会”,并努力恢复访问,并承诺在声明后 24 小时内提供更多技术细节。在那之前,所有其他 Anthropic 模型仍然可用。

对于政策斗争来说,讽刺将变成争论。法定人工智能监督的倡导者(其中包括人择)现在现场演示了如果没有他们提出的护栏,封锁权力会是什么样子:没有公开的证据,没有独立的评估,没有明确的上诉途径。任何政府角色的反对者都会使用同一事件来证明权力根本不可信。双方在同一三天内争论不休。

底线

抛开品牌名称,这一周看起来是这样的:一家公司推出了一款前沿人工智能模型,要求政府通过透明的法律程序对此类模型进行监管,然后被一家不透明的公司关闭,证据是小圈子之外没有人见过,因为它声称竞争模型已经提供了这种功能。

政府可能知道公众不知道的事情。这确实是可能的,并且机密证据场景是该指令最有力的案例。但是,国家权力根据未公开的证据、口头提供的、没有法律框架支持的商业技术来召回商业技术,这并不是一个安全制度。这是自由裁量权。在证据摆在桌面上之前,对政府花了四个月公开惩罚的公司所行使的自由裁量权完全应该为零。出路是这个故事中几乎每个人都声称想要的:将终止开关纳入法律,并公布证据和独立审查,因此下午 5:21 的下一封信必须展示其作用。

资料来源 (9)

Advertisement

🦋 Bluesky 讨论

在 Bluesky 上讨论

正在搜索帖子...