链接已复制!

人工智能越便宜,你的账单就越贵

在过去大约两年里,每个token的AI价格下降了280多倍,但AI账单却持续攀升。智能体工作负载成倍增加了消耗,GitHub将Copilot转为按量计费,Anthropic在最后一刻暂停了其重定价。以下是这一悖论背后的数学原理。

🌐
机器翻译

本文由英文原文自动翻译而成。 阅读英文原文

一位安详的会计师在办公桌前欣赏着一枚便士,而由无数便士组成的巨大海啸正向她席卷而来,即将落下

要点

  • 通货紧缩是真实的:在 2022 年 11 月至 2024 年 10 月期间,查询 GPT-3.5 级别性能的人工智能 (AI) 模型从每百万代币 20.00 美元下降到 0.07 美元,暴跌超过 280 倍。
  • 无论如何,账单还是上涨了:FinOps 基金会调查的组织中有 98% 现在正在积极管理人工智能支出,而两年前这一比例为 31%。
  • 2026 年 6 月是固定费用终止的月份:GitHub 在 6 月 1 日将所有 Copilot 计划转移到基于代币的计量计费。Anthropic 宣布了类似的拆分,然后在 6 月 15 日(原定生效当天)暂停。
  • 罪魁祸首是数量,而不是价格:代理工作负载每个任务消耗的令牌比聊天查询多几个数量级。更便宜的单位乘以爆炸性消费就等于更大的发票。这就是杰文斯悖论,在数据中心规模上运行。

20 美元计划不再有意义的月份

三年来,这笔交易很简单:向人工智能供应商提供固定的月费,并像自助餐一样使用该模型。 2026年6月,自助餐结束。

6 月 1 日,GitHub 在每个计划中都用 GitHub AI Credits 取代了 Copilot 的“高级请求”,其使用量“基于令牌使用情况,包括输入、输出和缓存令牌,根据每个模型发布的 API 费率”。两周后,Anthropic 计划推出自己的版本:将 Claude Agent SDK(软件开发工具包)和第三方代理的使用从订阅池中移出,转移到单独的每月信用额度上,范围从专业计划的 20 美元到顶级计划的 200 美元。它从未发生过。 6 月 15 日,即更改生效的当天,Anthropic 暂停了该更改,称“目前没有任何更改”,并且正在“努力使计划更好地与实际使用模式保持一致”。

这轮重新定价浪潮真正奇怪的原因是:它发生在人工智能代币变得有史以来最便宜的时刻。了解为什么这两件事同时成立可以解释你的人工智能账单的实际走向。

大通货紧缩是真实存在的

从供应商的角度开始。它的优点是真实。

斯坦福大学的人工智能指数是人工智能进展中被引用最多的年度报告,它发现,查询在 MMLU(大规模多任务语言理解,一种标准知识基准)上得分相当于 GPT-3.5 的模型的成本“从 2022 年 11 月的每百万代币 20.00 美元下降到 2024 年 10 月的每百万代币 0.07 美元”,在大约 18 个月内减少了 280 多倍。根据任务的不同,同一份报告发现推理价格每年下降 9 到 900 倍。在软件的支持下,机器学习硬件成本每年下降约 30%,而能源效率每年提高约 40%。

如此大规模的价格暴跌应该会使人工智能预算出现舍入误差。相反,相反的情况发生了。

消费爆炸

云金融运营 (FinOps) 行业机构 FinOps 基金会在其《2026 年 FinOps 状况》报告中发现,根据回答该问题的 693 名从业者,目前有 98% 的组织在管理人工智能支出,而 2025 年这一比例为 63%,2024 年为 31%。人工智能成本管理被列为团队需要培养的首要技能。你不会围绕不断缩减的成本建立一整套学科。

改变的不是代币的价格。这是一件作品消耗的代币数量。

2023 年的聊天机器人交换只是一个请求:输入一个问题,输出一个答案,端到端的几千个代币。代理编码会话是完全不同的动物。代理读取您的存储库、计划、调用工具、读取其输出、失败、重试并验证自己的工作。其中每个步骤都是一个新的模型调用,承载着之前所有内容的累积上下文。四秒的自动完成和四十五分钟的自主重构位于跨越大约三个数量级的令牌间隙的两端。

Gartner 给出了该结果的日期。 2026 年 6 月下旬,该研究公司预测,到 2028 年,人工智能编码代理的支出有望超过软件开发人员的平均工资,并报告称,近四分之一的技术领导者已每月为每位开发人员在人工智能编码代币上花费 200 至 500 美元,约 6% 的人称每位开发人员每月的支出超过 2,000 美元。无论这一具体预测是否属实,方向都是没有争议的。该单位变得便宜;工作量变得巨大。

静默重新定价剖析

固定费用订阅是针对聊天机器人时代定价的,而代理时代打破了它的数学原理。随之而来的与其说是一次协调一致的价格上涨,不如说是一系列日益尴尬的调整。

GitHub 走在了前面,并且走得最远。 在新的 Copilot 方案下,计划价格保持不变,但每个计划现在都包含相应的 AI 积分津贴:每月 10 美元的专业版包含 10 美元的积分,每用户 19 美元的商业版包含 19 美元,39 美元的企业版包含 39 美元。一个积分价值 0.01 美元。代码完成和下一步编辑建议仍然不计量,因此临时自动完成用户不会注意到任何事情。相比之下,代理用户现在正在花费以公布的 API(应用程序编程接口)费率运行的令牌计。

人类尝试过,然后眨眼。 该计划将让聊天和官方 Claude Code 命令行界面 (CLI) 保持在标准订阅限制上,同时阻止 Agent SDK、无头 claude -p 命令和第三方应用程序利用这些限制,而是按现行 API 费率计费,并通过每月信用额度进行缓冲。 6 月 15 日的暂停发生之际,《华尔街日报》报道称 OpenAI 正在考虑大幅削减其自己的 API 价格,这将使单方面提高有效价格成为令人不安的举动。一家供应商在发布之日发货而其竞争对手放弃的重新定价表明该行业尚未找到底线。

Advertisement

更微妙的杠杆是标记器。 Anthropic 自己的定价文档指出,Claude Opus 4.7 及更高版本使用标记器,“为同一文本生成大约 30% 的标记”。相同的标价、相同的文本、更多的计费单位。当 Opus 4.7 以不变的标题价格推出 时,该网站准确地标记了这种动态。

并且列表价格本身已经悄然停止在前沿下降。 Anthropic 的价格表显示,到 2026 年 8 月 31 日,Claude Sonnet 5 的介绍性价格为每百万输入代币 2 美元,每百万输出代币 10 美元,之后 3 美元和 15 美元的标准定价生效,计划上涨 50%。新的顶级 Claude Fable 5 售价为 10 美元,售价为 50 美元,是 Claude Opus 4.8 的 5 美元和 25 美元的两倍。甚至连预算也上调了:克劳德俳句 4.5 的售价为 1 美元和 5 美元,高于它所取代的已退役的俳句 3.5 的 0.80 美元和 4 美元。在这张价格表上,每一层都在向上重新定价。通货紧缩仍然存在于竞争中,存在于更便宜的竞争对手和开放重量模型中,而不是存在于现有企业的标价中。

数据

整个悖论都可以用一行算术来表示。任务的成本是代币的价格乘以任务消耗的代币数量:

Ctask=Ptoken×TtaskC_{task} = P_{token} \times T_{task}

2022 年至 2024 年间,在质量稳定的情况下,PtokenP_{token} 下降了约 280 倍。但对于现在占主导地位的工作负载,TtaskT_{task} 增长了数百到数千倍。当第二个因素的增长速度快于第一个因素的收缩速度时,即使每个单独的代币变得更便宜,CtaskC_{task} 也会上涨。

运行新副驾驶计划上的数字,看看一米的消耗速度有多快。对定价如 Claude Opus 4.8 的前沿模型进行一次代理会议,每百万输入代币 5 美元,每百万输出代币 25 美元。按以下费率计算,处理 150 万个输入令牌并生成 100,000 个输出令牌的会话的成本恰好为 10.00 美元:

订单项费率(每 M 代币)成本
输入令牌1,500,000$57.50 美元
输出代币100,00025 美元2.50 美元
会话总数$10.00

这样的两次会议和一个副驾驶商务舱座位已经耗尽了每月 19 美元的全部信用额度。此后的一切均按超额计量。固定费用并没有变得更贵。它只是不再涵盖人们现在实际工作的方式。

假地板

那么这里的恶棍是谁呢?选择你的理论。

一种读物是愤世嫉俗的:固定费用是对土地掠夺的补贴,而六月是回扣,补贴底线开始被打破的那一刻。另一本读起来很无聊:没有人需要计划任何事情。针对按 API 速率消耗数百美元计算的工作负载设置的廉价固定费用是一种自行失败的算术,无需恶意。

证据有利于无聊的阅读,但有一些转折。这不是供应紧张。据彭博社报道,就在 Anthropic 暂停的同一周,路透社报道称 Meta 计划通过云业务出售其多余的人工智能计算能力。产能并不稀缺;前沿规模的消费刚刚超过了为聊天而构建的定价模型。

客户也有地方可去。路透社 7 月 2 日报道称,一种新型、廉价的中国人工智能模型正在赶上 Anthropic 和 OpenAI 的前沿产品。 Tom’s Hardware 记录了各公司将工作负载转移到中国和开放权重模型的情况,专门是为了在订阅触及定价壁垒时扩大人工智能预算。每一张计量发票都是一次 API 调用的更便宜型号的广告。这不仅仅是客户商誉,也是对重新定价能走多远的检查。

1865 年韵

这些都不是什么新鲜事。 1865 年,经济学家威廉·斯坦利·杰文斯 (William Stanley Jevons) 观察到,随着燃煤技术变得更加高效,英国的煤炭消费总量不但没有下降,反而上升,因为效率使燃煤工业在更多地方变得经济。单位更便宜,总燃烧量更多。将煤炭换成代币,人工智能行业正在进行相同的实验,得到相同的结果。

更接近的韵律是纤维。 20 世纪 90 年代末,电信运营商借入巨额资金来建设容量,其增长速度远远快于需求,当互联网泡沫破裂后融资枯竭时,他们的债务负担引发了一波破产浪潮,导致世通和环球电讯等巨头破产。那个时代的教训并不是需求是假的。需求持续增长;它只是比基础设施和为其服务而构建的商业模式增长得慢,而且修正一下子就到来了。 人工智能视频生成的经济性已经碰壁了;文字代理正在以慢动作击中它。

接下来会发生什么

从六月的残骸中可以看到近期的轨迹。

计量价差。 GitHub 已经表明,政治上可行的版本是“计划价格不变,代理使用计量”,Anthropic 的暂停被解读为修订,而不是撤退;该公司表示正在重新调整该计划,而不是放弃该计划。敬请关注 9 月 1 日,届时 Sonnet 5 计划的 50% 标价上涨将生效,并测试中端价格是否能够真正上涨,而不会因开放重量替代品而失去工作量。

预计路由层将成为有趣的战场。公司已经将前沿模型与日常工作成本低大约十倍的替代方案配对。一旦每个令牌都被计量,沿着廉价路径发送大多数请求就不再是一种优化,而是开始成为整个游戏。并期望“代币 FinOps”成为一个职位名称。当 98% 的组织都在管理人工智能支出,而最大的技能差距是人工智能成本管理时,就会有人被雇用来拥有计量表。

这对您意味着什么

如果你使用人工智能工具编写代码:

  • 检查您的哪些工具已于 6 月份转为按计量计费。自动完成层实际上仍然是平坦的;代理层则不然。
  • 将模型与任务相匹配。在廉价模型处理的工作上运行前沿模型现在是一个可见的行项目,并且各层之间的价格差距是一个数量级。

如果您拥有人工智能预算:

  • 预测每个任务的代币,而不是席位。基于席位的预算是 2026 年超支的原因。
  • 将供应商标价视为数学的开始,而不是答案。即使价格表没有改变,标记器的变化和消费增长也会改变实际成本。

常见问题

如果代币价格持续下跌,这不会自行解决吗?

单价可能会持续下跌;斯坦福大学的数据显示,根据任务的不同,每年下降 9 到 900 次。但每项任务的消耗增长速度快于价格下降速度,而且代理仍然变得更加自主。把你的预算押在通货紧缩超过你自己的使用量上已经连续两年都是失败的赌注。

Anthropic 是取消了计费更改还是只是推迟了?

暂停了,没有取消。该公司表示“目前没有任何变化”,并且正在努力根据实际使用模式重新调整计划。导致这一变化的结构性压力并没有消失。

这只是人工智能供应商哄抬物价吗?

证据却指向相反的方向。按公布的 API 费率进行计量计费比悄悄补贴重度用户的固定费用更加透明,而且来自廉价的中国和开放重量模型的竞争限制了任何人可以走多远。真实的情况是,定价单位(一个月的访问量)不再与成本单位(代币)相匹配,这种不匹配最终被打破。

底线

廉价代币时代和巨额人工智能账单时代是从发票两端讲述的同一个故事。通货紧缩使情报变得廉价到足以肆意消费,特工们将支出工业化,隐藏仪表的固定费用订阅在 2026 年 6 月因算术而消亡。现在正在进行的修正虽然令人不安,但却是诚实的:可见的仪表、真实的价格,以及一个任务成本最终告诉你运行所需成本的市场。建立在这一事实基础上的预算会做得很好。建立在自助餐保持开放的预算不会。

资料来源 (13)

Advertisement

🦋 Bluesky 讨论

在 Bluesky 上讨论

正在搜索帖子...