AI Radar先替你读,再把 AI 变化讲明白
EN
Claude 性能溢价

Claude 最强模型只拿到 6% Token:企业愿为最后一点性能多付多少?

最后更新 2026-08-23编辑综合:多条来源拼接后再下判断不是快讯搬运;事实、判断和未知分开写
Ramp 企业支出数据显示 Fable 5 只占 Anthropic Token 的 6%,而半价 Opus 5 成为 Claude Max 默认模型的原创信息图
编辑绘图:6% 和 11.4% 来自 Ramp Token Spend Management 样本,不是 Anthropic 全部客户;Opus 5 的半价接近定位来自 Anthropic。
一句话结论

Ramp 的企业 Token 管理样本显示,Fable 5 在第一个相对完整月份只占 Anthropic Token 的 6%、模型支出的 11.4%,同期 GPT-5.6 Sol 占 OpenAI Token 的 25%。这不能代表整个市场,但 Anthropic 随后推出价格减半、能力接近 Fable 的 Opus 5,并设为 Max 默认模型,说明企业采购正从默认追逐最强,转向比较每个成功任务的总成本。

结论

Ramp 8 月企业 AI 支出数据给出了一个少见的反差:Anthropic 整体企业采用率已经超过 OpenAI,但它当时最强、最贵的公开模型 Fable 5,在第一个相对完整的销售月份里只占 Anthropic 企业 Token 购买量的 6%,占模型支出的 11.4%

这不能证明 Fable 5 “卖不动”,更不能证明企业不需要 Claude。Ramp 的模型级数据来自一批偏技术公司的 Token Spend Management 客户,7 月也只是 Fable 5 恢复全球访问后的第一个完整月份。

但它已经提出了一个很现实的问题:当一个模型输入 $10/M、输出 $50/M,而便宜一半的模型已经足够接近时,企业还愿意为最后一点性能多付多少钱?

我的判断是,AI 采购正在从“默认买最强”转向“按任务买够用”。旗舰模型不会消失,但它可能越来越像专家会诊:只在失败代价很高、普通模型做不稳的任务上出场。

企业在买 Claude,却没有追着买最贵的 Claude

先把背景说清楚。Ramp 的企业采用率数据显示,7 月有 43.5% 的美国样本企业向 Anthropic 购买订阅或 Token,高于 OpenAI 的 39.7%

所以故事不是企业抛弃 Claude。恰好相反,Anthropic 的企业渗透仍在上升。

反常之处发生在 Anthropic 内部。Ramp 统计称,过去一个月 Fable 5 只占 Anthropic Token 购买量的 6%,却因为单价很高,占到模型支出的 11.4%。

作为对照,GPT-5.6 Sol 占 OpenAI Token 的 25%、支出的 23%。Ramp 估算,7 月 Fable 5 带来的模型归因支出约为 Sol 的 75%。

《金融时报》8 月 23 日也把这个反差推到了主流科技报道中,标题直接指出:Anthropic 最好的模型在便宜工具增长时难以吸引用户。

Fable 5 并不是能力不够

Anthropic 6 月 9 日发布 Fable 5 时,称它的能力超过该公司此前向普通市场开放的任何模型,在软件工程、知识工作、科研和长时间自主任务上尤其强。

它也确实不是按普通模型定价:

  • 输入:$10 / 百万 Token
  • 输出:$50 / 百万 Token

Agent 任务会反复读取上下文、调用工具、生成计划、执行、报错和重试。模型单价翻倍,最终账单往往不只是多几毛钱,而可能决定一条工作流是否值得长期运行。

所以 6% 最可能说明的不是“模型没用”,而是企业在筛选哪些任务配得上它。

Anthropic 一个月后自己推出了半价答案

7 月 24 日,Anthropic 发布 Opus 5。官方第一段就把定位写得很直接:它接近 Fable 5 的 frontier intelligence,价格只有一半。

Anthropic 还把 Opus 5 设置为 Claude Max 默认模型,并称它在 Frontier-Bench、GDPval-AA 等 Coding 与知识工作评测上达到新的最好结果;在 CursorBench 的最高努力档,它距离 Fable 5 的峰值只有 0.5%,每项任务成本约为一半。

这不等于 Anthropic 承认 Fable 5 定价失败。Fable 在部分极限任务和特定安全、科研场景里仍可能有独特价值。

但产品动作很清楚:日常大量使用需要一个更便宜、足够接近的默认模型。最强模型和默认模型开始变成两个位置。

“性能溢价”第一次有了比较清楚的边界

过去模型差距很大。较弱模型可能根本读不完长文档、不会稳定调用工具,也无法完成复杂代码任务。那时企业没有多少选择,只能购买旗舰能力。

现在更像 95 分和 92 分的比较。前者也许更可靠,但如果价格高一倍,采购团队就会追问:多出来的成功率,能不能覆盖多出来的成本?

客服分类、文档初筛、商品信息整理和普通代码修改,往往不需要每一步都调用最贵模型。真正合理的指标也不再只是每百万 Token 多少钱,而是:

完成一件可以验收的工作,总共花了多少钱?

一个便宜模型如果连续失败三次,未必真便宜;一个贵模型如果只把成功率从 96% 提到 97%,也未必值得全量部署。

以后更合理的 Agent 会把模型分层

这组数据最可能推动的,不是所有企业改用便宜模型,而是任务路由变得更细。

  • 分类、抽取、格式转换:先交给便宜模型;
  • 普通写作、代码修改、资料整理:交给日常主力模型;
  • 复杂调试、关键合同、高价值研究:再升级到 Fable 这类旗舰模型;
  • 最终输出:用规则、人工或另一个模型复核。

Cursor、模型网关和企业内部 Router 都在争夺这层价值。真正有用的 Router 不是永远选最聪明的模型,而是知道什么时候多花钱能显著减少返工。

这组数据不能证明什么

Ramp 对模型份额的统计来自 Token Spend Management 产品,而不是全部 Ramp 客户或整个 AI 市场。Ramp 自己说明,这批公司比普通样本更偏技术型。

Fable 5 的销售时间线也不正常:6 月 9 日发布,6 月 12 日因美国政府出口管制暂停访问,7 月 1 日才恢复全球使用。7 月只是它第一个相对完整的月份,云平台恢复速度和订阅额度政策也会影响采用。

因此本文不会把 6% 写成市场已经判决 Fable 失败。更准确的说法是:

第一份企业实付数据没有显示“最强模型会自动吸走预算”,而 Anthropic 随后的产品动作也把性价比放到了更显眼的位置。

对开发者和企业,现在该怎么选

不要先问“哪个模型世界第一”,先选 10 到 20 个真实任务做对照。

记录四件事:

  • 最终是否完成;
  • 人工修了多久;
  • 模型和工具一共跑了多少次;
  • 每个可验收结果的总成本。

如果 Fable 能把一次高价值任务从失败变成完成,它的溢价可能很便宜。如果普通模型已经稳定完成,继续全量调用 Fable 只是把 Benchmark 优势变成账单。

对企业来说,旗舰模型最适合设为升级通道,而不是默认通道。对个人用户也是一样:难题再切最强模型,日常任务先用够用的。

我们的判断

Fable 5 没有证明“最强 AI 卖不动”。它更像第一次清楚地提醒整个行业:能力越靠近前沿,最后几分性能越贵,而客户不会无限付费。

未来最重要的模型可能不是综合榜第一名,而是能在你的任务里,把“每个成功结果的成本”压到最低的那一个。

这会让 Opus、Sol、Kimi、Qwen、DeepSeek 和各种 Router 的竞争越来越像采购问题,而不只是跑分比赛。

仍然要观察

  • Fable 5 在第二、第三个完整月份的 Token 和支出份额是否回升;
  • 大型云平台恢复供应后,企业采用是否发生变化;
  • Opus 5 是否持续成为 Anthropic 的默认工作模型;
  • 企业 Router 能否公开展示按任务划分的成功率、返工率和总成本。

常见问题

6% Token 是否代表 Fable 5 只占 Anthropic 6% 收入?

不是。Ramp 数据显示它占样本中 Anthropic Token 的 6%,但占模型支出的 11.4%。这也不是 Anthropic 的完整财务收入。

企业是不是已经不想买最强模型了?

不能这样概括。更可能是企业把最强模型留给少数高价值任务,而把大量日常工作交给便宜模型。

为什么不能直接比较 Token 单价?

因为模型可能生成不同数量的 Token、调用不同次数,也可能有不同的完成率和返工成本。最终更有用的是每个成功任务的总成本。

来源与证据边界

本文把 Ramp 样本中的模型采购份额与整个企业 AI 市场分开。FT 正文受订阅限制,本文只把其公开标题与报道时间作为媒体关注信号,数字和方法口径均以 Ramp 原文为准。