Claude 最强模型只拿到 6% Token:企业愿为最后一点性能多付多少?
Ramp 的企业 Token 管理样本显示,Fable 5 在第一个相对完整月份只占 Anthropic Token 的 6%、模型支出的 11.4%,同期 GPT-5.6 Sol 占 OpenAI Token 的 25%。这不能代表整个市场,但 Anthropic 随后推出价格减半、能力接近 Fable 的 Opus 5,并设为 Max 默认模型,说明企业采购正从默认追逐最强,转向比较每个成功任务的总成本。
结论
Ramp 8 月企业 AI 支出数据给出了一个少见的反差:Anthropic 整体企业采用率已经超过 OpenAI,但它当时最强、最贵的公开模型 Fable 5,在第一个相对完整的销售月份里只占 Anthropic 企业 Token 购买量的 6%,占模型支出的 11.4%。
这不能证明 Fable 5 “卖不动”,更不能证明企业不需要 Claude。Ramp 的模型级数据来自一批偏技术公司的 Token Spend Management 客户,7 月也只是 Fable 5 恢复全球访问后的第一个完整月份。
但它已经提出了一个很现实的问题:当一个模型输入 $10/M、输出 $50/M,而便宜一半的模型已经足够接近时,企业还愿意为最后一点性能多付多少钱?
我的判断是,AI 采购正在从“默认买最强”转向“按任务买够用”。旗舰模型不会消失,但它可能越来越像专家会诊:只在失败代价很高、普通模型做不稳的任务上出场。
企业在买 Claude,却没有追着买最贵的 Claude
先把背景说清楚。Ramp 的企业采用率数据显示,7 月有 43.5% 的美国样本企业向 Anthropic 购买订阅或 Token,高于 OpenAI 的 39.7%。
所以故事不是企业抛弃 Claude。恰好相反,Anthropic 的企业渗透仍在上升。
反常之处发生在 Anthropic 内部。Ramp 统计称,过去一个月 Fable 5 只占 Anthropic Token 购买量的 6%,却因为单价很高,占到模型支出的 11.4%。
作为对照,GPT-5.6 Sol 占 OpenAI Token 的 25%、支出的 23%。Ramp 估算,7 月 Fable 5 带来的模型归因支出约为 Sol 的 75%。
《金融时报》8 月 23 日也把这个反差推到了主流科技报道中,标题直接指出:Anthropic 最好的模型在便宜工具增长时难以吸引用户。
Fable 5 并不是能力不够
Anthropic 6 月 9 日发布 Fable 5 时,称它的能力超过该公司此前向普通市场开放的任何模型,在软件工程、知识工作、科研和长时间自主任务上尤其强。
它也确实不是按普通模型定价:
- 输入:$10 / 百万 Token
- 输出:$50 / 百万 Token
Agent 任务会反复读取上下文、调用工具、生成计划、执行、报错和重试。模型单价翻倍,最终账单往往不只是多几毛钱,而可能决定一条工作流是否值得长期运行。
所以 6% 最可能说明的不是“模型没用”,而是企业在筛选哪些任务配得上它。
Anthropic 一个月后自己推出了半价答案
7 月 24 日,Anthropic 发布 Opus 5。官方第一段就把定位写得很直接:它接近 Fable 5 的 frontier intelligence,价格只有一半。
Anthropic 还把 Opus 5 设置为 Claude Max 默认模型,并称它在 Frontier-Bench、GDPval-AA 等 Coding 与知识工作评测上达到新的最好结果;在 CursorBench 的最高努力档,它距离 Fable 5 的峰值只有 0.5%,每项任务成本约为一半。
这不等于 Anthropic 承认 Fable 5 定价失败。Fable 在部分极限任务和特定安全、科研场景里仍可能有独特价值。
但产品动作很清楚:日常大量使用需要一个更便宜、足够接近的默认模型。最强模型和默认模型开始变成两个位置。
“性能溢价”第一次有了比较清楚的边界
过去模型差距很大。较弱模型可能根本读不完长文档、不会稳定调用工具,也无法完成复杂代码任务。那时企业没有多少选择,只能购买旗舰能力。
现在更像 95 分和 92 分的比较。前者也许更可靠,但如果价格高一倍,采购团队就会追问:多出来的成功率,能不能覆盖多出来的成本?
客服分类、文档初筛、商品信息整理和普通代码修改,往往不需要每一步都调用最贵模型。真正合理的指标也不再只是每百万 Token 多少钱,而是:
完成一件可以验收的工作,总共花了多少钱?
一个便宜模型如果连续失败三次,未必真便宜;一个贵模型如果只把成功率从 96% 提到 97%,也未必值得全量部署。
以后更合理的 Agent 会把模型分层
这组数据最可能推动的,不是所有企业改用便宜模型,而是任务路由变得更细。
- 分类、抽取、格式转换:先交给便宜模型;
- 普通写作、代码修改、资料整理:交给日常主力模型;
- 复杂调试、关键合同、高价值研究:再升级到 Fable 这类旗舰模型;
- 最终输出:用规则、人工或另一个模型复核。
Cursor、模型网关和企业内部 Router 都在争夺这层价值。真正有用的 Router 不是永远选最聪明的模型,而是知道什么时候多花钱能显著减少返工。
这组数据不能证明什么
Ramp 对模型份额的统计来自 Token Spend Management 产品,而不是全部 Ramp 客户或整个 AI 市场。Ramp 自己说明,这批公司比普通样本更偏技术型。
Fable 5 的销售时间线也不正常:6 月 9 日发布,6 月 12 日因美国政府出口管制暂停访问,7 月 1 日才恢复全球使用。7 月只是它第一个相对完整的月份,云平台恢复速度和订阅额度政策也会影响采用。
因此本文不会把 6% 写成市场已经判决 Fable 失败。更准确的说法是:
第一份企业实付数据没有显示“最强模型会自动吸走预算”,而 Anthropic 随后的产品动作也把性价比放到了更显眼的位置。
对开发者和企业,现在该怎么选
不要先问“哪个模型世界第一”,先选 10 到 20 个真实任务做对照。
记录四件事:
- 最终是否完成;
- 人工修了多久;
- 模型和工具一共跑了多少次;
- 每个可验收结果的总成本。
如果 Fable 能把一次高价值任务从失败变成完成,它的溢价可能很便宜。如果普通模型已经稳定完成,继续全量调用 Fable 只是把 Benchmark 优势变成账单。
对企业来说,旗舰模型最适合设为升级通道,而不是默认通道。对个人用户也是一样:难题再切最强模型,日常任务先用够用的。
我们的判断
Fable 5 没有证明“最强 AI 卖不动”。它更像第一次清楚地提醒整个行业:能力越靠近前沿,最后几分性能越贵,而客户不会无限付费。
未来最重要的模型可能不是综合榜第一名,而是能在你的任务里,把“每个成功结果的成本”压到最低的那一个。
这会让 Opus、Sol、Kimi、Qwen、DeepSeek 和各种 Router 的竞争越来越像采购问题,而不只是跑分比赛。
仍然要观察
- Fable 5 在第二、第三个完整月份的 Token 和支出份额是否回升;
- 大型云平台恢复供应后,企业采用是否发生变化;
- Opus 5 是否持续成为 Anthropic 的默认工作模型;
- 企业 Router 能否公开展示按任务划分的成功率、返工率和总成本。
常见问题
6% Token 是否代表 Fable 5 只占 Anthropic 6% 收入?
不是。Ramp 数据显示它占样本中 Anthropic Token 的 6%,但占模型支出的 11.4%。这也不是 Anthropic 的完整财务收入。
企业是不是已经不想买最强模型了?
不能这样概括。更可能是企业把最强模型留给少数高价值任务,而把大量日常工作交给便宜模型。
为什么不能直接比较 Token 单价?
因为模型可能生成不同数量的 Token、调用不同次数,也可能有不同的完成率和返工成本。最终更有用的是每个成功任务的总成本。
来源与证据边界
- 企业支出数据:Ramp August 2026 AI Index
- 可信媒体:Financial Times:Anthropic’s best AI model struggles to attract users
- 一手来源:Anthropic:Claude Fable 5 and Mythos 5
- 一手来源:Anthropic:Introducing Claude Opus 5
- 一手时间线:Anthropic:Redeploying Fable 5
本文把 Ramp 样本中的模型采购份额与整个企业 AI 市场分开。FT 正文受订阅限制,本文只把其公开标题与报道时间作为媒体关注信号,数字和方法口径均以 Ramp 原文为准。