AI Radar先替你读,再把 AI 变化讲明白
EN
Meta 智能体价格战

刚被谷歌领跑两小时,Meta就贴脸开大:1美元跑60次智能体,大模型下半场拼的是“工时费”

最后更新 2026-09-03编辑综合:多条来源拼接后再下判断不是快讯搬运;事实、判断和未知分开写
展示 Meta Muse Spark 1.3 在 DeepSWE 跑分 75.4 分、架构做减法与 1 美元跑 60 次智能体实测的原创图表
AI Radar 原创图表:Meta 突发 Muse Spark 1.3 截胡谷歌,DeepSWE 夺冠并创下 1 美元运行 60 次智能体循环的极低成本记录。
一句话结论

2026 年 9 月 3 日,就在谷歌发布 Gemini 3.8 Flash 仅一天后,Meta 突发上线前沿编程与智能体模型 Muse Spark 1.3。该模型在长程编程基准 DeepSWE v1.1 中拿下 75.4 分,反超 Claude Opus 5 与 GPT-5.6 Sol。与行业盲目堆砌参数不同,该模型通过架构“做减法”,使 Token 消耗降低 25%、工具调用减少 20%,实测 1 美元即可运行 60 次智能体自纠错闭环。扎克伯格正通过极致的地板价算力补贴,为 7×24 小时个人常驻智能体铺路,同时也引发了行业对基准刷榜过拟合与弃权率机制的深度探讨。

# 刚被谷歌领跑两小时,Meta就贴脸开大:1美元跑60次智能体,大模型下半场拼的是“工时费”

结论

2026 年 9 月 3 日,就在谷歌发布 Gemini 3.8 Flash 并宣称拿下轻量级王座不到 24 小时,Meta 突发上线前沿编程与智能体模型 Muse Spark 1.3。这不仅让大模型前沿榜首的更迭周期缩短到了“小时级”,更引爆了一场针对智能体真实落地成本的全面价格战:

  1. 真实长程编程登顶:在衡量多文件、多轮重构的 DeepSWE v1.1 评测中,Muse Spark 1.3 拿下 75.4 分,一举反超 Claude Opus 5(74.0 分)与 GPT-5.6 Sol(73.0 分),把刚发布一天的 Gemini 3.8 Flash 甩在身后;
  2. 反常识的“架构做减法”:不同于行业惯用的暴力堆叠参数与无限消耗 Token,该模型在长程任务中将无效交互轮次降低,Token 消耗减少约 25%,工具调用减少约 20%
  3. 1 美元跑完 60 次智能体循环:实测显示,在严苛的“代码评分低于 9.5 即推倒重写”的 2 小时压力测试中,该模型连续跑了 20 轮自我纠错、调用 60 余次智能体实例,总消耗竟然不到 1 美元。其贡献者层(Contributor Tier)定价更是被开发者群体戏称为“美国 AI 实验室的 DeepSeek 时刻”;
  4. 跑分繁荣背后的冷思考:知名机构 BridgeMind 与多方评测指出,各家大模型正陷入针对基准定向“刷题”的怪圈。Muse Spark 1.3 在知识问答测试中的小幅回落,恰恰揭示了其通过提高“弃权拒答率”换取低幻觉的技术权衡,绝对知识储备并未像刷题榜单那样实现质的跃迁。

大模型的战火已经从单纯的“聊天跑分”,正式转向“7×24 小时个人与企业智能体的真实工时费”。谁能把长时间长程任务的试错成本打到底线,谁才能在接下来的智能体落地期掌握核心定价权。

---

发生了什么

2026 年 9 月刚过去 3 天,全球 AI 行业就迎来了密集的“递归自进化(RSI)”式发版潮:Anthropic 刚推完 Fable 5.1 与 Mythos 5.1,谷歌昨晚刚发完号称“主动加班、小钢炮登顶”的 Gemini 3.8 Flash。

然而,谷歌领跑的时间甚至没能维持超过 24 小时。

9 月 3 日,Meta 首席执行官扎克伯格在社交平台 X 上宣布 Muse Spark 1.3 正式上线,直言这是 Meta“在编程和智能体工作方面迄今实现的最大飞跃”。紧接着,掌舵 Meta 超级智能实验室的前 Scale AI 创始人 Alexandr Wang 更是连发数条长文,公开嘲讽友商:“在 Artificial Analysis 智能指数上,Gemini 啥也不是,只能在后面吃别家模型的汽车尾气。”

核心评测与成本对比

在综合反映长程编码与智能体实战能力的多个主流基准中,Muse Spark 1.3 展现出了极其亮眼的成绩单:

| 评估基准 / 关键维度 | Muse Spark 1.3 | Claude Opus 5 | GPT-5.6 Sol | Gemini 3.8 Flash | | :--- | :--- | :--- | :--- | :--- | | DeepSWE v1.1 (长程代码重构) | 75.4 分 | 74.0 分 | 73.0 分 | 未公开实测顶格分 | | Artificial Analysis 智力指数 | 62 分 | 61 分 | 61 分 | 58 分 | | 单任务平均推演成本 (AA 测算) | $0.55 | $1.23 | $0.95 | $0.62 | | 百万 Token 基础输入/输出标价 | $1.25 / $4.25 | $15.00 / $75.00 | $3.00 / $12.00 | $0.75 / $3.75 |

与 Claude Fable 5 相比,Muse Spark 1.3 在保持同等智力指数的同时,输入成本低了 8 倍,输出成本低了近 12 倍。在 5 个月时间内,Meta 已经连续推出了 4 个 Muse Spark 迭代版本,发版迭代速度甚至压过了传统软件军团。

---

为什么能便宜到“无需计量”:架构做减法

在过去一年的大模型升级中,多数厂商采用的策略是“加大思考预算(Thinking Budget)”或者“放任模型在后台多轮循环”。昨天的 Gemini 3.8 Flash 便是典型代表——标价便宜,但因为模型学会了“主动加班”,实际消耗的 Token 数量翻倍上涨。

Meta 团队在此次训练中选择了一条反向路径:通过强化测试期算力扩展(Test-time Compute Scaling)做减法

华人学者的后训练突破

据北大校友、Meta 核心研究员孙之清(Zhiqing Sun)披露,团队针对此前代号为“牛油果(Avocado)”的基础底座进行了极高密度的长程后训练。其核心机制是在复杂任务中抑制模型的废话与盲目试错:

  1. 修剪无效轮次:针对多工具调用的依赖链条做剪枝,工具调用频次直接降低约 20%;
  2. 代码风格紧凑化:生成的补丁与重构指令更干练,单次回答的 Token 消耗下降约 25%;
  3. 长任务意图针刺保持:在长达数小时的上下文跨度中,模型不会因为中间信息过多而遗忘原始边界,从而避免在错误分支上产生无谓的 Token 浪费。

2 小时 60 次智能体运行的极端压力实测

开发者 @SPAC89 在拿到模型接口后,进行了一项极具说服力的压力测试: - 他在自动化 Agent 流程中设定了一条严苛规则:“由独立评委对生成的代码进行质量打分,只要低于 9.5 分(满分 10 分),智能体必须无条件推倒重来并继续自纠错”; - 整个自闭环流程连续高压运行了整整 2 个小时; - 模型一共完成了 20 轮深度自我改进循环,每轮并行拉起 3 个智能体协同分工——总计完成了 60 多次完整的智能体工作流运转; - 最终结算清单显示,整场长程实测的总消耗不到 1 美元

这种价格冲击力让 Codedamn 创始人 Mehul Mohan 公开发表评价,称这是美国顶级 AI 实验室首次打出的“DeepSeek 定价时刻”。

---

狂欢背后:我们被“跑分刷榜”骗了吗?

尽管基准数字和宣传文案极尽华丽,但理性审视这一轮发布,行业内部的质疑声浪同样尖锐。

1. 刷榜过拟合与真实体验脱节

知名 AI 独立评测机构 BridgeMind 在同一天公开发声质疑: > “Gemini 3.8 Flash 和 Muse Spark 1.3 同一天发布,两者的基准测试看起来都无比光鲜。但我无法感到兴奋——因为这个月的 AI 发版如出一辙:分数每周都在狂飙,但真实世界的开发体验却毫无长进。实验室已经深陷玩弄基准的怪圈。”

第三方开发者对 Muse Spark 1.3 与 Gemini 3.8 Flash 在特定 3D 逻辑约束任务下进行了压力盲测,发现两个模型在未被基准测试覆盖的边角逻辑中均出现显著退化。这种“专门针对 DeepSWE、Tau3-Bench、GPQA 刷题”的训练倾向,正在让单一榜单的参考价值加速稀释。

2. 弃权率上升带来的知识面幻觉

在 Artificial Analysis 的深度细分项评测中,Muse Spark 1.3 在全知测试(AA-Omniscience)上相比前代甚至出现了微弱的分数下滑。分析显示,这是因为团队为了压低幻觉率,调高了模型的“弃权(Abstention)”阈值: - 当模型对事实不完全确定时,它更倾向于直接回答“不知道”或拒绝推演,而不是继续生成推测; - 这在工程代码审查中是一项极好的安全特性,但也客观说明,底座模型的绝对通用知识储备并没有像长程编程跑分表现得那么跨越。

---

我们的判断

结合本周 Gemini 3.8 Flash、ChatGPT Mil 与 Muse Spark 1.3 的密集交锋,我们给出四项行业级判断:

  1. 基座模型的“纯参数红利”彻底见顶:单纯靠堆叠几千亿参数、消耗海量无监督语料的大力出奇迹模式,边际收益已经微乎其微。未来真正的技术分水岭,在于谁能在测试期通过架构做减法,把多轮推演的 Token 浪费压缩到极致;
  2. 大模型的考核核心变成了“工时费”:大模型竞争正式告别了以问答(Chat)为主的上半场,全面进入以自主智能体(Agent)为主的下半场。评判一个模型的标准不再是它单次回答说了什么,而是它跑完一个 2 小时的复杂工程重构,到底要收你 1 美元还是 20 美元;
  3. 小扎的价格战打法本质是在“补贴基础设施”:Meta 之所以把贡献者层定价压到地板价,战略意图非常清晰——扎克伯格的目标是构建能够 7×24 小时常驻运行的个人与企业自主智能体。只有将日均运行成本压到几元人民币以内,常驻智能体才具备商业落地的可行性;
  4. 对开发者的实操建议:不要把单一维度的最高分当成灵丹妙药。如果你的业务场景涉及长程代码库自审、大量单元测试循环重构,Muse Spark 1.3 是目前最具性价比的实验底座;但若涉及广泛的多学科通识事实问答,仍需搭配知识面更宽的旗舰模型互为补充。

---

仍然要观察

在接下来的第四季度,以下三个维度的表现将决定 Meta 这场突袭的最终战果:

  1. 大规模并发下的 API 吞吐与可用性:极低定价是否会引来全球开发者的疯狂薅羊毛,进而导致 Meta 的云端推演实例遭遇严峻的排队等待和限流?
  2. 商业贡献者条款的数据隐私接纳度:企业客户是否愿意为了极致的低价,接受将调用数据反馈给 Meta 用于后续模型优化的条款?
  3. 谷歌与 OpenAI 的下一轮降价与架构反击:面临 Meta 的贴脸降价挑战,OpenAI 与谷歌是否会在未来数周内跟进推出各自的“减法版”低价推理模型?

---

信息来源清单与证据类型: - 一手官方发布:Meta AI Blog《Introducing Muse Spark 1.3》(2026.09.03) - 一手高管言论:Mark Zuckerberg 与 Alexandr Wang 官方社交账号公开技术声明(2026.09.03) - 一手研究者反馈:Meta 核心研究员孙之清(Zhiqing Sun)关于 Avocado 模型后训练与 Scaling 的公开解析(2026.09.03) - 独立基准评测:Artificial Analysis 针对 Muse Spark 1.3 智力指数(62 分)、单任务成本($0.55)与 Omniscience 弃权率分析报告(2026.09.03) - 社区高压实测:开发者 @SPAC89 关于 2 小时 20 轮 60 次智能体自改进长程测试与账单记录(2026.09.03) - 反方行业批评:AI 独立观察机构 BridgeMind 关于基准测试刷榜与真实体验脱节的公开评论(2026.09.03)