Ox Alpha 身份快被扒光了:免费 1M 多模态模型,几乎就是 GLM-5.3 Flash?
Ox Alpha 的真实身份还没有官方盖章,但现有黑箱证据已高度指向 GLM-5.3 家族:分词器计数在多组文本上恒定相差 75 tokens,错误字符串和温度 0 输出风格也高度相似。它目前在 OpenRouter 页面标为免费、支持文本/图片/视频和 1M 上下文;免费不等于无限量,更不等于零风险生产服务。
先说结论
神秘模型 Ox Alpha 的马甲,已经被社区扒到只剩一层纸。
OpenRouter 页面仍把它写成“匿名第三方提供商”的 stealth model,但黑箱测试者报告:6 组中英文、代码和 emoji 文本,Ox Alpha 的 token 计数与公开 GLM-5.3 每次都恒定相差 75;错误字符串也出现了 GLM-5.3 同款的“不能关闭 thinking”提示;温度设为 0 时,连德语小数和 Markdown 习惯都高度相似。
这足以让“Ox Alpha 属于 GLM-5.3 家族”成为目前最强解释。但它还不是官方实锤:智谱没有公开说 Ox Alpha 就是 GLM-5.3-Flash,OpenRouter 也仍然把提供商写成匿名。更谨慎的判断是:它很可能是 GLM-5.3 的后训练或多模态预览变体,具体是不是 Flash,要等发布方自己揭牌。
先看官方页面:这不是普通的“换皮模型”
OpenRouter 给 Ox Alpha 的定位很大胆:面向编程、持续 Agent 工作和生产工作流的推理模型。页面显示它支持文本、图片和视频输入,最大上下文 1,048,576 tokens,最大输出 131,072 tokens,发布时间标为 2026 年 8 月 20 日。
更离谱的是价格栏:输入和输出都是 Free。Provider 只有一个 Stealth,页面还显示约 26 tokens/s、P50 延迟约 3.90 秒。它已经被 Hermes Agent、Claude Code、DeepSeek Harness 等真实应用调用,活动页显示短时间内产生了巨量请求。
所以大家才会疯:一个 1M 上下文、多模态、能跑长程编码 Agent 的模型,居然暂时免费,而且看起来不像随便拼出来的匿名小模型。
第一根针:tokenizer 每次都差 75,不像巧合
社区测试者没有只问几个问题然后凭感觉下结论,而是做了三组黑箱指纹测试。
第一组是分词器。测试了英文、德文、中文、代码和 emoji 共 6 种输入,Ox Alpha 与公开 GLM-5.3 的 prompt token 数在每组都只差 75。作者推测,这更像固定隐藏 system prompt 的长度,而不是两个模型“碰巧差不多”。换成 Kimi、Qwen、MiMo 和 MiniMax,计数就不再一致。
分词器相同不能证明权重相同。很多模型可以共享 tokenizer,甚至共享基座。它能证明的是:Ox Alpha 很可能没有离开 GLM 这条技术路线。
第二根针:连报错都像同一个人写的
测试者随后故意给 Ox Alpha 传入无效的 reasoning_effort 参数。OpenCode 把参数原样传给模型后,返回的错误提示是:
This model always engages in thinking and cannot be disabled; please use low, high, or max.
这和公开 GLM-5.3 的错误字符串一致。单看一条报错,可能是兼容层复用;但当它和 tokenizer 恒差、接口行为一起出现,指纹就开始有了组合拳的味道。
第三根针:温度 0 的小毛病也撞车
在贪心输出测试里,Ox Alpha 与公开 GLM-5.3 出现相近的 Markdown 习惯、德语小数写法 0{,}375,部分事实回答甚至接近逐词重合。测试者的结论是“很确定它是 GLM 模型”,但仍不确定是 GLM-5.3 的视觉变体,还是更晚的新版本。
这里也要留一条缝:输出相似可能来自同一基座、同一后训练数据、相似系统提示,甚至测试路径的兼容层。它是强证据,不是发布方签字。
为什么“GLM-5.3-Flash”这个猜测会迅速流行
时间线刚好把这条猜测推到了聚光灯下。智谱已经公开上线 GLM-5.3 API,官方文档也把它作为最新旗舰模型;社区随后注意到,Ox Alpha 公开可用、免费、多模态,而公开 GLM-5.3 的产品形态并不能完全解释这些特征。
于是最顺的故事就变成了:智谱把一个 GLM-5.3 家族的多模态或 Flash 版本先交给 OpenRouter 做 stealth 压测,等正式发布前收集真实 Agent 流量。
这个故事很合理,但“合理”不能替代确认。还有另一种可能:Ox Alpha 是以 GLM-5.3 为基座、由其他团队继续后训练的衍生模型;也可能是同家族但更大的内部版本。匿名条款恰恰意味着我们暂时不知道谁负责最后一公里。
免费能不能白嫖?可以试,但别把 Free 看成无限额度
目前 OpenRouter 页面确实显示输入和输出价格均为 Free,用户可以通过模型页申请 API Key,在兼容 OpenAI 的接口里调用 stealth/ox-alpha。它支持文本、图片和视频输入,适合拿来做代码改写、长上下文阅读、浏览器 Agent 和多模态小实验。
但免费有四个现实限制:
- 页面没有承诺永久免费,stealth 预览随时可能改价、下线或换模型;
- 免费 provider 仍可能限速、排队或按账号设置使用上限,不能拿它做关键生产链路;
- OpenRouter 明确提示,提示词和补全会由提供商保留,但不用于训练,具体数据边界要看 Stealth Model Terms;
- 匿名提供商意味着你无法像使用公开模型那样核对版本、权重、数据驻留和安全响应流程。
所以正确姿势是:现在可以大胆试,暂时不要把客户资料、密钥、医疗文件和生产仓库整包喂进去。 免费模型最值得做的是低风险 benchmark、提示词迁移、Agent 小任务和输出质量对比。
我们的判断:身份八九不离十,Flash 仍差最后一张官宣海报
如果只问“是不是 GLM 家族”,答案已经非常接近是;如果问“是不是智谱 GLM-5.3-Flash 多模态模型”,答案仍然是高概率推断,不是已确认事实。
这一区别很重要。因为一旦它真是 Flash,智谱就不只是发布了一个新模型,而是在用匿名预览测试一套完整的 Agent 生态:OpenRouter、OpenCode、Claude Code、浏览器工具和海量真实调用,先替它把最难的长程任务跑一遍。
而如果它是第三方后训练版,故事同样有意思:GLM-5.3 的基座已经足够好,别人可以在上面继续做出一个更适合 Agent 的产品。
不管最后是哪一种,Ox Alpha 都给了我们一个很实用的提醒:模型身份可以隐藏,模型指纹很难完全隐藏;免费试用的窗口很短,但证据和风险不会因为价格是 0 而消失。
仍需观察
- 智谱或 OpenRouter 是否公开确认提供商和模型名称;
- Ox Alpha 是否出现正式模型 ID、版本号、价格变更或下线通知;
- 独立测试能否在视觉、长上下文和 Agent 任务上复现 GLM-5.3 的指纹;
- 免费期的速率限制、数据保留、地区可用性和真实稳定性。