Qwen3.8-27B 有点离谱:浏览器 Agent 追到 GPT-5.6 Luna,写复杂代码却翻车了
Qwen3.8-27B 的多组社区实测出现鲜明反差:一个 Browser Agent 测试称它接近 GPT-5.6 Luna,但消耗约 4.5 倍输出与推理 tokens;复杂 Coding Agent 测试又只有 3/17 个严格 checkpoint。它值得本地 Agent 用户认真试,但没有证据证明其综合能力追平闭源旗舰。
先说结论
Qwen3.8-27B 这次最有意思的,不是它“打败了谁”,而是它在不同工作里像换了三个性格。
最近几天的社区实测把它塞进浏览器 Agent、本地代码测试和 16GB 显卡量化环境。一个 BU Bench v1 测试者称它接近 GPT-5.6 Luna xhigh;另一边,复杂 Coding Agent 测试只有 3/17 个严格 checkpoint。基础数学和代码题又能拿到 GSM8K 96.7%、HumanEval 95.5%。
这不是一张统一排行榜,而是一个很人类的反差:它会把新功能写出来,却可能在第二轮需求里把旧功能弄坏。27B 小模型已经能在某些 Agent 工作里追到闭源模型,但“跑分强”仍然不等于“可以独立接管代码库”。
先看它到底有多小,又有多不小
Qwen 官方把它定位成 27B dense、多模态模型,原生上下文 262K,可扩展到 1M,并支持 thinking 开关、推理强度和 Agent 执行。完整权重约 55.6GB,这当然不是“塞进笔记本就能跑”的玩具。
但本地玩家会量化。一组社区测试显示,Q4_K_M 约 17.1GB,IQ4_XS 约 14.6GB;后者相对 Q8 reference 的 perplexity 质量代理约为 99.2%。这不是 Agent 能力保留 99.2%,却说明 27B 已经摸到单张 16GB 消费 GPU 的边缘。
第一幕:浏览器 Agent 竟然摸到 GPT-5.6 Luna
8 月 19 日,一位测试者用 BU Bench v1 和开源 Browser Agent harness 测 Qwen3.8-27B,称它击败了自己测试过的其他便宜或开放模型,整体接近 GPT-5.6 Luna xhigh。
这句话很炸:一个开放权重、27B、能本地部署的模型,居然在真实浏览器任务里把差距缩到了这个量级。
但很快就有账单反转。该测试补充的估算是,Luna 约消耗 150 万 output + reasoning tokens,Qwen xhigh 约 680 万,超过四倍,耗时也明显更长。所以正确结论不是“Qwen 等于 Luna”,而是:Qwen 可以用更多推理计算,把部分浏览器任务的完成表现推近闭源模型。
对于拥有闲置 GPU 的人,多用 token 不一定像 API 账单那样刺眼;但在共享服务器、低延迟产品和大规模并发里,这个差距会重新变成钱。
第二幕:基础题很漂亮,复杂代码却露馅
另一组 2×RTX 3090、Q8_0、2483 个机械评分样本的测试,给出了 GSM8K 96.7%、MATH-500 86.4%、HumanEval 95.5%、MBPP 80.0%。代码直接跑单元测试,数学用 SymPy 判断等价,没有 LLM Judge。
这至少说明 Qwen 的基础能力不是几张 Demo 拼出来的。
然后测试换成 SlopCodeBench 的 HumanLayer Opus 5 子集,问题从“写一个函数”变成“理解陌生项目、跨文件修改、别把旧功能搞烂”。Qwen 只通过 3/17 个 strict checkpoints,17.6%;同组 Claude Opus 5 + Claude Code 是 4/17,另一种 DeepSeek V4 Flash 配置是 5/17。
测试者的判断很克制:Qwen 适合有明确指导的 Copilot,不太适合自己长期管理复杂代码库。评论里有人把它说得更直白:新东西写得不错,但不断破坏旧东西。
为什么 HumanEval 95%,项目维护却只有 17.6%
因为这两个测试问的不是同一件事。
HumanEval 更像考试题:“你会不会把这个函数写出来?”复杂 Agent 测试问的是:“给你一个陌生公司项目,需求中途变化,你能不能规划、调用工具、保持结构、跑测试、知道什么时候别再改?”
前者需要代码生成,后者还需要长期记忆、边界意识、回归控制和停手能力。一个人 LeetCode 很强,不代表他接手 500 万行代码项目就不会制造技术债。AI 也一样。
这对本地部署的人意味着什么
如果你的任务是浏览器填表、固定 SOP、内部 PDF、知识库问答和有明确验收标准的工具调用,Qwen3.8-27B 值得认真 A/B 测试。数据留在内网、没有稳定海外 API、或手里有 16GB 以上显卡的团队,尤其应该关注它。
如果任务是大型代码库长期维护、开放式架构设计或几十步连续判断,就不要因为一项浏览器成绩把权限全交出去。最稳妥的做法是让它先改小范围、自动跑测试、保留 diff,并把付款、删除和生产部署放在人工审批后面。
我们的判断:小模型正在学会挑工作
Qwen3.8-27B 代表的不是“我已经成为全球最强模型”,而是另一条路线:把够用的 Agent 能力压缩进一个越来越容易本地运行的模型。
这会改变模型选择的问法。以后不是先问哪个模型总榜第一,而是问:我的工作需要什么能力?浏览器导航和固定流程可能已经够用;长期维护和架构判断,仍然需要更大的模型、更强的工具和人类监督。
所以这轮实测最值得记住的不是“阿里超过 OpenAI”,而是:前沿闭源模型和本地小模型的差距,已经不再对所有任务一样大。 有些任务它追得很近,有些任务它马上露出短板。
如果一张 16GB 显卡已经能把你的工作做完,旗舰模型再强 30% 也许和你没那么大关系。反过来,如果你的工作不能容忍一次回归错误,漂亮的 95.5% 也不能替你签字。
仍需观察
- Browser Agent 测试能否在更多任务、更多 harness 和更少推理 token 下复现;
- 3/17 的复杂 Coding 结果是否会随工具、提示和模型版本改善;
- 量化后真实视觉、长上下文和工具调用能力,而不只是 perplexity;
- 本地部署的速度、显存占用、驱动兼容和企业维护成本。