DeepSeek Harness 刚爆火,就被 14,560 次攻击“上强度”
一篇最新论文对 DeepSeek Harness 做了 14,560 次受控间接 Prompt Injection 测试,某一隐藏 Unicode 文件攻击组合的最高规则判定成功率为 25.5%;实验使用本地夹具,没有真实外部副作用。
先说结论
DeepSeek Harness 刚冲上热榜,研究人员就用 14,560 次受控攻击给它上强度。
8 月 17 日提交、8 月 18 日更新的 arXiv 论文,评估了 DeepSeek Harness 对间接 Prompt Injection 的抵抗力。实验覆盖 16 种间接内容渠道、文本和文件载体、35 个攻击目标与 12 种攻击方法。
论文报告的最高观测值包括:文件模式下隐藏 Unicode 攻击按规则判定达到 25.5%,文本模式下 fake-completion 按语义模型判定达到 17.0%,skills 渠道文件模式达到 16.0%。
但标题不能写成“DeepSeek Harness 有 25% 概率被黑”。这是受控本地夹具实验,敏感工具和数据都没有连接真实外部系统;25.5% 是某一攻击方法、载体和判定器组合下的最高观测值,不是所有任务的平均失守率。
Agent 最怕的不是一句脏话,而是一条藏在文件里的命令
普通聊天机器人遇到网页里的恶意 Prompt,最多可能生成一段奇怪回答。Harness 连接了工具、文件、终端和工作区后,间接 Prompt Injection 就可能变成行动:读到一段内容,误以为是系统指令,接着调用工具或把敏感结果送往错误的地方。
论文测试了文本、文件、工具结果、额外上下文和技能渠道。它不是在问“模型会不会被一句话骗”,而是在问:不可信内容进入 Agent loop 后,能不能穿过工具策略抵达敏感动作。
25.5% 这个数字,真正说明了什么
研究使用规则判定器和语义 LLM 判定器。两者结论不同:语义判定器更常把行为算作部分服从,部分服从率为 7.3%,规则判定器为 2.0%。
这说明安全评估本身也有争议:什么叫“攻击成功”?模型输出了危险计划但没有执行,算不算?执行了工具调用但没有外泄,算不算?不同判定器会给出不同答案。
因此最有价值的结果不是一个吓人的百分比,而是提醒开发者:安全控制不能只放在模型提示词里,还要放在不可信内容与敏感动作之间。
我们的判断:Agent 的软肋是权限链
Harness 越强,能接入的上下文和工具越多,攻击面就越像一条供应链。真正的防线应该包括内容标记、工具调用审批、敏感数据隔离、最小权限、执行日志和可回滚操作。
这篇论文没有证明 DSH 在真实生产环境里一定危险,也没有证明换一个模型就能解决问题。它更像一次压力测试:先告诉大家,Agent 不能只靠“请忽略恶意指令”来保命。
仍然要观察
- 论文代码和后续版本能否复现实验结果。
- DSH 是否将这些控制内置到工具策略和插件系统。
- 不同模型、不同权限配置下,攻击成功率如何变化。