AI Radar先替你读,再把 AI 变化讲明白
EN
Agent 安全压力测试

DeepSeek Harness 刚爆火,就被 14,560 次攻击“上强度”

最后更新 2026-08-20编辑综合:多条来源拼接后再下判断不是快讯搬运;事实、判断和未知分开写
DeepSeek Harness 间接 Prompt Injection 研究的 14560 次受控实验与攻击渠道示意图
编辑绘图:25.5% 是特定攻击、载体和判定器组合下的最高观测值,不是所有任务的平均失守率。
一句话结论

一篇最新论文对 DeepSeek Harness 做了 14,560 次受控间接 Prompt Injection 测试,某一隐藏 Unicode 文件攻击组合的最高规则判定成功率为 25.5%;实验使用本地夹具,没有真实外部副作用。

先说结论

DeepSeek Harness 刚冲上热榜,研究人员就用 14,560 次受控攻击给它上强度。

8 月 17 日提交、8 月 18 日更新的 arXiv 论文,评估了 DeepSeek Harness 对间接 Prompt Injection 的抵抗力。实验覆盖 16 种间接内容渠道、文本和文件载体、35 个攻击目标与 12 种攻击方法。

论文报告的最高观测值包括:文件模式下隐藏 Unicode 攻击按规则判定达到 25.5%,文本模式下 fake-completion 按语义模型判定达到 17.0%,skills 渠道文件模式达到 16.0%

但标题不能写成“DeepSeek Harness 有 25% 概率被黑”。这是受控本地夹具实验,敏感工具和数据都没有连接真实外部系统;25.5% 是某一攻击方法、载体和判定器组合下的最高观测值,不是所有任务的平均失守率。

Agent 最怕的不是一句脏话,而是一条藏在文件里的命令

普通聊天机器人遇到网页里的恶意 Prompt,最多可能生成一段奇怪回答。Harness 连接了工具、文件、终端和工作区后,间接 Prompt Injection 就可能变成行动:读到一段内容,误以为是系统指令,接着调用工具或把敏感结果送往错误的地方。

论文测试了文本、文件、工具结果、额外上下文和技能渠道。它不是在问“模型会不会被一句话骗”,而是在问:不可信内容进入 Agent loop 后,能不能穿过工具策略抵达敏感动作。

25.5% 这个数字,真正说明了什么

研究使用规则判定器和语义 LLM 判定器。两者结论不同:语义判定器更常把行为算作部分服从,部分服从率为 7.3%,规则判定器为 2.0%。

这说明安全评估本身也有争议:什么叫“攻击成功”?模型输出了危险计划但没有执行,算不算?执行了工具调用但没有外泄,算不算?不同判定器会给出不同答案。

因此最有价值的结果不是一个吓人的百分比,而是提醒开发者:安全控制不能只放在模型提示词里,还要放在不可信内容与敏感动作之间。

我们的判断:Agent 的软肋是权限链

Harness 越强,能接入的上下文和工具越多,攻击面就越像一条供应链。真正的防线应该包括内容标记、工具调用审批、敏感数据隔离、最小权限、执行日志和可回滚操作。

这篇论文没有证明 DSH 在真实生产环境里一定危险,也没有证明换一个模型就能解决问题。它更像一次压力测试:先告诉大家,Agent 不能只靠“请忽略恶意指令”来保命。

仍然要观察

  • 论文代码和后续版本能否复现实验结果。
  • DSH 是否将这些控制内置到工具策略和插件系统。
  • 不同模型、不同权限配置下,攻击成功率如何变化。

证据与原文