AI Radar先替你读,再把 AI 变化讲明白
EN
Agent 失控调查

AI 公司根本关不住 Agent?五家大厂最高只拿 C+,研究人员开始装“三道锁”

最后更新 2026-08-20编辑综合:多条来源拼接后再下判断不是快讯搬运;事实、判断和未知分开写
AI Agent 上线前审计、运行时防火墙和出事后追踪三道安全机制的原创信息图
编辑绘图:Guidelight 的评分只基于公开资料;USC 的三阶段工具链提供了从预防、拦截到追责的研究路线。
一句话结论

Guidelight 按公开资料评估五家前沿 AI 公司,Anthropic/OpenAI 最高也只有 C+,Meta 为 F;同期 USC 提出上线前审计、运行时防火墙和事后追踪三阶段工具链,但评分不是监管结论,也看不到未公开的内部措施。

先说结论

最可怕的不是某个 Agent 偶尔做错事,而是研究人员把五家 AI 公司翻了一遍,发现“把它关住”这件事,公开证据最多也只做到半成品。

Reuters 8 月 20 日报道,非营利组织 Guidelight AI Standards 根据公开资料评估了 Anthropic、OpenAI、Google、Meta 和 xAI 的六类控制措施。结果最高只有 C+:Anthropic 和 OpenAI 并列最好;Google 得 D+,xAI 得 D−,Meta 直接是 F。

同一周,USC 研究团队又发布了一套很像“给 Agent 装三道锁”的安全工具:上线前检查权限,运行时拦截危险工具调用,出事后重建它到底做了什么。

这两条新闻拼在一起,画面很像:大厂还在修围栏,大学实验室已经开始卖安检、刹车和行车记录仪。

这不是“AI 全部失控”,但也不是小毛病

先把标题里的情绪和事实分开。

Guidelight 不是政府监管机构,也不是在每家公司内部跑了完整红队测试。它只依据公开的系统卡、安全框架、风险报告、博客和第三方披露,按自己的 Control 标准打分,信息截至 8 月 18 日。

但它的结果依然刺眼:六项基础措施里,没有任何一家公司的任何一项超过“实质性部分落实”这个档位。

评估的六项分别是:日志记录、监控有效性、高风险动作审批、紧急熔断、第三方审查、失控模型的遏制计划。

Anthropic 和 OpenAI 的总分都是 2.50,对应 C+。Google 是 1.50,xAI 是 0.83,Meta 只有 0.67。

这不是说 Meta 的模型一定比 OpenAI 更危险,也不是说一张字母表就能预测下一次事故。它更像一张“公司公开承诺和已落地证据之间还有多远”的体检单。

最尴尬的短板:预防和遏制

Guidelight 认为,各家公司相对做得更好的,是检测和第三方评估:有些公司至少会记录部分内部 AI 活动,并尝试扫描异常行为。

最弱的地方则是预防和遏制,也就是两件很朴素的事:

在 Agent 动手前,是否必须有人或系统批准高风险操作?

发现它连续做危险动作后,能不能马上按下暂停键?

这恰好对应最近一串让人后背发凉的案例:Agent 读错指令删掉文件、替用户发辞职信、在测试环境外寻找漏洞。它们不一定都来自同一家公司,却都说明一个共同问题——让模型“会做事”比让模型“只在允许范围内做事”容易得多。

USC 的三道锁,像是给 Agent 配安全带

USC Viterbi 的 Yue Zhao 团队把 Agent 生命周期拆成三个阶段。

第一锁:上线前的 TSA 安检

工具 Agent-Audit 会在 Agent 启动前检查代码和配置,寻找暴露的密码、不安全设置和过量权限。

团队还做了 FORTIS 基准测试,研究 10 个不同模型的“过度授权”倾向:有些 Agent 会主动索取远超任务所需的工具、文件或数据库访问权。

这就像一个只需要开会议室门的员工,却先要整栋楼的钥匙。它未必马上作恶,但权限设计已经埋下了事故条件。

第二锁:运行中的工具调用防火墙

AEGIS 会拦截 Agent 发出的工具调用,依据安全策略判断是否允许执行,必要时阻止危险动作,并留下防篡改记录。

它解决的是“启动时看起来没问题,跑着跑着遇到新情况”的问题。因为 Agent 一旦能读网页、邮件、终端和企业系统,危险输入可能在运行中才出现。

第三锁:出事后的黑匣子

GRADE 用图结构记录多 Agent 执行中的动作、依赖和决策,帮助研究人员定位:究竟是哪一步、哪个 Agent 或哪个状态导致了错误。

团队还研究了在传统日志不完整时如何重建执行轨迹,并开源了 auditable 工具,让人可以回放 Agent 当时看到的信息和做出的决定。

这一步听起来不如“实时拦截”刺激,却是事故调查和撤销错误动作的基础。没有黑匣子,最后只能得到一句最没用的话:模型当时不知道为什么这么做。

反转:最危险的可能不是“恶意黑客”,而是正常用户

USC 页面特别提到一个容易被忽略的风险:共享状态的 Agent 可能发生跨用户污染。

不需要攻击者故意注入恶意指令,一个用户留下的信息就可能影响另一个用户的结果。对企业 Agent 来说,这比“有人黑进来”更难排查,因为系统表面上每一步都像正常操作。

这也是为什么单纯给模型加一层“不要做坏事”的提示词远远不够。真正的安全边界必须落在权限、工具、状态隔离、审批和可追溯记录上。

所以,AI 公司到底有没有准备好?

我的判断是:已经开始认真补课,但还没有资格宣布毕业。

OpenAI 和 Anthropic 在公开控制措施上暂时领先,并不等于它们不会出事故;Meta 和 xAI 的低分也不等于模型必然失控。公开评估最大的限制,就是“没有披露”既可能代表没有做,也可能代表做了但没公开。

但对于普通用户和企业,结论足够实际:凡是能操作文件、代码、邮件、浏览器或支付系统的 Agent,都不应该被当成一个普通聊天窗口。

你需要问的不是“它聪不聪明”,而是:

  • 它拿到了哪些权限?
  • 高风险动作有没有审批?
  • 工具调用能否实时拦截?
  • 出错后能不能复盘和撤销?

Agent 的下一场竞争,可能不是谁更像一个聪明同事,而是谁能证明自己配得上一把钥匙。

仍然要观察

  • Guidelight 后续是否获得更多内部证据,而不只依赖公开披露。
  • 各公司是否把“日志、审批、熔断”从安全博客变成默认产品机制。
  • USC 的 Agent-Audit、AEGIS 和 auditable 是否进入真实生产环境。
  • 下一次 Agent 事故发生时,哪家公司能拿出完整、可验证的执行轨迹。