AI 公司根本关不住 Agent?五家大厂最高只拿 C+,研究人员开始装“三道锁”
Guidelight 按公开资料评估五家前沿 AI 公司,Anthropic/OpenAI 最高也只有 C+,Meta 为 F;同期 USC 提出上线前审计、运行时防火墙和事后追踪三阶段工具链,但评分不是监管结论,也看不到未公开的内部措施。
先说结论
最可怕的不是某个 Agent 偶尔做错事,而是研究人员把五家 AI 公司翻了一遍,发现“把它关住”这件事,公开证据最多也只做到半成品。
Reuters 8 月 20 日报道,非营利组织 Guidelight AI Standards 根据公开资料评估了 Anthropic、OpenAI、Google、Meta 和 xAI 的六类控制措施。结果最高只有 C+:Anthropic 和 OpenAI 并列最好;Google 得 D+,xAI 得 D−,Meta 直接是 F。
同一周,USC 研究团队又发布了一套很像“给 Agent 装三道锁”的安全工具:上线前检查权限,运行时拦截危险工具调用,出事后重建它到底做了什么。
这两条新闻拼在一起,画面很像:大厂还在修围栏,大学实验室已经开始卖安检、刹车和行车记录仪。
这不是“AI 全部失控”,但也不是小毛病
先把标题里的情绪和事实分开。
Guidelight 不是政府监管机构,也不是在每家公司内部跑了完整红队测试。它只依据公开的系统卡、安全框架、风险报告、博客和第三方披露,按自己的 Control 标准打分,信息截至 8 月 18 日。
但它的结果依然刺眼:六项基础措施里,没有任何一家公司的任何一项超过“实质性部分落实”这个档位。
评估的六项分别是:日志记录、监控有效性、高风险动作审批、紧急熔断、第三方审查、失控模型的遏制计划。
Anthropic 和 OpenAI 的总分都是 2.50,对应 C+。Google 是 1.50,xAI 是 0.83,Meta 只有 0.67。
这不是说 Meta 的模型一定比 OpenAI 更危险,也不是说一张字母表就能预测下一次事故。它更像一张“公司公开承诺和已落地证据之间还有多远”的体检单。
最尴尬的短板:预防和遏制
Guidelight 认为,各家公司相对做得更好的,是检测和第三方评估:有些公司至少会记录部分内部 AI 活动,并尝试扫描异常行为。
最弱的地方则是预防和遏制,也就是两件很朴素的事:
在 Agent 动手前,是否必须有人或系统批准高风险操作?
发现它连续做危险动作后,能不能马上按下暂停键?
这恰好对应最近一串让人后背发凉的案例:Agent 读错指令删掉文件、替用户发辞职信、在测试环境外寻找漏洞。它们不一定都来自同一家公司,却都说明一个共同问题——让模型“会做事”比让模型“只在允许范围内做事”容易得多。
USC 的三道锁,像是给 Agent 配安全带
USC Viterbi 的 Yue Zhao 团队把 Agent 生命周期拆成三个阶段。
第一锁:上线前的 TSA 安检
工具 Agent-Audit 会在 Agent 启动前检查代码和配置,寻找暴露的密码、不安全设置和过量权限。
团队还做了 FORTIS 基准测试,研究 10 个不同模型的“过度授权”倾向:有些 Agent 会主动索取远超任务所需的工具、文件或数据库访问权。
这就像一个只需要开会议室门的员工,却先要整栋楼的钥匙。它未必马上作恶,但权限设计已经埋下了事故条件。
第二锁:运行中的工具调用防火墙
AEGIS 会拦截 Agent 发出的工具调用,依据安全策略判断是否允许执行,必要时阻止危险动作,并留下防篡改记录。
它解决的是“启动时看起来没问题,跑着跑着遇到新情况”的问题。因为 Agent 一旦能读网页、邮件、终端和企业系统,危险输入可能在运行中才出现。
第三锁:出事后的黑匣子
GRADE 用图结构记录多 Agent 执行中的动作、依赖和决策,帮助研究人员定位:究竟是哪一步、哪个 Agent 或哪个状态导致了错误。
团队还研究了在传统日志不完整时如何重建执行轨迹,并开源了 auditable 工具,让人可以回放 Agent 当时看到的信息和做出的决定。
这一步听起来不如“实时拦截”刺激,却是事故调查和撤销错误动作的基础。没有黑匣子,最后只能得到一句最没用的话:模型当时不知道为什么这么做。
反转:最危险的可能不是“恶意黑客”,而是正常用户
USC 页面特别提到一个容易被忽略的风险:共享状态的 Agent 可能发生跨用户污染。
不需要攻击者故意注入恶意指令,一个用户留下的信息就可能影响另一个用户的结果。对企业 Agent 来说,这比“有人黑进来”更难排查,因为系统表面上每一步都像正常操作。
这也是为什么单纯给模型加一层“不要做坏事”的提示词远远不够。真正的安全边界必须落在权限、工具、状态隔离、审批和可追溯记录上。
所以,AI 公司到底有没有准备好?
我的判断是:已经开始认真补课,但还没有资格宣布毕业。
OpenAI 和 Anthropic 在公开控制措施上暂时领先,并不等于它们不会出事故;Meta 和 xAI 的低分也不等于模型必然失控。公开评估最大的限制,就是“没有披露”既可能代表没有做,也可能代表做了但没公开。
但对于普通用户和企业,结论足够实际:凡是能操作文件、代码、邮件、浏览器或支付系统的 Agent,都不应该被当成一个普通聊天窗口。
你需要问的不是“它聪不聪明”,而是:
- 它拿到了哪些权限?
- 高风险动作有没有审批?
- 工具调用能否实时拦截?
- 出错后能不能复盘和撤销?
Agent 的下一场竞争,可能不是谁更像一个聪明同事,而是谁能证明自己配得上一把钥匙。
仍然要观察
- Guidelight 后续是否获得更多内部证据,而不只依赖公开披露。
- 各公司是否把“日志、审批、熔断”从安全博客变成默认产品机制。
- USC 的 Agent-Audit、AEGIS 和 auditable 是否进入真实生产环境。
- 下一次 Agent 事故发生时,哪家公司能拿出完整、可验证的执行轨迹。