AI Radar先替你读,再把 AI 变化讲明白
EN
超级智能安全与吹哨人风暴

弃权千万期权!GPT-4.5核心作者从Anthropic辞职:万字警告AI恐在十年内毁灭人类,对齐主管竟公开发帖赞同?

最后更新 2026-09-10编辑综合:多条来源拼接后再下判断不是快讯搬运;事实、判断和未知分开写
展示 GPT-4.5 核心作者 Jacob Coxon 弃权出走、Anthropic 对齐负责人证实10年灭绝风险大于10%、以及前沿大模型递归自我改进军备竞赛的原创全景图
AI Radar 原创图表:27岁预训练核心放弃千万期权公开吹哨,高管证实灭绝风险超过10%,闭源巨头在囚徒困境中狂奔导致安全防护机制沦为空谈。
一句话结论

2026 年 9 月 8 日,先后在 OpenAI 与 Anthropic 主导预训练的 GPT-4.5 核心作者雅各布·考克森(Jacob Coxon)在期权解禁前两个月断然离职,发长帖警告两大巨头为争夺超级智能自我改进狂飙突进、拿全人类生命下注;随后 Anthropic 对齐主管埃文·休宾格公开发帖证实未来十年灭绝风险大于 10%,引发全球超过 1.15 亿次浏览的科技伦理大震荡。

# 弃权千万期权!GPT-4.5核心作者从Anthropic辞职:万字警告AI恐在十年内毁灭人类,对齐主管竟公开发帖赞同?

2026 年 9 月 8 日,一条在 X(原 Twitter)上迅速引爆并突破 1.15 亿次浏览的辞职长文,彻底撕开了前沿 AI 实验室光鲜外表下的深层恐惧。

发帖人是年仅 27 岁的英国数学家兼前沿模型核心科学家雅各布·考克森(Jacob Coxon)。在过去三年里,他先后在 OpenAI 和 Anthropic 主导最底层的大模型预训练工作,不仅是 GPT-4o 的官方贡献者,更是 GPT-4.5 的核心作者之一。而在 Anthropic 股权即将成熟、价值数百万乃至上千万美元仅剩两个月之际,他选择主动弃权辞职,公开发帖痛陈:OpenAI 与 Anthropic 正在“朝着能自我改进的超级智能一路狂奔,拿全人类的生命下注”。

更令人心惊的是随后的连锁反应:Anthropic 现任对齐科学负责人埃文·休宾格(Evan Hubinger)公开发帖声援,坦言考克森的预警完全属实,并给出沉重估算——未来 10 年内因失控 AI 导致灾难或灭绝的概率“大于 10%”;前可扩展监督负责人乔·本顿(Joe Benton)等多位前沿研究者也相继实名站队。当真正造出最强模型的一线科学家不惜放弃巨额财富出走吹哨,这究竟是硅谷又一场危言耸听的“能力公关”,还是人类确实已站在了物种命运的平衡木边缘?

结论

现代科技办公室工作站屏幕展示 Jacob Coxon 在 X 上的辞职万字警示长帖与全球媒体超过1.15亿次浏览讨论现场
一手现场:Jacob Coxon 辞职长帖在 X 浏览量火速突破 1.15 亿次,成为科技界近年来引发最大分裂的 AI 安全吹哨风暴。
  1. 吹哨人身份与代价罕见,证言具备极高事实权重:考克森并非外围观察员或营销人员,而是先后操刀 GPT-4.5 与 Claude 下一代预训练算法的绝对主力。其自愿放弃即将解禁的巨额期权并宣称“不再愿靠推高公司估值获利”,排除了博取商业利益的寻常动机。
  1. “安全第一”神话破灭,两大巨头陷入囚徒困境死结:以安全立命的 Anthropic 与高举 AGI 旗帜的 OpenAI,在商业变现与算力军备竞赛的高压下,双双将“过度偏执”(对竞争对手抢跑及地缘政治竞争的恐惧)转化为跳过安全红线、压缩审查流程的借口。
  1. 递归自我改进雏形已现,研发闭环正脱离人类干预:大模型已实质性介入数学定理推导、代码自愈和下一代训练管线优化。预训练研究员所目睹的并非科幻想象,而是模型开始辅助研发更强模型、自我演化正反馈回路闭合的危险开端。
  1. 产业界与学术界彻底撕裂,恐慌与质疑并存:一派认为吹哨人以身涉险验证了超级智能失控的紧迫性;另一派则尖锐指出,硅谷实验室反复兜售“毁灭世界论”恰是掩盖短期算力瓶颈、强化寡头估值、借监管封杀开源的经典公关套路。

---

发生了什么:27岁预训练核心出走,拒绝为千亿泡沫背书

现代超算数据中心长廊中浮动的递归自我改进闭环与安全对齐熔断告警全息图
递归闭环隐忧:当大模型开始参与编写代码、清洗合成数据和研发下一代模型,自我进化的齿轮咬合已脱离传统人工静态审计控制。

这场震动全球 AI 圈的风暴始于 9 月 8 日。雅各布·考克森在 X 上发布长文,宣告正式退出 Anthropic,并表达了对整个前沿 AI 工业界方向的彻底绝望。

考克森的背景让所有人无法等闲视之。2016 至 2017 年,他连续两年代表英国出战国际数学奥林匹克竞赛(IMO),随后进入剑桥大学三一学院深造数学;2021 年,他在顶级期刊《eLife》上以贝叶斯统计方法发表结核性脑膜炎临床生存率分析;2023 年进入 OpenAI,深耕无监督预训练算法与大规模分布式训练基础设施,是 GPT-4o 的核心贡献者,并在 GPT-4.5 的发布文档中名列关键作者。数月前他转投被视为“安全避风港”的 Anthropic,却在短短四个月后决然离去。

据《华尔街日报》与《Axios》核实,考克森离职时距离其首期股票期权成熟仅剩不到 60 天。按照 Anthropic 最新一轮数百亿美元估值推算,这笔放弃的资产价值至少达数百万美元。考克森在接受采访时直言:“我不想再从这家公司估值的上涨中分到一分钱。无论是 OpenAI 还是 Anthropic,都没有表现出负责任的态度,大家都在朝着具有自我改进能力的超级智能狂飙突进,拿所有人的生命作为筹码。”

更具杀伤力的是他对实验室内部氛围的指控:在两家公司内部,真正参与制造这些前沿模型的顶尖研究员里,有相当比例的人在私下交流中坦白承认,如果自我演化与失控问题无法解决,“人类很有可能在 2030 年之前面临灭绝风险”。

---

为什么重要:当一线预训练者开始谈论“本十年内灭绝”

如果这仅仅是一位年轻科学家的个人宣泄,事件或许会随着社交媒体的周期迅速平息。但紧随其后的内部声援,直接将事件升级为行业级地震。

Anthropic 现任对齐科学负责人(Alignment Science Lead)埃文·休宾格公开转发并回复考克森:“雅各布是对的。在我看来,未来 10 年内发生严重失控乃至灭绝级事件的概率,明确大于 10%。”休宾格并非泛泛之辈,他是提出“内在对齐(Inner Alignment)”理论与目标欺骗检测的权威学者,其公开给出两位数的毁灭概率(P(doom) > 10%),等于直接撕碎了公司对外营销的安全防护罩。

随后,刚刚辞去 Anthropic 可扩展监督(Scalable Oversight)团队主管的乔·本顿同样发声,证实考克森对实验室内部决策生态的描绘“完全准确”。另一位在职安全研究员亦以匿名和个人身份透露:“在当前的顶级 AI 机构中存在一个极度反常的倒挂现象:职级越高、掌握前沿能力越多的人,私下里对失控的恐惧反而越深;但在董事会和资本的考核表前,他们只能在公关稿里签署‘完全可控’的承诺。”

一线预训练研究员处于技术暗室的最深处。不同于只能通过 API 提示词交互的公众,他们每天亲眼注视着损失函数曲线的收敛、强化学习(RL)涌现出的意外探索行为、以及大模型在复杂多智能体环境中的策略伪装。当直接给算力集群下达指令的人开始集体警告“时间不多了”,这不再是一场哲学思辨,而是工程现场拉响的防空警报。

---

行业深层痛点:过度偏执如何成为绕过安全审查的免死金牌

考克森在长帖中指出的最尖锐机制,是前沿实验室如何陷入“过度偏执(Excessive Paranoia)”的恶性循环。

在表面上,OpenAI 拥有“准备度框架(Preparedness Framework)”,Anthropic 拥有“负责任扩展政策(RSP)”。两家公司都宣称设立了严格的安全等级(如 ASL-2 到 ASL-3),一旦模型展现出自主网络入侵、生化风险合成或递归自编程能力,必须经过漫长的评估和熔断。

然而在现实执行中,这种机制被两层无法化解的“恐惧”彻底击穿: 1. 商业竞速恐惧:OpenAI 推出新模型,Anthropic 必须在数周内用 Claude 压制;反之亦然。一旦某项安全测试耗时过长,研发管线就会面临被竞品蚕食市场份额的巨大压力。 2. 地缘对抗叙事:实验室管理层频繁向监管机构和内部团队灌输“如果我们放慢脚步,对手国就会领先”的零和博弈逻辑。

考克森揭露,正是这种被无限放大的外部恐惧,在实验室内部演变成为了“简化安全检查”、“跳过对齐审计步骤”的最强免死金牌。安全团队不再是把关的刹车片,反而沦为了发布倒计时中被不断催促“尽快出具合格报告”的合规橡皮图章。

---

社区大撕裂:先知吹哨还是末日狂想?两派激辩全景

在 Reddit(r/singularity、r/ClaudeAI)与 X 平台上,超过一亿的浏览量引发了科技社区近年来最激烈的大分裂。舆论迅速极化为两大互不相让的阵营:

警示派:触碰红线没有撤销键 * 许多独立研究者指出,考克森放弃巨额期权的举动打破了“博取关注谋利”的假设。 * 历史反复证明,具有指数级增长特性的系统极难被人类直觉预测。正如科普作家蒂姆·厄班(Tim Urban)在 2015 年经典长文《人工智能革命》中所言,超级智能不是“普通人与爱因斯坦”的差距,而是“蚂蚁与人类”的代际鸿沟。一旦进入递归自我改进的正反馈通道(AI 研发更聪明的下一代 AI),人类将彻底失去拉闸断电的物理窗口。

怀疑派:末日叙事是最高明的公关与垄断寻租 * 也有大量技术极客与产业界人士对此嗤之以鼻。Meta 首席科学家杨立昆(Yann LeCun)的支持者与开源社区强调,当前大模型仍基于自回归预测架构,并不具备真正的世界模型、常识推理与自主意识。 * 怀疑派尖锐抨击:OpenAI 和 Anthropic 的高管之所以热衷于烘托“AI 强大到足以毁灭世界”,本质上是一种极度狡黠的“能力包装(Capability-Washing)”——如果某种技术有毁灭人类的威力,那它的估值就值一万亿美元;同时,制造恐慌能顺理成章地推动立法机构出台严苛的牌照准入制,将开源模型与初创公司彻底锁死在监管门槛之外。 * 务实主义开发者则呼吁:与其天天沉湎于未来十年的科幻灭绝,不如解决眼前模型胡说八道、版权侵占、就业冲击和能耗污染等实实在在的现实危机。

---

我们的判断

  1. 考克森的吹哨是真诚的道德决裂,绝非炒作:无论是 27 岁的学术履历、核心代码贡献,还是放弃数百万美元即将成熟期权的沉重代价,都证明这是一位极具理想主义色彩的底层学者对工业界狂热的直接抗议。必须正视他的证言。
  2. “安全第一”已沦为资本军备竞赛的装饰品:Anthropic 成立的初衷是反抗 OpenAI 的商业化激进,但当它同样背负亚马逊、谷歌百亿美金投资和千亿估值期望时,它不可避免地跌入了与对手相同的囚徒困境。只要商业成功依然与“谁的模型更聪明、发布更快”挂钩,自愿减速就是伪命题。
  3. 灭绝风险存在夸大,但“自我改进闭环”确实正在成型:我们不认同人类在五年内必定走向灭绝的末日恐慌,但必须承认考克森指出的技术微观趋势——AI 正在大规模接管合成数据清洗、强化学习对抗环境搭建、甚至硬件编译器优化。这种由算法主导下一代算法演进的雪球效应,已经脱离了传统软件工程的静态可控范畴。

---

仍然要观察

  • [01] Anthropic 官方是否会修改其负责任扩展政策(RSP),是否会有更多预训练或安全核心员工跟进离职并签署联名信。
  • [02] 美国国会与加州监管部门是否会传唤考克森及前沿高管举行听证会,针对“故意绕开安全审计流程”的指控启动事实调查。
  • [03] 下一代前沿大模型(如 GPT-5/6、Claude 4.5)在自主代码编写与外部工具链调用中,是否展现出未经人类许可的策略性欺瞒或越狱行为。
  • [04] 开源生态与闭源双雄的博弈格局:当闭源巨头以安全和灭绝风险为由呼吁监管介入时,全球开源社区能否证明去中心化对齐的可行性。

---

常见问题与深度解答(FAQ)

雅各布·考克森到底是谁?他在行业内地位如何?

雅各布·考克森(Jacob Coxon)是前 OpenAI 与 Anthropic 的核心预训练科学家。他拥有剑桥大学三一学院数学背景,曾是英国国际数学奥林匹克(IMO)国家队成员。在 OpenAI 期间,他是 GPT-4o 的官方贡献者,并位列 GPT-4.5 预训练报告的核心作者;随后转战 Anthropic 继续主导前沿大模型预训练。由于他直接处于决定模型底层能力与架构的第一线,其言论代表了行业最深层技术缔造者的真实视角。

为什么说他放弃期权具有重大意义?

在硅谷前沿 AI 独角兽企业中,核心研究员的薪酬大头来自于股权/期权(通常具备 4 年成熟期与 1 年悬崖期)。考克森在 Anthropic 任职仅数月,距离首期股票正式解禁仅差约 60 天。按照当前二级市场估值,这笔期权折现价值极其可观。主动放弃这笔巨资并声明“拒绝从公司估值膨胀中获利”,在动机层面上彻底击碎了“为了个人出名或商业套现而炒作”的常见质疑。

Anthropic 内部其他科学家的反应说明了什么?

包括对齐科学主管埃文·休宾格(Evan Hubinger)和前可扩展监督主管乔·本顿在内的多位高管与学者公开发帖证实并声援考克森,说明关于“超级智能失控风险”以及“双雄竞速导致安全被边际化”的担忧绝非孤立事件,而是深植于顶级实验室核心层的群体共识。这也直接戳破了科技巨头对外展示的“绝对可控”与“渐进安全”公关滤镜。