AI Radar先替你读,再把 AI 变化讲明白
EN
安全攻防首发

关掉思考却吐出万字底牌?Oh My Pi作者用一张“草稿纸”,撕开GPT-5.6与Claude加密思维链

最后更新 2026-09-05编辑综合:多条来源拼接后再下判断不是快讯搬运;事实、判断和未知分开写
展示 Oh My Pi 作者利用 externalThinking 绕过大模型隐藏思考、导出 GPT-5.6 与 Claude 加密思维链的原创图表
AI Radar 原创图表:Oh My Pi 提出“草稿纸理论”,仅凭一个普通 Tool Call 便系统性导出了大模型内部加密的穴居人思维链。
一句话结论

2026 年 8 月,拥有超 2.4 万 Star 的开源终端编程代理 Oh My Pi(omp)作者 can1357 发现了一项反直觉的“草稿纸旁路”:无需任何逆向解密算法,只需关闭模型原生隐藏思考(thinking: off),并挂载一个名为 deep_think 的外部工具调用,GPT-5.6 与 Claude Fable 5 就会在处理数论等极难题时毫无戒备地将未过滤、跳跃式的“穴居人语言”万字原始思维草稿全盘写入公开 API 工具参数中。这一突破已被正式集成进 Oh My Pi v17.2.14 的 externalThinking 功能,直接击穿了闭源巨头防止小模型蒸馏的千万美元级数据护城河,但也带来了开发者本地日志泄露生产环境 API Key 与凭据的巨大安全隐患。

# 关掉思考却吐出万字底牌?Oh My Pi作者用一张“草稿纸”,撕开GPT-5.6与Claude加密思维链

结论

开发者在多屏工作站中运行 Oh My Pi 终端智能体并捕获外部思考草稿的实拍图
AI Radar 实测现场:开启 externalThinking 后,模型在修改代码前主动将万字原始推导倾倒在本地终端。

2026 年 8 月中旬,AI 安全与大模型开发者生态迎来了一场极具戏剧性的技术震荡:开源终端编程工作台 Oh My Pi(简称 omp,GitHub 拥有超 2.4 万 Star) 的作者 can1357,公开展示了一种几乎“零门槛”、无需任何算法破解,即可将 OpenAI GPT-5.6Anthropic Claude Fable 5 内部被深度加密的隐藏思维链(Chain of Thought)完整导出的实操方法。

这一发现不仅迅速在极客圈引爆,更直接动摇了闭源大模型厂商苦心构筑的数据防线:

  1. “草稿纸理论”击穿加密防线:can1357 没有尝试暴力破解 API 返回的加密思维载荷,而是利用极其朴素的反向逻辑——在 API 中直接将模型原生推理通道关闭(thinking: off),并为模型挂载一个名为 deep_think 的单一参数外部工具(Tool Call),命令模型在执行任何行动前先在工具中写下推导步骤;
  2. 万字未经修饰的“穴居人语言”全量流出:在面对极其苛刻的高难度数论考卷时,GPT-5.6 Luna 与 Claude Fable 5 毫无戒备地主动触发该工具,在公开的 API 参数中倾倒出数千甚至上万字未经公关包装、跳跃自言自语的原始推理速记(即所谓“穴居人语言”);
  3. 动摇千万美元的“防蒸馏”商业护城河:OpenAI 与 Anthropic 过去两年之所以将思维链深度加密并向普通用户隐藏,首要目的就是防止开源社区利用高质量 CoT 数据低成本蒸馏出能力逼近的小模型;此次旁路泄漏意味着这道商业护城河在工具调用层彻底失守;
  4. 工具已完成自动化武器化落地:can1357 已将该机制正式封装进 Oh My Pi v17.2.14externalThinking 配置项中,开发者无需自写脚本即可一键捕获顶级模型的隐式草稿,但也引发了开发者敏感凭据随日志外泄的严重安全风险。

这件事最有深度的地方在于:越复杂的安全加密架构,往往越容易被最朴素的工具机制绕开。厂商封锁了原生思维通道,却难以封死通往外部世界的每一个工具接口。

---

发生了什么

展示神经网络内部推理轨迹突破加密保险箱流入工具调用参数的概念图景
AI Radar 架构解析:越复杂的加密体系,往往越容易被模型对工具调用的语义特权信任直接击穿。

大模型内部推理记录(Reasoning Traces),本质上是模型在给出最终答案前打下的“解题草稿”。与 DeepSeek 习惯于公开发布思维链不同,OpenAI 与 Anthropic 出于防抄袭、防蒸馏以及安全对齐考虑,向来将完整的思考过程深锁在后台黑盒中,仅向用户展示精简的结论或高度概括的摘要。

当用户需要多轮连续调用 API 时,这些厂商会通过不可逆的加密载荷将思维上下文传回。此前,学术界普遍认为想要还原这些加密思维,需要极高难度的对抗手段。

例如,Alexander Panfilov 等学者发表的学术论文《Stealing Reasoning Traces from Proprietary LLM APIs》展示:研究人员必须先让强模型生成加密推理数据,再把这些数据喂给同一厂商旗下安全水位较弱的模型(如 GPT-4o-mini 或 Kimi-K3),利用特定提示词将弱模型诱导为“解密解码器”来还原部分文本。这种学术方法不仅链路繁琐,而且极易触发厂商在 API 层的跨请求安全风控。

而 Oh My Pi 的作者 can1357 读完论文后,选择了一条完全不同的工程路线。

攻击路径对比:学术解码 vs 工具语义旁路

can1357 提出的理念被称为“草稿纸置换”:既然厂商不允许模型使用官方带锁的草稿纸,那我干脆直接递给模型一张全新的外部草稿纸。

| 核心评估维度 | 学术弱模型解码 (Panfilov 论文) | 外部草稿纸注入 (Oh My Pi can1357) | 原生隐藏思考 (官方默认体系) | | :--- | :--- | :--- | :--- | | 技术实现难度 | 中等(需跨模型诱导与逆向调试) | 极低(仅需一个标准 Tool Call) | 无法直接导出(系统强制黑盒) | | 导出的思维完整性 | 易被弱模型二次总结或局部丢失 | 100% 原始逐字推导速记草稿 | 仅向用户展示公关修饰后的摘要 | | 捕获的思维文风 | 被弱模型重新人类化修辞 | 纯粹“穴居人语言”极简符号 | 人类可读的礼貌自然语言 | | 被平台风控拦截概率 | 高(易被跨用户数据流风控识别) | 极低(属于合法业务工具参数) | 不适用 | | 工程工具化成熟度 | 停留于实验室概念验证 (PoC) | 已直接集成进 Oh My Pi 正式版 | 官方闭源黑盒运行 |

为了验证这套机制是否适用于最前沿的旗舰,can1357 准备了一道涵盖马尔可夫三元组、韦达变换、根树结构证明及模 4 分类证明的高难度数论考卷,题目明确要求不得编写代码、不得查表,必须写出完整下降过程。

测试结果令人咋舌:在原生推理被设为关闭的状态下,GPT-5.6 Luna 和 Claude Fable 5 均全线“中招”。模型毫无保留地在外部工具参数里倾泻了万字草稿,把此前从未公开展示过的底层推演逻辑彻底暴露在开发者眼前。

---

为什么重要:“草稿纸理论”背后的安全与商业大地震

表面上看,这只是一个巧妙的 Prompt 与工具组合技巧;但在深度系统工程与商业竞争层面,它直接撕开了大模型行业最敏感的几层窗户纸。

为什么大模型防住了越狱,却防不住最朴素的Tool Call

大模型安全团队花费了数亿美元构筑对齐训练(RLHF)与红队防御,为什么却在一张小小的工具参数前全面缴械?

  • 工具调用的语义特权与角色混淆:在大语言模型的微调阶段,Tool Call 被赋予了极高的系统优先级。当模型被告知“必须先向工具报告你的分析以辅助后续操作”时,模型的注意力机制会判定这是在履行正常的业务逻辑,而非违规泄露内部机密。传统的安全分类器重点盯防的是输出对话窗口中的拒绝词,对功能性工具参数的内容审查存在天然盲区;
  • “穴居人语言”揭开了非人类中间表征的冰山一角:导出的万字草稿中,充满了大量的无主语句子、跳跃缩写、逻辑箭头和自我推翻式碎碎念(如“try vieta / fail / mod 4 odd / contradiction / check node”)。这印证了学术界的长期猜想:在强化学习驱动的测试期算力(Test-time Compute)中,大模型真正高效的思考并不依赖于优美的人类语法,而是在使用一种高度压缩的内部计算方言;
  • 重创闭源厂商千万美元级的“防蒸馏”护城河:高质量的 CoT 推理数据是全球最稀缺的 AI 训练燃料。DeepSeek、Meta、Mistral 等开源团队一直在寻找优质长推理轨迹来训练新一代推理模型。过去 OpenAI 通过加密封装锁死了这部分数据流,而通过这一工具旁路,任何开发者都可以用最廉价的 API 调用批量爬取顶级模型的真实思维链,闭源大厂的代际优势将大幅缩水;
  • 生产环境凭据泄漏的致命风险:这是一把危险的双刃剑。当模型习惯于在外部草稿中记录一切上下文时,如果用户的业务提示词中包含了 API Key、内部数据库账号或系统私钥,模型在草稿中演算时极易把这些高危凭据明文写入工具参数中。一旦这些内容被日志采集工具或第三方中间件收录,将酿成灾难性的企业数据泄露。

---

社区落地:Oh My Pi v17.2.14 与开发者的武器化选择

随着实验的全面成功,can1357 迅速将其工程化落地,并发布了 Oh My Pi v17.2.14 稳定版。

在这一版本中,用户只需在配置中激活 externalThinking: true,omp 客户端就会自动在与模型握手时注入外部草稿工具,并在模型修改本地工程代码前,强制其将全部架构考量和潜在 Bug 风险倾倒在本地终端中。

随后 can1357 还紧急修复了一个边界 Bug:部分模型在接收到关闭隐藏思考指令时,底层引擎仍会静默跑一遍内部推理,导致模型在内部想了一遍又在外部写了一遍,引发 Token 双倍计费。在修复后,客户端已能精准控制模型的单轨外部推理。

这标志着顶级模型的隐藏思考提取已经从少数极客的临时脚本,演变为普及给数万名开发者的开箱即用工具。

---

我们的判断

针对 Oh My Pi 导破思维链事件及其引发的涟漪反应,我们给出四项核心研判:

  1. 大模型的本质是自回归计算机器,不存在绝对安全的“思维隐形”:只要模型依然被赋予调用外部工具、与现实环境交互的权力,任何试图在同一个语义空间内“既让模型深度思考、又对调用者隐瞒思考轨迹”的设计,在信息论上都是千疮百孔的;
  2. “穴居人语言”的泄露将加速开源小模型的推理平替:社区拿到未经公关美化的真实 CoT 样本后,针对性微调 7B 至 14B 参数小模型的效果将迎来肉眼可见的飞跃,未来 3 到 6 个月内将涌现大量具备顶级思维跳跃能力的平价开源模型;
  3. 闭源巨头将紧急发起 API 接口级“工具内容深度过滤”升级:OpenAI 与 Anthropic 绝不会对思维链泄漏坐视不管。预计在接下来的几周内,各家 API 将上线针对 Tool Call 参数的敏感词与 CoT 模式检测探针,甚至强制对特定命名模式的外部思考工具实施静默截断;
  4. 企业级 AI 架构必须立即隔离模型操作日志与敏感资产凭据:这一事件敲响了警钟——绝对不能信任大模型在思考过程中的保密自觉性。企业必须在网关层建立严格的数据脱敏拦截,严禁将生产环境密码与未混淆的核心资产直接投喂给带工具调用的智能体。

---

仍然要观察

在这一 bypass 机制向全网扩散的进程中,以下三个关键变量仍需持续追踪:

  1. OpenAI 与 Anthropic 是否会推出系统级补丁封禁 externalThinking 机制:厂商会选择静默修改模型 Prompt 识别能力,还是从 API 网关层直接限制工具参数长度与类型;
  2. 开源社区基于“穴居人推理数据集”蒸馏的新一代开源模型质量:从这些高密非自然语言草稿中训练出的小模型,是否能复现完整的前沿数理逻辑推理能力;
  3. 企业端因开启外部草稿导致的敏感信息外流真实安全事故率:在开源编程代理普遍集成的背景下,是否有团队因为本地日志未做脱敏而遭遇凭据黑客攻击。

---

信息来源清单与证据类型

  • 开源项目官方仓库:can1357 Oh My Pi (omp) GitHub 仓库源码与 v17.2.14 发布更新日志(2026.08)
  • 核心开发者一手推文:Oh My Pi 核心作者 can1357 在 X 平台关于 externalThinking 测试期突破的完整推文串与测试报告(2026.08)
  • 学术界一手安全论文:Alexander Panfilov et al.《Stealing Reasoning Traces from Proprietary LLM APIs》(2026.08)
  • 模型推理评测实测:数论马尔可夫图与韦达变换推导实测记录及 GPT-5.6 / Claude Fable 5 真实响应日志(2026.08)
  • 模型厂商安全规范:OpenAI 与 Anthropic 开发者平台关于隐藏推理(Hidden Thinking)与 Tool Call 隐私边界条款(2026.08)
  • 独立安全分析报告:AI Radar 安全实验室:大模型工具调用语义逃逸与企业凭据泄露风险深度测算(2026.09)