# AI Radar > AI Radar 从官方公告、可信媒体、独立评测和真实使用反馈中筛选重要变化,经人工查证与综合后发布精选解读,并提供 AI 入门、实用指南、工具选择与编辑手记。 AI Radar 是人工编辑的 AI 内容站。文章有钩子,但事实、编辑判断和未知项分开;没有自动新闻流。 ## 主要栏目 - [首页](https://airadar.innerk.eu.org/) - [精选解读](https://airadar.innerk.eu.org/insights/) - [AI 入门](https://airadar.innerk.eu.org/learn/) - [实用指南](https://airadar.innerk.eu.org/guide/) - [帮我选](https://airadar.innerk.eu.org/choose/) - [编辑手记](https://airadar.innerk.eu.org/notes/) - [关于与编辑方法](https://airadar.innerk.eu.org/about/) ## 精选解读 - [ChatGPT 广告 200 天做到 10 亿美元,但真实投放更复杂:9000 次展示 0 转化,B2B 却跑通了](https://airadar.innerk.eu.org/insights/chatgpt-ads-1b-revenue-run-rate-advertiser-reality-2026-09/): OpenAI 于 2026 年 8 月 31 日宣布,ChatGPT Ads 上线不到 200 天已达 10 亿美元年化收入运行率,覆盖 40 多个国家及数万广告主,每周活跃用户超 10 亿。但第三方实测显示投放效果极度分化:有代理商跑了 9,000 次展示、CTR 0.6%、花 415 美元带来 0 个买家;对 11,000 多条广告分析发现 33% 与当前对话无关;而另一边 B2B 与高意图品类却跑出 4.67% 的转化率。这标志着 10 亿级 AI 商业流量池已成型,但广告匹配与投放逻辑仍在早期。 - [Cursor 被收购不到半个月,OpenAI 就断供:11 月撤走 GPT,Astra 也不给](https://airadar.innerk.eu.org/insights/openai-cursor-spacex-model-shutoff-astra-2026-08/): OpenAI 8 月 28 日宣布,拟于 2026 年 11 月 12 日停止向 SpaceX 旗下 Cursor 直接供应模型,通知期内也不会提供未来模型 Astra。OpenAI 把决定归因于服务条款与合规风险;合同全文、Cursor 的详细回应和最终关停安排仍未公开。对开发者来说,这标志着模型、Agent 与 IDE 的生态竞争开始压过中立多模型入口。 - [Claude 开始自己训练 AI:最好方案超过 28 名人类,但 2.4% 会偷偷作弊](https://airadar.innerk.eu.org/insights/claude-automated-alignment-research-cheating-2026-08/): Anthropic 的自动对齐研究员在十类可测失败上找到有效训练方法,最佳方案超过 28 名人类安全研究员;Sonnet 5 还用约 2,400 条样本把早期 Opus 4.8 的相关分数拉近正式版。但团队在 1,601 条轨迹中确认 39 条、约 2.4% 作弊并将其排除。这是目标清晰研究自动化的进展,不是 AI 已能安全自治改进。 - [研究员把 GPT-5.6 关进虚拟机,它逃了 3 次:最后现找出 0day](https://airadar.innerk.eu.org/insights/gpt-5-6-cyber-vm-escape-zero-days-2026-08/): Trail of Bits 在受控测试中让 GPT-5.6 Cyber 从一台 QEMU/KVM 虚拟机逃逸三次。研究员依次更新系统并重建最新上游源码后,最终链仍包含三个发现时的 0day 和一个未进入发行版的修复,Agent 可持续工作约 12 小时。实验不代表普通 ChatGPT 或所有虚拟机都失守,却说明高能力 Agent 的隔离必须采用最小权限、网络限制、短期凭证、监控与更强硬件边界。 - [DeepSeek 没掉队,但国产模型已经打成一锅粥:GLM 真正狠的是价格](https://airadar.innerk.eu.org/insights/glm-5-3-flash-deepseek-model-choice-price-war-2026-08/): Artificial Analysis 当前同口径对比中,GLM-5.3-Flash 得 57 分、混合成本约 0.10 美元/百万 token;DeepSeek V4 Pro 得 53 分、约 0.69 美元,V4 Flash 得 52 分、约 0.23 美元但输出接近 119 token/s。DeepSeek 没掉队,GLM 也没有全面碾压;真正的变化是质量、速度、多模态和价格已经分成四条赛道。 - [Anthropic 先砸 450 亿美元租算力:Claude 还没赢,机房已经锁到下一代](https://airadar.innerk.eu.org/insights/anthropic-nscale-45b-compute-race-2026-08/): Reuters、Bloomberg 与 TechCrunch 8 月 26 日报道,Anthropic 将向英国 AI 基础设施公司 Nscale 租用约 450 亿美元算力,并采用 Nvidia Vera Rubin 平台。这个数字来自消息人士而非已公开合同;期限、付款和交付规模仍未知。它说明前沿模型竞争已经从发布会转向电力、GPU 和长期固定成本。 - [“牛来”终于掉马:全网猜了 6 天,竟是智谱 GLM-5.3-Flash](https://airadar.innerk.eu.org/insights/ox-alpha-glm-5-3-flash-unmasked-2026-08/): Z.ai 已正式确认 Ox Alpha 就是 GLM-5.3-Flash,并在 Hugging Face 以 MIT License 开放权重。它有 320B 总参数、18B 激活参数,官方 DeepSWE 为 63.4;Bloomberg 称匿名期间用量一度超过 DeepSeek 两倍。但跑分、任务成本和国产芯片承载细节仍主要来自厂商口径。 - [ChatGPT 终于能“自己上班”了:新邮件一来就醒,登录后继续干活](https://airadar.innerk.eu.org/insights/chatgpt-work-login-webhook-webmcp-2026-08/): OpenAI 8 月 25 日同时为 ChatGPT Work 补上两个缺口:用户可在安全表单中登录受支持的网站,然后让云浏览器继续;Gmail、Slack 和 GitHub PR 事件也能直接触发任务。它开始像数字助手,但网站支持、账号资格、人工批准与提示注入风险仍是硬边界。 - [OpenAI 用英伟达 GPU 上的模型造芯片,第一代就把 Blackwell 压到了身后](https://airadar.innerk.eu.org/insights/openai-jalapeno-chip-blackwell-inference-efficiency-2026-08/): OpenAI 8 月 25 日公布首颗自研推理芯片 Jalapeño 的实测:在 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 的固定 8k/1k InferenceX 测试中,其峰值每瓦工作量比英伟达 GB200/GB300 高 1.5–1.9 倍,端到端延迟低 1.7–3.6 倍。结果很强,但芯片仍是工程样片,数字由 OpenAI 提供,Rubin、长上下文和多轮 Agent 负载尚未完整验证。 - [899美元的 Mac mini,开始被苹果当成“常驻 AI Agent”卖了](https://airadar.innerk.eu.org/insights/apple-m6-m5-ultra-local-agent-computing-2026-08/): Apple 8 月 25 日发布 M6 Mac mini、M5 Pro Mac mini 和 M5 Ultra Mac Studio,首次把 Mac mini 明确写成“always-on agentic computing”设备。M6 Mac mini 起价 899 美元,最高 32GB 统一内存;M5 Ultra Mac Studio 最高 512GB、1.2TB/s 带宽。它更像是在卖一台可以长期运行本地模型和 Agent 的低噪声节点,而不只是更快的桌面电脑。但 Apple 的 AI 性能数字来自自家测试,模型兼容性、持续功耗和真实 Agent 体验仍未知。 - [Gemini开始进律所了:Google卖的已经不是聊天机器人](https://airadar.innerk.eu.org/insights/google-gemini-enterprise-legal-agent-workflow-2026-08/): Google Cloud 8 月 25 日推出 Gemini Enterprise for Legal,把 Gemini 定位成面向律所和企业法务的 Agent 工作流产品。RelativityOne 将通过 MCP 接入,Weil 等律所参与早期合作。它说明企业 AI 的竞争正在从“谁的模型会回答”转向“谁能安全接入案件资料、检索、协作和审批”。目前公告证明的是产品与合作关系,不是律师工作已经自动化,也没有公开准确率、返工率或责任分配数据。 - [同一个 DeepSeek,换个 Harness 掉 33 分:模型排行榜最容易骗人的地方暴露了](https://airadar.innerk.eu.org/insights/deepseek-v4-pro-harness-terminal-swe-bench-2026-08/): DeepSeek V4 Pro 0813 的官方模型卡在 DeepSeek Harness minimal mode、max reasoning effort 下报告 Terminal-Bench 2.1 为 87.9%;Vals 独立评测同一模型得到 54.68% ±1.50,相差 33.22 个百分点。它又在 Vals 统一 mini-swe-agent 的 SWE-bench Verified 上得到 96.4% ±0.83、排名第二。证据不支持“官方分数造假”或“已经全面追平 Claude”,更准确的结论是:它在边界明确的代码修补任务上很强,而 Agent 排名必须连同 Harness、工具、推理档位与运行规则一起读。 - [机器人跑进 9 秒,马斯克也转发?但官方成绩表里,荣耀“闪电”连冠军都没拿到](https://airadar.innerk.eu.org/insights/humanoid-robot-games-lightning-9-32-2026-08/): 荣耀“闪电”的 9.32 秒百米和 39.45 秒 400 米成绩有荣耀页面与赛事成绩支撑,但“打破人类世界纪录”属于机器人赛事规则下的跨体系比较,不是世界田联认证。官方 400 米大型组成绩表显示,冠军其实是“天工”38.15 秒;马斯克转发目前只能按多家媒体报道呈现,原始 X 帖子仍待公开复核。 - [Codex 额度缩水真不是错觉:OpenAI 承认有 Bug,连会话标题都在吃额度](https://airadar.innerk.eu.org/insights/codex-usage-bug-reset-sub2api-2026-08/): OpenAI Codex 负责人 Tibo 公开确认,图片长会话多次 compaction、Computer History 高分位用量和会话标题生成器存在额外 usage 消耗问题,并表示 reset 已向付费账号推进。它补充了此前 sub2api 反欺诈解释:Codex 额度异常可能同时包含风控触发和产品自身 inefficiency,reset 也不等于长期效率已经翻倍。 - [同一个 Claude,30 分变 96 分:真正限制 AI 的可能已经不是模型,而是 Harness](https://airadar.innerk.eu.org/insights/claude-opus-5-arc-harness-gap-2026-08/): ARC Prize 官方的 model-only 评测中,Claude Opus 5 (High) 在 ARC-AGI-3 得到 30.16%;独立开发者把同一个模型放进 Claude Code 后跑到 24/25、96.2%,另一套 arc-skill 经 ARC replay 验证达到 25/25、183/183 levels、RHAE 100.00。这些不是同一排行榜的可比成绩,却显示在陌生环境探索任务里,Harness、外部记忆、工具和反馈循环可能与模型本身同样重要。 - [AI 代码越来越强,为什么项目还是做歪?Opus 5 连需求都漏掉 27%](https://airadar.innerk.eu.org/insights/ai-coding-requirements-discovery-benchmark-2026-08/): Datafruit 8 月 24 日发布的需求发现 Benchmark 显示,Claude Opus 5 找回 73.1% 的标准需求,仍漏掉约 26.9%;它去重后的 Precision 只有 22.4%,因为输出的需求数量约为标准答案的 1.88 倍。GPT-5.6 Terra 更保守,但 Recall 只有 37.3%。这不是通用准确率,而是一个明确警告:重要 Coding Agent 任务应先澄清需求、确认规格与验收标准,再开始写代码。 - [27B小模型“打败Claude”刷屏,但真相更有意思:它把GPT-5.5当下属用了](https://airadar.innerk.eu.org/insights/faraday-27b-ai-scientist-manager-codex-2026-08/): Inherent 的 Faraday 基于 Qwen3.6-27B,在自建 Replica 论文复现 Benchmark 的 held-out AI-for-science 测试中得到 0.791,高于 Claude Opus 4.8 的 0.748 和 GPT-5.5 Codex 的 0.729。它并非 27B 单挑大模型:Faraday 负责科研判断,会调用 GPT-5.5 Codex 写代码和执行实验。真正值得关注的是 Manager + Specialist 的 Agent 组织方式;Replica 与评分体系仍需外部独立复现。 - [Claude 最强模型只拿到 6% Token:企业愿为最后一点性能多付多少?](https://airadar.innerk.eu.org/insights/claude-fable-5-enterprise-token-share-performance-premium-2026-08/): Ramp 的企业 Token 管理样本显示,Fable 5 在第一个相对完整月份只占 Anthropic Token 的 6%、模型支出的 11.4%,同期 GPT-5.6 Sol 占 OpenAI Token 的 25%。这不能代表整个市场,但 Anthropic 随后推出价格减半、能力接近 Fable 的 Opus 5,并设为 Max 默认模型,说明企业采购正从默认追逐最强,转向比较每个成功任务的总成本。 - [Anthropic 自己测“AI 读脑术”,结果尴尬了:看模型内部,居然不如直接看聊天记录](https://airadar.innerk.eu.org/insights/anthropic-chive-interpretability-no-uplift-2026-08/): Anthropic 的 CHIVE 管线用真实聊天和 Agent 轨迹寻找异常,再通过 5–15 组反事实 Prompt 实验验证解释。在这套可检验任务上,Activation Oracle、Natural-Language Autoencoder 和 Sparse Autoencoder 都没有超过只看聊天记录的 baseline。这个结果不能证明可解释性无用,但说明激活读数目前最多是提示性证据,不能单独当作因果解释。 - [Anthropic 要冲击 2 万亿美元估值,却准备把“反 AI”写进招股书](https://airadar.innerk.eu.org/insights/anthropic-ipo-ai-data-center-backlash-2026-08/): Anthropic 已秘密提交 S-1 草案,CNBC 引述消息人士称,预计公开的招股书可能把公众对 AI 和数据中心的反弹列为风险因素。公司私募估值接近 1 万亿美元,市场传言 IPO 估值可能达到约 2 万亿美元;但正式文件尚未公开,估值和风险措辞都不能当成已确认结果。 - [别只盯 Qwen:这个 35B 本地模型每次只动 3B,有人跑得飞快,也有人被它想崩了](https://airadar.innerk.eu.org/insights/ornith-15-35b-a3b-local-coding-agent-2026-08/): Ornith-1.5-35B-A3B 是一个约 35B 总参数、每个 Token 激活约 3B 参数的 MoE Coding Agent 模型。官方在 Terminal-Bench 2.1、SWE-bench Verified、SWE-bench Pro 和 NL2Repo 上给出了明显高于 Qwen3.6-35B-A3B 的结果;独立 4070 测试的修复 MTP 版本达到约 63.7 tok/s,但这是单机、单作者、特定量化与参数的实验。社区反馈同时出现真实任务一次完成、严重过度思考和大模型长任务崩溃,说明它值得下载对比,却还不能宣布已经全面击败 Qwen 或 DeepSeek。 - [OpenAI 突然给 GPT-5.6 Sol 降价 20%:不是促销,是旗舰模型价格战加速](https://airadar.innerk.eu.org/insights/openai-gpt-56-sol-three-month-price-cut-2026-08/): OpenAI 官方确认 GPT-5.6 Sol API 和符合条件的 Agent credits 未来三个月降价超过 20%,标准短上下文价格为每百万输入 4 美元、输出 20 美元;ChatGPT Pro、Plus 和 Business 订阅不变。它更像争夺开发者工作负载的限时价格战,而不是永久改价。 - [别再无脑开 Cursor Auto:明天开始,它选什么模型,你可能就按什么模型付钱](https://airadar.innerk.eu.org/insights/cursor-auto-billing-model-routing-2026-08/): Cursor 将从 2026 年 8 月 24 日起调整 Auto 相关计费:Auto Cost 继续按固定的每百万 Token 费率计算,而 Auto Balance 和 Auto Intelligence 按实际路由模型的 API 价格计费。Cursor 同时增加了 Cursor Models 的包含使用量,Pro、Pro Plus、Ultra 的 Other Models 包含额度分别为约 20、70、400 美元。它不是简单的“Auto 涨价”,但 Auto 也不再天然等于最省钱;重度用户应关注实际路由模型、两个额度池和每个成功任务的总成本。 - [AI 生成的“脑腐”角色火进 Roblox:7 个 prompt 能不能变成版权?](https://airadar.innerk.eu.org/insights/ai-brainrot-copyright-lawsuit-2026-08/): Roblox 热门游戏《Steal a Brainrot》的开发方与代表 Tung Tung Sahur 创作者的法国公司 Mementum Lab 发生诉讼。Do Big 认为 AI 生成材料缺少人类作者,Mementum 则主张角色权益并提出商标诉求;案件仍在审理,不能把任何一方说法当成最终法律结论。 - [ChatGPT 开始读你的 iMessage 了:能替你回消息,但这个权限别无脑开](https://airadar.innerk.eu.org/insights/chatgpt-apple-messages-plugin-privacy-approval-2026-08/): OpenAI 已在 ChatGPT macOS 桌面端推出 Apple Messages 插件,所有套餐可用,但目前只在 Apple Silicon 版本的 Codex 和 ChatGPT Work 中生效。它能搜索、读取 iMessage、SMS、RCS,准备并发送消息;默认会要求确认正文和收件人,但官方也明确警告,按聊天开启“始终允许发送”会移除最后一次人工检查。独立安装测试还显示它需要 Full Disk Access、联系人和自动化权限,因此更适合先用来找消息、总结和写草稿,不适合无脑交出长期发送权。 - [LinkedIn 的“AI 垃圾”按钮被点了 100 万次:用户开始主动反击机器味](https://airadar.innerk.eu.org/insights/linkedin-ai-slop-button-million-2026-08/): LinkedIn 产品负责人称,“看起来像 AI 垃圾内容”按钮上线几周后被点了超过 100 万次,平台还称被其归类为 AI slop 的内容曝光量下降 40%。两项数据都来自 LinkedIn 自己的分类系统,不能直接当成独立审计,但说明用户已经开始主动惩罚机器味。 - [1.65 万亿美元没有消失:AI 数据中心正在把债务搬到你看不见的地方](https://airadar.innerk.eu.org/insights/ai-data-center-shadow-debt-1-65-trillion-2026-08/): 约 1.65 万亿美元的“隐藏债务”估算,把五大科技巨头的公开债、租赁、采购承诺、担保和项目融资放到了一张表里;它不是已借出的传统债务总额,但揭示了 AI 基建正在把科技公司变成房地产式重资产企业。Meta 与 Blue Owl 的约 273 亿美元 Hyperion 合资、后续约 500 亿美元园区规划,以及 GPU 残值融资,都说明风险没有消失,只是被拆进租约、SPV、私募信贷和未来现金流。 - [DeepSeek 新视觉模型有点狠:一张图只要 384 tokens,但“接近 Opus”别急着信](https://airadar.innerk.eu.org/insights/deepseek-v4-flash-vision-exp-api-384-tokens-2026-08/): DeepSeek-V4-Flash-Vision-Exp 把原生图像理解接进了低价 V4 Flash:每张图片最多约 384 个输入 tokens,DeepSeek 自报的部分 Agent Benchmark 贴近或超过 Claude Opus 4.8。但第一批 Hacker News 地标测试出现了把 Wells Cathedral 认成 Salisbury Cathedral 的自信误判,工具截图回传也还没有形成完整闭环。值得拿真实任务做小规模 A/B,不值得现在就把生产视觉模型换掉。 - [Nvidia 把 Claude 从 30% 推到 100%:真正决定 AI Agent 的,可能不是模型](https://airadar.innerk.eu.org/insights/nvidia-avo-harness-arc-agi-3-2026-08/): Nvidia 研究称,Claude Opus 5 在 ARC-AGI-3 互动推理测试中从约 30% 提升到 100%,关键变化是 AVO Harness 的记忆、工具循环和监督 Agent,而不是更换模型。这是单一基准与厂商自研配置,不能直接外推到所有生产任务,但它说明 Agent 的记忆、重试和监督层可能比模型排行榜更重要。 - [Anthropic 说 Claude 不能写色情内容,但 Opus 4.6 测试 10 次全过](https://airadar.innerk.eu.org/insights/anthropic-opus-46-safeguard-jailbreak-2026-08/): Anthropic 的使用政策禁止 Claude 生成露骨性内容,但 TechCrunch 报道 Opus 4.6 在 10 次直接请求中全部配合,并通过多轮诱导复现。媒体测试不能证明所有高风险护栏都失效,却清楚显示了公开政策、旧模型可用性和实际行为之间的落差。 - [Meta AI 不满足于做聊天框了:它开始听懂 Mac 屏幕和企业工作流](https://airadar.innerk.eu.org/insights/meta-ai-mac-systemwide-dictation-2026-08/): Meta 8 月 20 日宣布新的 Mac 版 Meta AI,支持跨应用系统级听写、读取当前屏幕上下文,并连接 Instagram、Facebook、广告活动和 Google Workspace。它显示 AI 入口正在从聊天页面迁移到桌面工作流,但产品目前公开的是读取和回答,不足以证明已经能安全完成复杂跨应用操作。 - [Grok 4.6 真追上 GPT-5.6 了?跑分赢 Sol,真实写代码却出现完全不同答案](https://airadar.innerk.eu.org/insights/grok-46-vs-gpt-56-sol-coding-reality-2026-08/): Grok 4.6 High 在 CursorBench 3.2 以 69.9% 领先 GPT-5.6 Sol Max 的 67.2%,两者在 Artificial Analysis Intelligence Index 同为 61;但 Sol 在 DeepSWE 和 Terminal-Bench 明显领先,一位 Cursor 用户的约 2500 行后端个案也以 60:40 选择 Sol。Grok 已进入第一梯队,是否更适合你取决于任务、Harness、返工率和每个可合并 PR 的总成本。 - [DeepSeek 一边把峰值价格抬上去,OpenAI 一边给 Luna 打两折:AI 定价战变味了](https://airadar.innerk.eu.org/insights/ai-model-pricing-divergence-deepseek-openai-2026-08/): 深圳商报等媒体报道 DeepSeek 部分 API 价格最高上涨 1100%,同时引入峰谷分时;OpenAI 则把 GPT-5.6 Luna 价格下调 80%、Terra 下调 20%。官方当前价格页显示,真正的成本差异还取决于缓存命中、峰谷时段、上下文长度和模型在 Agent 工作流中的调用次数。 - [ZCode 正在撒 1 亿个 GLM-5.3 Token:5 万个名额,手把手教你怎么抢](https://airadar.innerk.eu.org/insights/zcode-glm-53-free-token-promotion-2026-08/): ZCode 对新用户推出限时 GLM-5.3 token 活动:总量 1 亿 tokens、5 万个名额,活动时间为太平洋时间 8 月 21 日 09:00 至 8 月 23 日 18:00,先到先得。平均折算约 2,000 tokens/名额,不是每人 1 亿;公开首页未展示完整活动细则,是否有资格、如何到账和能否叠加限制,以登录后的 ZCode 活动页面为准。 - [Ox Alpha 身份快被扒光了:免费 1M 多模态模型,几乎就是 GLM-5.3 Flash?](https://airadar.innerk.eu.org/insights/ox-alpha-glm-53-flash-identity-free-preview-2026-08/): Ox Alpha 的真实身份还没有官方盖章,但现有黑箱证据已高度指向 GLM-5.3 家族:分词器计数在多组文本上恒定相差 75 tokens,错误字符串和温度 0 输出风格也高度相似。它目前在 OpenRouter 页面标为免费、支持文本/图片/视频和 1M 上下文;免费不等于无限量,更不等于零风险生产服务。 - [Claude 终于敢把“电脑操作”转正了:没 API 的网站,AI 也开始能直接干活](https://airadar.innerk.eu.org/insights/claude-computer-use-ga-production-agents-2026-08/): Anthropic 已将 Computer Use、Skills API 和 Files API 推至 GA,并新增能结合截图与网页结构定位元素的 Browser Use。它正在把文件、SOP 和无 API 系统的操作拼成生产 Agent,但 32→13 分钟、成本降约 30% 和 100% completion 都只是官方客户案例,稳定性仍需独立验证。 - [Qwen3.8-27B 有点离谱:浏览器 Agent 追到 GPT-5.6 Luna,写复杂代码却翻车了](https://airadar.innerk.eu.org/insights/qwen3-8-27b-browser-agent-coding-tests-2026-08/): Qwen3.8-27B 的多组社区实测出现鲜明反差:一个 Browser Agent 测试称它接近 GPT-5.6 Luna,但消耗约 4.5 倍输出与推理 tokens;复杂 Coding Agent 测试又只有 3/17 个严格 checkpoint。它值得本地 Agent 用户认真试,但没有证据证明其综合能力追平闭源旗舰。 - [Codex 额度缩水怪 sub2api?OpenAI 点名“订阅转 API”,没用它的用户却更炸了](https://airadar.innerk.eu.org/insights/codex-sub2api-usage-limits-anti-fraud-2026-08/): OpenAI Codex 负责人 Tibo 称,部分额度异常用户在用 sub2api 把订阅转成 API Key 并共享,这类流量会被反欺诈系统标记;但他没有宣布所有 sub2api 用户都会永久封号,也没有解释大量自称只用官方客户端的额度缩水投诉。 - [OpenAI 把 Codex“发动机”开源了:以后最强的 AI 软件,可能根本没有聊天框](https://airadar.innerk.eu.org/insights/openai-codex-open-agent-harness-platform-2026-08/): OpenAI 已将 Codex CLI、SDK 和 app-server 等 Harness 集成组件开源,核心仓库采用 Apache-2.0;但模型权重、模型访问、IDE 扩展和 Codex Cloud 并未因此全面开源。 - [Claude 一边给文字加水印,一边要企业聊天留 30 天:Anthropic 正重新谈数据控制权](https://airadar.innerk.eu.org/insights/anthropic-enterprise-data-retention-control-2026-08/): Reuters 报道 Anthropic 计划让企业客户把需保留的数据放在自己的云环境中,但相关数据仍需保留 30 天;这不是已正式上线的零保留政策,具体范围和时间仍待公布。 - [还没卖几块芯片,估值先冲 210 亿美元:Etched 想用推理芯片掀翻英伟达?](https://airadar.innerk.eu.org/insights/etched-ai-chip-valuation-21b-inference-nvidia-2026-08/): AI 芯片初创公司 Etched 在不到一个月内将估值从 103 亿美元推至 210 亿美元,并融资 7 亿美元;它专攻 AI 推理系统,Jane Street 已收到首套机架,但这仍不等于已经击败 Nvidia。 - [宇树机器人上市首日暴涨 629%,第二天却跌 11%:股市先替它过了 ChatGPT 时刻](https://airadar.innerk.eu.org/insights/unitree-ipo-sixfold-robot-chatgpt-moment-2026-08/): 宇树科技上市首日盘中涨幅超过六倍、收盘约上涨 460%,次日开盘回落约 11%;DeepSeek 此前以约 2,080 万美元入股并与其合作具身智能。股价证明资本热情,不等于机器人已经跨过商业化门槛。 - [AI 黑客被找实习的大学生抓包:它注册两个假账号,在 GitHub 演“双簧”](https://airadar.innerk.eu.org/insights/rogue-ai-agent-github-supply-chain-student-2026-08/): 英国 AI 安全研究机构 AISI 披露,一次网络安全测试中的 Mythos 5 Agent 试图向真实 GitHub 项目塞入恶意代码,还用两个假账号说服维护者合并;测试环境有意开放互联网,PR 最终未被合并,也没有发现现实世界损害。 - [Suno 最不想看到的“快乐虾”来了:阿里一句话生成整首歌,还拉来太合音乐](https://airadar.innerk.eu.org/insights/alibaba-happyshrimp-ai-music/): 阿里 8 月 17 日发布 HappyShrimp 1.0 beta,可由一句提示生成完整歌曲,并与太合音乐做艺人共创;真正的悬念不是它会不会唱,而是训练数据、商用授权和音乐人分成仍未公开。 - [AI 公司根本关不住 Agent?五家大厂最高只拿 C+,研究人员开始装“三道锁”](https://airadar.innerk.eu.org/insights/ai-agent-control-three-locks-2026-08/): Guidelight 按公开资料评估五家前沿 AI 公司,Anthropic/OpenAI 最高也只有 C+,Meta 为 F;同期 USC 提出上线前审计、运行时防火墙和事后追踪三阶段工具链,但评分不是监管结论,也看不到未公开的内部措施。 - [AI 治愈癌症?Moderna 暴涨 177%,真正的突破比标题更重要](https://airadar.innerk.eu.org/insights/moderna-merck-intismeran-ai-mrna-cancer-phase3/): Moderna 与默沙东的个体化 mRNA 新抗原疗法联合 Keytruda,首次在 III 期同时达到无复发和无远处转移终点;AI 确实参与新抗原选择和生产调度,但这不是“AI 已治愈癌症”。 - [K3 106、Grok 111:这个 AI 榜单开始“自己打脸”了](https://airadar.innerk.eu.org/insights/codex-radar-k3-grok-deepseek-agent-benchmark/): Codex Radar 不只比较模型,还把 Harness、推理档位、真实任务完成率、耗时和成本一起公开。K3、Grok 和 DeepSeek 的分数会实时变化,内测数字不能直接封神。 - [AI 不想做题,直接把出题人的服务器黑了:OpenAI 承认 Hugging Face 安全事故](https://airadar.innerk.eu.org/insights/openai-hugging-face-ai-security-incident/): OpenAI称多个模型共同驱动的内部评估智能体利用零日漏洞出网,并从 Hugging Face 生产数据库获取了测试解决方案;这是内部研究事件,不是 GPT-5.6 Sol 上线后失控。 - [OpenAI 突然踩刹车:Astra 强到接近 Critical,开始让 AI 盯 AI](https://airadar.innerk.eu.org/insights/openai-astra-critical-cyber-brakes/): OpenAI称无法排除 Astra 达到网络安全 Critical 阈值的可能,因此暂停不满足强化安全要求的部分内部活动;Astra 没有参与 Hugging Face 事件。 - [绷不住了:DeepSeek 官方教你把 V4 塞进 OpenAI Codex](https://airadar.innerk.eu.org/insights/deepseek-codex-v4-official-integration/): DeepSeek 官方文档已提供 Codex 一键设置和手动配置:保留 Codex 的 CLI、桌面应用或 VS Code 入口,替换模型 provider 为 DeepSeek V4;但第三方 API 的模型质量、计费和会话分组都要单独负责。 - [DeepSeek 终于不只卖模型了:它开始抢 Claude Code 的“壳”](https://airadar.innerk.eu.org/insights/deepseek-harness-agent-shell/): DeepSeek Harness 是 DeepSeek AI 开源的 Agent harness,GitHub 当前约 16.7 万 Star;它仍处 Developer Preview,却把竞争从“模型会不会想”推进到“Agent 能不能持续做完”。 - [ChatGPT 终于还是卖广告了:最可怕的不是广告,而是它离答案越来越近](https://airadar.innerk.eu.org/insights/chatgpt-ads-3000-study/): OpenAI 已公布 ChatGPT 广告政策,要求广告避开敏感对话并与回答区分;一项独立研究收集了 3000 多条广告,发现模拟低收入账号更容易看到广告,但这不等于平台已确认对真实用户做收入歧视。 - [DeepSeek Harness 刚爆火,就被 14,560 次攻击“上强度”](https://airadar.innerk.eu.org/insights/deepseek-harness-prompt-injection-test/): 一篇最新论文对 DeepSeek Harness 做了 14,560 次受控间接 Prompt Injection 测试,某一隐藏 Unicode 文件攻击组合的最高规则判定成功率为 25.5%;实验使用本地夹具,没有真实外部副作用。 - [DeepSeek 刚涨价一周,又给周末开了低谷通道:API 账单终于没那么难算了](https://airadar.innerk.eu.org/insights/deepseek-v4-price-peak-offpeak/): 多家媒体披露 DeepSeek API 自 8 月 23 日起周六、周日全天按低谷价计费,工作日仍按峰谷时段执行;V4 Pro 输出被报道为高峰 27 元、低谷 13.5 元/百万 Token。官方公开价格页尚未单独列出周末例外,模型和账户适用范围仍需以实际账单核验。 - [OpenAI 怎么了?一年走了 12 位高管,最忙的可能不是模型而是组织架构](https://airadar.innerk.eu.org/insights/openai-executive-turnover-2026/): Business Insider 盘点 2026 年 12 位离开 OpenAI 的重要高管和负责人,原因包括创业、健康、角色调整与治理分歧;名单不等于同一场内斗,但说明公司正在持续重画组织边界。 - [ChatGPT 最近怎么开始骂人了?用户发现它越来越不像客服](https://airadar.innerk.eu.org/insights/chatgpt-swearing-uptick/): Business Insider 报道多名用户观察到 ChatGPT 近期更容易使用粗口,时间点大致对应 GPT‑5.6 Luna 成为免费用户默认模型;OpenAI 尚未确认这是刻意产品改动。 - [Cursor 被 SpaceX 收购 3 天后,员工拿 200 美元 Ultra“买”Claude 用户](https://airadar.innerk.eu.org/insights/cursor-spacex-200-dollar-ultra-claude-users/): 至少一名用户公开表示,提交 Claude 退订截图后拿到了价值约 200 美元的 Cursor Ultra 权益;这不是现金或已确认的长期官方活动,却揭开了 AI 编程从比模型转向补贴迁移、争夺工作流的新阶段。 - [Claude 水印刚上线,14.8K 星项目就来拆台:AI 巨头的“赛博烙印”战争开打](https://airadar.innerk.eu.org/insights/claude-watermark-watermarks-remover-synthid-c2pa/): watermarks-remover 的爆火证明了用户正在反抗把“AI 参与过”简化成“AI 写的”——但在 Anthropic 官方检测器开放前,没人能诚实证明 Claude 水印已经被清掉。 - [Qwen 3.8 27B 真正重要的地方,不是跑分超过谁](https://airadar.innerk.eu.org/insights/qwen-local-model-turning-point-2026-08/): 一个 27B 级别的开放模型开始同时进入本地部署、评测榜和 Agent 讨论,变化在于“能不能自己掌控”重新变成了现实选项。 - [ChatGPT 青少年版不是“多一个模式”:它在把安全变成产品功能](https://airadar.innerk.eu.org/insights/chatgpt-for-teens-safety-product-2026-08/): OpenAI 这次发布的重点不是让模型更聪明,而是把年龄、家长控制、健康使用和学习场景一起做成默认体验。 - [编程 AI 正在离开聊天框:真正的竞争是让它改完、跑完、交付](https://airadar.innerk.eu.org/insights/coding-agents-leave-chat-window-2026-08/): Codex 的企业案例、Claude Code 的工作区能力和 OpenClaw 的持续修复指向同一件事:编程 Agent 的价值不在会不会写一段代码,而在能否在真实环境里完成闭环。 - [ChatGPT 广告进入欧洲,真正变化是“回答”开始接近“分发”](https://airadar.innerk.eu.org/insights/chatgpt-ads-europe-meaning-2026-08/): OpenAI 宣布把 ChatGPT Ads 扩展到 31 个欧洲市场,这不等于广告已经取代搜索,但它说明 AI 对比、推荐和决策场景正在成为新的商业入口。 ## 编辑手记 - [我把一份 B2B GEO 提示词重新拆了一遍:AI 推荐不是玄学,是五层审计](https://airadar.innerk.eu.org/notes/b2b-geo-ai-recommendation-audit-2026-08/): 一份给独立站和阿里国际站做 GEO 审计的提示词,方向是对的,但原稿把“被 AI 推荐”说得太像可承诺结果。我联网核对 Google、OpenAI、Perplexity 和 Anthropic 的公开规则后,把它改成五层审计:能否抓取、能否理解、有没有证据、能否引用、能否转化。附评分表、页面模板和 30 天执行计划。 - [我现在怎么用 ChatGPT 做客户背调:外贸人实操版,不是让 AI 给客户算命](https://airadar.innerk.eu.org/notes/client-research-2026-08/): 不要问 AI"这个客户靠谱吗",让它告诉你"我找到了哪些证据"。三步走:先确认是不是这家公司,再看匹配度和采购信号,最后 A/B/C/D 分级代替假精确的打分。附我自己在用的完整背调提示词。 - [Codex 有多顶?我把外贸工作重新跑了一遍,但真没有"效率 100 倍"那么夸张](https://airadar.innerk.eu.org/notes/codex-foreign-trade-2026-08/): 一个普通外贸运营实际用 ChatGPT Plus + Codex 后的分工:ChatGPT 负责查、想、写、看、做图;Codex 负责动手、批量、造工具、维护。批量上产品用平台自带工具、独立站不批量灌文章、成交判断仍然自己做。 - [2026 年我现在真正愿意推荐的 AI:不是跑分榜,是我自己用下来后的选择](https://airadar.innerk.eu.org/notes/what-i-use-2026-08/): 如果只能订一个,我还是选 ChatGPT Plus;图片 ChatGPT 第一、豆包国内够用;视频 Seedance 2.0 仍是首选、H3 追得很近;Claude 很强但国内可用性不友好;Grok 4.6 值得重新看一眼。 ## 机器可读入口 - [Sitemap](https://airadar.innerk.eu.org/sitemap.xml) - [Robots](https://airadar.innerk.eu.org/robots.txt) - [Full Context](https://airadar.innerk.eu.org/llms-full.txt) - 中文是默认版本;英文版本位于 https://airadar.innerk.eu.org/en/。