AI Radar先替你读,再把 AI 变化讲明白
EN
OpenAI 芯片反攻

OpenAI 用英伟达 GPU 上的模型造芯片,第一代就把 Blackwell 压到了身后

最后更新 2026-08-26编辑综合:多条来源拼接后再下判断不是快讯搬运;事实、判断和未知分开写
OpenAI Jalapeño 第一代推理芯片与英伟达 GB200、GB300 每瓦效率和延迟对比的原创信息图
编辑绘图:Jalapeño 在 OpenAI 公布的三组 InferenceX 测试中,每瓦工作量高出对照系统 1.5–1.9 倍;它仍是工程样片,Rubin 与长上下文 Agent 测试尚未完整对比。
一句话结论

OpenAI 8 月 25 日公布首颗自研推理芯片 Jalapeño 的实测:在 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 的固定 8k/1k InferenceX 测试中,其峰值每瓦工作量比英伟达 GB200/GB300 高 1.5–1.9 倍,端到端延迟低 1.7–3.6 倍。结果很强,但芯片仍是工程样片,数字由 OpenAI 提供,Rubin、长上下文和多轮 Agent 负载尚未完整验证。

结论

OpenAI 真的把第一颗自研推理芯片做出来了,而且第一张成绩单相当凶。

8 月 25 日公布的结果里,Jalapeño 跑 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5,峰值每瓦工作量比对照的英伟达 GB200、GB300 高 1.5–1.9 倍,端到端延迟低 1.7–3.6 倍。DeepSeek R1 在单用户低并发下达到约 700 tokens/s,GPT-OSS 更接近 1,459 tokens/s。

但“OpenAI 一出手就打败英伟达、AMD、Google 所有芯片”说过头了。公开附录直接对比的是 GB200 和 GB300,不是完整的 Rubin、AMD 与 TPU 同条件大赛;测试还是固定 8,000 输入、1,000 输出 tokens。Jalapeño 现在也只是工程样片。

真正的新闻是,一家模型公司开始把手伸进英伟达最厚的利润层,而且它拿来挖墙脚的工具,恰好是先跑在英伟达 GPU 上的 AI。

六月只亮了芯片,八月终于交卷

OpenAI 和 Broadcom 在六月第一次公开 Jalapeño。当时只有一句很大胆的话:早期测试的每瓦性能将明显高于现有先进硬件。没有规格表,也没有可读的跑分,外界只能先记账。

两个月后,OpenAI 把三组公开模型搬上 InferenceX。这个测试看的是一整套推理系统怎么处理请求,不只数单颗芯片的理论算力。它同时画出吞吐量、功耗和用户等待时间之间的关系。

结果不是小胜。GPT-OSS 120B 的峰值 mixed tokens 每千瓦是 85,448,对照 GB200 为 44,960;DeepSeek R1 是 19,641,对照 GB300 为 11,781;Kimi K2.5 是 18,195,对照 GB300 为 11,862。

Jalapeño 标称 700W,三项负载中的持续实测功耗没有超过 550W。数据中心现在最缺的常常不是再买一块卡的钱,而是能接进机房的电。每一兆瓦多吐多少 token,最后会直接变成收入和 API 成本。

700 tokens 每秒很猛,但别拿一个数字包打天下

DeepSeek R1 的最低 token 间隔从 GB300 的 5.90ms 降到 1.43ms,对应单用户生成速度从 169 升到约 700 tokens/s。Kimi K2.5 约 694 tokens/s,GPT-OSS 则达到 1,459 tokens/s。

这些速度来自低并发、固定长度和单 token 预测,没有使用多 token 预测或推测解码。它说明 Jalapeño 很会处理追求即时反馈的推理,却不等于一个繁忙 API 在全天真实流量下也会让每位用户稳定看到 700 tokens/s。

SemiAnalysis 的团队到 OpenAI 实验室看过测试运行,但也写下限制:原始数字由 OpenAI 提供,他们没有跑完全部 InferenceX,更没有看到更接近长上下文、多轮 Agent 的 AgentX。8k/1k 是一张漂亮的短跑成绩单,还不是马拉松。

它能跑 DeepSeek 和 Kimi,说明不是 OpenAI 专用插座

Jalapeño 从一开始就为大语言模型推理设计,但没有锁死 OpenAI 自家模型。三组测试横跨 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T,模型架构和开发者都不同。

这并不意味着随便把任何模型扔进去就能满速跑。OpenAI 明说,每加入一个模型家族,仍要写新 kernel、做模型专用优化。差别在于这套硬件和编程模型让优化变得更快。SemiAnalysis 甚至看到了 Codex 用提示词把 Doom 移植过去。能跑游戏没什么商业意义,但很能说明它不是一块只认 ChatGPT 的黑盒。

最有戏剧性的一幕:AI 开始给自己的饭碗造炉子

OpenAI 官方说,Jalapeño 从正式设计到流片用了九个月。SemiAnalysis 所说的约 16 个月,是从 2024 年中开始招团队算起。两个数字不是冲突,只是起点不同。

AI 不只在旁边写会议纪要。OpenAI 用模型探索电路实现、缩短设计和验证循环,还优化了算术电路。流片之后,团队又用 Codex 和 GPT-Astra,在两个月内把三个原本不在生产计划里的开源模型调到高性能。

在 GPT-OSS 的部分 attention 和 MoE 模块上,AI 生成的实现比原有人类专家版本快 1.5–1.8 倍。注意,是“部分模块”,不是整颗芯片或完整模型快 1.8 倍。

这幅画面确实有点黑色幽默:OpenAI 的模型先吃着英伟达 GPU 长大,再帮工程师设计和编程一颗减少英伟达依赖的 ASIC。

英伟达的 CUDA 护城河被炸了吗

还没有。Jalapeño 证明了 OpenAI 可以在选定推理负载上做出很强的第一代芯片,却没有证明它能替代 GPU 的全部工作。

GPU 能训练、推理,也能应付不断变化的软件和计算任务。Jalapeño 目前专注推理。OpenAI 自己也说,未来仍会大规模部署英伟达和其他伙伴的加速器。它想得到的是选择权和议价权,不是明天把英伟达从机房赶出去。

Rubin 也不能被一句“超过了”草草带过。SemiAnalysis 认为 Jalapeño 的部分每瓦结果可以压过英伟达公布的早期 Rubin 数字,同时承认比较并不完整:Rubin 已开始向客户出货,Jalapeño 仍在工程样片阶段;两边的软件成熟度、预测方法和测试条件都没有完全对齐。

真正的战场从模型榜单挪到了电表后面

OpenAI 过去买算力,现在开始自己设计芯片、内存路径、网络、kernel 和机架系统。它不需要 Jalapeño 在所有任务上获胜,只要高频推理成本下降,就能让 ChatGPT、Codex 和 API 多跑很多步。

这也是为什么每瓦性能比单芯片峰值更值得看。Agent 会连续调用模型、读写缓存、运行工具。一次回答省下的电不显眼,数亿次调用叠起来,就会影响服务价格、响应速度和公司毛利。

OpenAI 计划在 2026 年底前把 Jalapeño 放进自家基础设施;SemiAnalysis 称量产将在 2027 年逐步爬坡,主要产出集中在年底,并把 100MW 视为下一阶段目标。能不能把实验室里的好看曲线复制到成千上万颗芯片,才是下一场考试。

我们的判断

Jalapeño 还没“击败英伟达帝国”,但它已经让一个老说法站不住了:第一代自研 ASIC 必然要交几年学费,模型公司永远绕不开 CUDA。

OpenAI 用九个月完成设计到流片,三个月拿出能测的芯片,又用 AI 加速模型适配。哪怕最后只有部分流量迁走,它也能逼供应商重新谈价格,并把模型、软件和硬件的反馈循环握在自己手里。

对普通用户,短期内不会出现一张 Jalapeño 显卡。更现实的影响是,未来 ChatGPT 和 Codex 可能更快、更便宜,或者在同样价格下允许 Agent 多走几步。对英伟达,麻烦也不是突然少卖一万张卡,而是最大客户之一开始拥有可用的第二条路。

仍然要观察

  • Rubin、AMD 和 Google TPU 在同一公开套件、同一模型与同一预测方式下的完整结果;
  • 长上下文、多轮 Agent、缓存命中变化和高并发生产流量下是否仍领先;
  • 2027 年良率、HBM4 供应、机架可靠性和 100MW 部署进度;
  • OpenAI 是否把成本优势传给 API 用户,还是主要留在自身毛利;
  • Gen 2、Gen 3 能否继续保持九个月级的迭代速度;
  • 英伟达的软件生态是否会用更快的模型适配和新推理方案追回差距。

来源与证据边界

  • 一手来源:OpenAI 的性能报告和附录,支持三组 InferenceX 数字、功耗、AI 辅助设计与部署计划;
  • 独立芯片分析:SemiAnalysis 到实验室见证运行,并提供架构、Doom、16 个月项目周期、2027 爬坡与 100MW 信息;
  • “压过 Blackwell”只适用于公开的固定 8k/1k 推理测试,不代表所有芯片、模型、负载和量产系统。