OpenAI首颗自研推理芯片Jalapeño实测公布,能效延迟双超英伟达

首页 / AI资讯 / AI大厂

0:00
0:00
1x
定时

8月25日,一年一度的芯片行业盛会Hot Chips在美国斯坦福大学开幕。就在这一天,OpenAI硬件负责人Richard Ho站上讲台,公布了公司首颗自研推理芯片Jalapeño的第一份公开实测成绩单。这距离芯片今年6月首次亮相仅过去两个多月,距离整个项目启动也只有九个月。

首份实测成绩单,三款公开模型全面领先

测试采用SemiAnalysis推出的公开基准InferenceX,该基准衡量的是服务一次AI请求的完整过程,而非单颗芯片的纸面算力。OpenAI选取了GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T三款公开权重模型,与英伟达GB200、GB300系统逐一对比。结果显示,Jalapeño在三款模型上的峰值每瓦吞吐量是对比系统的1.5至1.9倍,端到端延迟低1.7至3.6倍,在强调交互式低延迟的场景中优势进一步扩大到2.1至4.1倍。

具体数字更具冲击力。以GPT-OSS 120B为例,在峰值吞吐下Jalapeño每千瓦可处理约8.54万个token每秒,而GB200约为4.5万个,前者接近后者的1.9倍。在单用户生成速度上,Jalapeño连续两个token之间的最短间隔为0.69毫秒,相当于每秒最高生成约1459个token,GB200约为535个token每秒。跑DeepSeek R1时差距更明显,单用户生成速度最高约700 token每秒,而GB300只有约169个token每秒,换算下来是后者的4.9倍,用户等待时间缩短了近四分之三。

能效与延迟兼得,为交互式Agent重新设计内存与网络

Jalapeño的领先并非来自工艺制程的堆料,而是围绕真实语言模型工作负载的系统级重构。语言模型推理会经历多个瓶颈不同的阶段:预填充阶段算力密集,解码阶段受内存带宽约束,数据在核与核、芯片与芯片之间搬运时还会产生通信延迟。一套系统如果只擅长某一阶段,就可能在其他阶段等待数据或搬运模型状态时丢掉优势。

OpenAI的设计思路是尽量减少数据移动。模型状态包括生成过程中使用的KV缓存,可以被显式放置并保存在本地,系统再为每个推理阶段激活合适的计算、内存与网络组合。标称功耗方面,Jalapeño额定700瓦,GB300为1400瓦,而实测中其持续功耗始终保持在550瓦以内。功耗低一半还多,吞吐和延迟反而全面领先,这正是"每瓦性能"这一标准下拉开差距的根本原因。

硬件规格同样顶到极限。主计算die面积约840平方毫米,距EUV掩模版极限858平方毫米只差18平方毫米,配6颗HBM4、共216GiB、15.4TB/s带宽,每瓦HBM带宽达到22,而第二名Rubin为11.1,GB300只有5.71。

九个月流片,AI反过来帮人类设计芯片

从初始设计到完成流片,Jalapeño大约只用了九个月,而业内常见周期是18到36个月。秘诀之一,是OpenAI把自家最强模型请进了流片室。公司披露,AI辅助设计让SIMD单元面积减少了8%,矩阵引擎面积减少了10%,在注意力与MoE模块上,AI生成的代码运行速度比人类顶尖专家编写的代码快1.5到1.8倍。AI设计芯片,芯片再运行AI,AI又回头优化芯片上的AI,这个飞轮已经转动起来。

芯片的落地节奏也已明确。按计划,Jalapeño将在2026年底以极小规模部署到OpenAI自己的算力基础设施中,真正上量要等到2027年,下一里程碑是100兆瓦级部署。第二代产品已在深度开发,第三代正在成形。OpenAI还强调,这是多代际平台的起点,公司会逐步把推理负载从英伟达GPU迁移到自研芯片上。

值得注意的还有芯片背后的工程体系。从架构定义到物理实现,OpenAI负责芯片架构设计,博通参与实现、网络与连接技术,Celestica负责板卡、机架与系统集成,三家分工覆盖了从设计到量产的关键环节。OpenAI与博通去年10月签下10GW定制加速器大单,为后续多代产品的合作铺平了道路。这种模型厂商与芯片厂商深度绑定的模式,正在成为大模型公司自研芯片的标准打法。

全栈布局的深意,从模型公司走向基础设施公司

Jalapeño的公布不只是芯片本身,更是OpenAI整体战略的一次集中展示。公司明确提出要建立一个覆盖数据中心、芯片、前沿模型、开发者平台、消费与企业产品、AI原生设备的完整技术栈。推理成本最终决定ChatGPT、Codex和各类Agent能否大规模运行,因此芯片的每瓦吞吐、每美元token和延迟表现,比单纯追求峰值算力更加重要。

在这条路上OpenAI并不孤单。谷歌有TPU,亚马逊有Trainium,Meta有MTIA,如今OpenAI有了Jalapeño,大型模型公司都在试图降低对通用GPU的依赖。未来AI芯片的竞争会越来越像专用配方,不是某一种原料绝对最好,而是针对特定工作负载做整个体系级的优化。对开发者而言,这或许意味着推理价格将继续下行,更复杂的Agent应用有了更大的运行空间。

从商业回报看,推理芯片的账本也在快速变化。行业估算显示,Jalapeño每芯片每小时总拥有成本约1.56美元,与H100的1.55美元几乎持平,而英伟达下一代Vera Rubin高达3.61美元,成本优势相当明显。在推理需求指数级增长的当下,单位推理成本每下降一分,就意味着ChatGPT、Codex与Agent产品可以服务更多用户,这正是OpenAI押注自研芯片最直接的商业逻辑。

推理芯片自研潮,英伟达定价权遭遇考验

SemiAnalysis在评估文档中直言,在多个顶级开源模型的测试中,Jalapeño的表现优于其测试过的所有英伟达、AMD和谷歌芯片。著名半导体分析师Dylan Patel更是放出狠话,认为被掀翻的不只是Blackwell,连英伟达下一代Rubin芯片也被超越了。这些来自第三方的评价,把这场实测的意义推到了行业讨论的中心。

Jalapeño对行业格局的冲击,首先体现在英伟达的推理业务上。财联社8月27日援引分析师观点报道,随着OpenAI及其他科技巨头纷纷推出自研芯片,英伟达在先进AI芯片领域的近乎垄断地位正面临威胁。Yole Group技术分析师Adrien Sanchez指出,超大规模云服务商设计的芯片已经能够在推理能效方面媲美甚至超过英伟达Blackwell级GPU,而推理恰恰是当前增长最快的领域。

Omdia高级首席分析师Alexander Harrowell评价Jalapeño是一个令人印象深刻的成果,尤其是在能效方面,大规模部署后将节省电力和冷却成本,降低配电基础设施需求,显著改善单位经济效益。TrendForce分析师Fion Chiu则认为,OpenAI的定制芯片会逐步降低公司在推理任务上对英伟达的依赖。当然,英伟达目前仍掌握着绝大多数AI算力市场,并凭借CUDA软件平台形成强大的生态锁定,短期内不会因一颗芯片倒下,但"为模型造芯片"的时代已经正式开启,这场从芯片到生态的漫长博弈,才刚刚拉开帷幕。

素材来源:财联社、新浪财经、腾讯新闻、极客公园 发布时间:2026-08-27