OpenAI发布Jalapeño ASIC:9个月流片,效率驱动推理

OpenAI发布推理专用ASIC Jalapeño。该芯片借助AI辅助设计,仅用9个月完成从零到流片,确立新基准。其核心驱动力是在电力受限下最大化单位功耗的智能输出,兼顾低延迟与高吞吐量。

OpenAI 硬件副总裁 Richard Ho 谈 Jalapeño ASIC:效率驱动与 AI 辅助设计新基准

2026 年 8 月,OpenAI 在 Hot Chips 大会上正式发布了其名为 Jalapeño 的推理专用 ASIC。该芯片依托人工智能辅助设计技术,实现了极短的设计周期。Toms Hardware 高级 CPU 分析师 Jake Roach 专访了 OpenAI 硬件副总裁 Richard Ho,深入探讨了这款芯片背后的研发逻辑、供应链策略以及未来路线图。

9个月从零到流片

核心驱动力:电力受限下的效率最大化

针对开发自研 ASIC 的具体动因,Richard Ho 明确指出是“效率”。随着 Sam Altman 所言的计算瓶颈日益凸显,数据中心可获取的电力成为限制因素。OpenAI 的核心目标是在有限的算力和电力约束下,尽可能高效地为用户提供智能服务。

Ho 解释道:“我们专注于推理而非训练,因为用户更关心 ChatGPT 或 Codex 的响应速度。Jalapeño 的设计兼顾了低延迟和高吞吐量,通过优化推理设备来最大化单位电力下的智能输出。”

内部共建优势:模型与硬件的协同设计

相较于直接采购市场现有产品,OpenAI 选择自研的关键在于“共同设计”的机会。Ho 强调,模型中存在大量不可公开分享的研究知识产权,即便签署保密协议也存在泄露风险。内部团队拥有对软件堆栈和硬件架构的全景视野,能够精准判断哪些优化应在模型层面进行,哪些应下沉至硬件层面。

这种可见性使得 Jalapeño 能够针对特定应用进行深度优化。Ho 澄清了一个常见误解:Jalapeño 并非仅适用于 OpenAI 自有模型。通过 SemiAnalysis 的 InferenceX 基准测试,OpenAI 证明了该芯片同样能高效运行开源 Transformer LLM 模型。此外,编程易用性也是亮点之一,团队在拿到芯片后两个月内即完成了开源模型的适配与结果呈现。

尽管具备对外服务能力,但 Ho 表示,鉴于 OpenAI 内部计算需求随日活/周活用户增长及新功能发布而持续膨胀,首要任务仍是满足自身需求。“这不是说它不能用于其他场景,但目前我们的优先级是确保内部算力供给。”

AI 辅助设计确立新基准:9个月从零到流片

Jalapeño 的开发周期仅为 9 个月,这一速度在传统芯片设计中难以想象。Ho 认为这确立了新的行业基准。传统上,即使基于现有 IP 或旧架构,设计周期也需 18 个月至两年,而 Jalapeño 是从零开始,无任何参考代码。

这一突破得益于 AI 工具(如 Codex 及早期 Sol 模型)的深度介入。从 2025 年 11 月启动项目到次年 5 月内核首次上线,AI 模型能力显著提升。特别是在最后两个月的基准测试冲刺阶段,工程师们惊讶地发现 AI 在内核优化方面的潜力远超预期。

Ho 强调,AI 并未取代工程师,而是让小型精英团队变得“超级富有成效”。“这是 AI 时代工程实践的正确范式:优秀工程师结合强大 AI 工具,实现更快、更好的交付。”

在工具链方面,OpenAI 依然使用 Cadence 和 Synopsys 等标准 EDA 流程以确保结果准确性,但通过 AI 优化了这一组合流程。

供应链策略与行业影响

关于是否向外部开放 AI 辅助设计流程,Ho 透露行业内对此兴趣浓厚。OpenAI 计划在适当时机分享其在缩短时间表和提升性能方面的经验,旨在提高整个行业的生产力,因为更高效的计算基础设施最终也将惠及 OpenAI 自身。

面对全球芯片供应紧张的局面,Ho 承认两年前曾游说供应商扩大产能未果,但随着新基准的确立,存储、逻辑晶圆及 SSD 等组件的供应链正在响应,尽管完全缓解仍需数年。OpenAI 已提前布局,目前处于良好的供应状态。

架构选择:务实规避风险

在配套平台选择上,Jalapeño 采用了 Nvidia 的 Turing 架构而非更新的 Vera Rubin。Ho 解释称,这是为了降低风险并加速设计进程。Vera 作为独立组件成熟度稍逊,而团队对 Turing 已有合作经验。对于 Jalapeño 而言,务实决策优于追求最新技术带来的不确定性。

谈及长期愿景,Ho 指出 OpenAI 的“北极星”指标是最低的基础设施成本,而非单纯依赖自研芯片。“如果第三方合作伙伴能提供更具性价比的设备,我们会毫不犹豫地将其纳入车队。只要保持客观评估,不陷入‘既然造了就必须用’的思维定势,就能做出对用户最有利的选择。”

技术细节:推测解码与长上下文表现

针对未在当前基准中展示推测解码(Speculative Decode)的问题,Ho 澄清该功能已在硬件层实现,只是由于时间紧迫,未能完成配套草稿模型的训练以进行公开基准测试。实际上,多令牌预测(Multi-token Prediction)预计将带来 3-5 倍的性能提升,这部分成果将在生产环境中逐步释放。

Hot Chips 的展示本身也是一个意外之喜。原本未计划参与,但在芯片回片验证成功后,团队在最后期限前争取到了演讲机会。此外,虽然公开基准主要基于 8K/1K 上下文窗口,但内部测试显示,随着上下文长度增加和模型规模扩大,Jalapeño 相对于现有设备的性能优势进一步扩大。

值得注意的是,对比对象 Grace Blackwell 是目前公开数据中最强的竞品,但实际部署时将面对未来的 Vera Rubin 甚至 Ultra 版本。出于保密原因,OpenAI 不会公布针对这些未发布竞品的内部测试结果。

量产节奏与未来路线图

Jalapeño 将于今年下半年小批量爬坡,主要用于生产环境验证,大规模放量预计在 2027 年。

对于下一代 Jalapeño 2 的时间表,Ho 明确表示反对“日历式流片”。每一代产品必须带来性能功耗比、原始性能或延迟上的阶跃式改进。流片时机取决于 HBM 代数、SerDes 类型或光互联等技术成熟度,而非固定周期。

“我们不会为了更新而更新,如果新设备仅比上一代好 2%,更换整个机队并不划算。”Ho 总结道,“关键在于花足够时间定义正确的设备,一旦确定,就利用 AI 加速执行,快速推向市场。”

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读