适合读者:关心 AI 基础设施、大模型成本和产品速度的开发者与行业观察者。核心结论是:Jalapeño 的首批数据很亮眼,但它证明的是 OpenAI 在公开基准上测得更好的“推理系统”,不是自研芯片已经全面取代 GPU。
时间线:新闻是首批性能结果,不是芯片刚刚诞生
Jalapeño 于 2026 年 6 月 24 日由 OpenAI 与 Broadcom 公布,定位是专为大语言模型运行阶段设计的推理加速器。2026 年 8 月 25 日,OpenAI 才发布第一批详细性能结果。本文更新于 2026 年 8 月 26 日,讨论的是“首批实测公布”,而不是把两个月前的发布重新包装成当日新品。
Broadcom 的联合材料显示,这款芯片从设计到流片用了九个月,OpenAI 负责面向模型和服务需求的架构设计,Broadcom 与合作伙伴负责芯片实现、网络和系统集成。这更准确地说是软硬件共同设计,不是一家软件公司独立完成了整条芯片供应链。
数据说了什么
OpenAI 使用 SemiAnalysis 的公开 InferenceX 基准,测试了 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三个公开模型。按其公布数据,Jalapeño 在峰值吞吐量下,每瓦完成的 AI 工作量是对比系统的 1.5 至 1.9 倍,端到端延迟则低 1.7 至 3.6 倍;在高互动负载中,性能高 2.1 至 4.1 倍。
这里有三个容易被标题忽略的限定。第一,数字来自 OpenAI 自己的测试与披露,使用了公开基准,但不等于多家独立实验室已复现。第二,能效比较按各加速器公布的芯片功率归一化;Jalapeño 额定 700 瓦,OpenAI 称测试持续功率不超过 550 瓦。第三,基准结果不等于大规模生产环境中的综合成本,后者还包括良率、网络、机架、散热、软件成熟度与稳定运维。
为什么推理芯片值得单独设计
模型训练是学会能力,推理则是每一次用户请求到达后真正运行模型。推理内部也不是单一问题:处理提示词的 prefill 更吃计算,逐词生成的 decode 更容易受内存带宽限制,多芯片之间搬运模型状态又会引入通信延迟。
Jalapeño 的思路是把芯片、内存、网络、编译与服务软件当作一个整体,尽量减少数据搬运,并让 KV cache 等模型状态保持在合适的位置。这种设计对智能体尤其重要:一个任务要串行经过许多次模型调用,单次节省的延迟会在整条工作流中累积。
对开发者和用户的实际影响
短期内,用户不会因为一组基准数字就立即获得更便宜的 API 或全面提速。OpenAI 计划在 2026 年底前开始将 Jalapeño 部署到自有计算基础设施,而生产资格认证、软件完善和更多模型验证仍在继续。所以,现在更值得关注的不是猜测某个产品哪天降价,而是观察三个后续指标:实际部署规模、真实服务可用性,以及成本下降是否传导给 API 与产品价格。
对开发者而言,这组结果还提醒了一个架构事实:评估 AI 服务不能只看单次 token 速度。对需要反复调用工具的 agent,应同时测量首 token 延迟、每步尾延迟、并发时的吞吐和整个任务的完成时间。硬件芯片的优势,只有通过服务软件和产品调度传导下来,才会变成用户能感知的改善。
现在不能下的三个结论
第一,“OpenAI 已经摆脱 NVIDIA”不成立。Jalapeño 是推理芯片,不负责训练新模型。OpenAI 也明确表示将继续在训练和推理中广泛部署 NVIDIA 及其他伙伴的加速器。
第二,“基准领先就等于综合成本最低”不成立。现有公开数据侧重吞吐、延迟与功率,还不足以计算芯片研发、制造、折旧、网络与运维后的完整经济账。
第三,“产品一定马上降价”不成立。更高能效可以降低服务成本,但价格还受需求、产能、产品策略和服务级别影响。在官方公布具体价格之前,把芯片测试直接换算成用户账单只是推测。
Jalapeño 真正值得关注的地方,是 OpenAI 开始把模型、编译器、服务系统和芯片放进同一个优化循环。首批结果证明这条路线有潜力;年底后的实际部署、独立复测和价格传导,才会决定它能否从一次亮眼测试变成长期竞争优势。