OpenAI 于 2026 年 8 月 25 日公布自研推理芯片 Jalapeño 的首批测试结果。官方数据显示,这款芯片在三种大模型工作负载中同时提高了单位功耗吞吐量并降低延迟。对开发者而言,真正值得关注的问题不是它是否在单项基准中领先,而是这种每瓦性能优势能否转化为更低的模型服务成本,进而反映在 API 价格上。官方测试结果与EE Times 报道均确认了此次基准发布及其主要结论。
首批基准究竟测出了什么
Jalapeño 接受了 SemiAnalysis 公开基准 InferenceX 的测试,运行对象包括 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T。按照 OpenAI 公布的汇总数据,它在峰值吞吐场景下实现了比较系统约 1.5 至 1.9 倍的单位功耗工作量,同时将端到端延迟降低至约 1.7 至 3.6 分之一;在强调交互速度的工作负载中,性能优势为 2.1 至 4.1 倍。OpenAI 基准说明与TechCrunch 报道对测试模型、指标方向和领先范围的描述一致。
分模型来看,OpenAI 披露的 GPT-OSS 120B 峰值单位功耗吞吐约为对比系统的 1.9 倍,DeepSeek R1 670B 约为 1.7 倍,Kimi K2.5 1T 约为 1.5 倍。芯片标称功耗为 700 瓦,但官方称测试负载下持续功耗不超过 550 瓦。需要注意,横向比较采用各芯片公开的标称功耗进行归一化,并不等同于完整数据中心的实际电表读数。官方附录列出了测试配置,EE Times也提示了功耗口径与测试方法的区别。
优势不只来自算力峰值
Jalapeño 的设计重点是减少推理过程中的数据移动。大模型处理输入提示的预填充阶段偏向计算密集,逐个生成标记的解码阶段则更依赖内存带宽;模型状态、KV Cache 和中间结果如果频繁跨核心或跨芯片传输,会同时增加能耗和等待时间。OpenAI 表示,其芯片、内存、网络和服务软件采用协同设计,使模型状态能够保持在更接近计算资源的位置。OpenAI 架构说明和EE Times 技术分析都将减少数据移动视为主要优化来源。
这也解释了为什么官方反复强调吞吐量与延迟需要一起观察。传统推理系统可以通过扩大批处理提高总吞吐量,但用户等待时间可能随之增加;追求极低延迟又可能导致计算资源利用不足。Jalapeño 的目标是把这条权衡曲线向外推,在维持较高单用户生成速度的同时,让每千瓦服务更多请求。对于需要连续执行多个步骤的智能体、代码生成和长链推理任务,单次延迟的改善还可能减少多轮调用累积的等待时间。官方测试方法与TechCrunch 分析均强调了这一吞吐与延迟的双重目标。
每瓦吞吐提高为何有利于降低成本
推理 API 的成本并不只由芯片采购价决定,还包括电力、冷却、服务器、网络、机房、软件维护、芯片利用率以及模型本身的计算量。每瓦吞吐提高,首先意味着在相同供电条件下能够完成更多推理工作;如果系统还能维持较低延迟,服务商便不必为了响应速度长期牺牲批处理效率。两项改善叠加,理论上可以降低每百万标记或每次有效任务的基础设施成本。OpenAI 也明确表示,Jalapeño 有望降低成功交付结果的服务成本,但官方没有公布具体的单次调用成本或成本降幅。OpenAI 成本表述可作为判断依据,EE Times则指出该芯片近期主要用于 OpenAI 内部计算需求。
不过,基础设施降本并不必然导致 API 立即降价。服务商可能把节省的资源用于扩大容量、改善高峰期可用性、提供更快的推理档位,或者抵消模型规模增长带来的计算开销。API 定价还取决于市场竞争、供需关系、研发投入和产品策略。因此,更现实的短期结果可能是相同价格下提供更快响应、更稳定访问或更高的上下文处理能力,而不是直接下调每百万标记价格。
目前仍有哪些不确定性
- 测试数据主要由 OpenAI 提供:InferenceX 是公开测试框架,但本轮具体结果来自厂商披露,仍需要后续独立复测与真实生产负载验证。官方测试页面与TechCrunch均说明了数据来源。
- 比较对象会继续升级:现有数据涉及 Nvidia GB200、GB300 等系统,而 Jalapeño 大规模部署时,竞争平台及其推理软件可能已经更新,当前领先幅度不能直接外推到未来。
- 量产规模尚未得到验证:OpenAI 计划在 2026 年底开始内部部署,初期规模预计有限,更明显的扩展可能在 2027 年出现。TechCrunch与EE Times均报道了这一部署节奏。
- 整机经济性仍待观察:芯片每瓦性能只是成本方程的一部分,良率、封装、内存、网络、机柜利用率和运维复杂度都会影响最终的每次调用成本。
开发者应该关注哪些后续信号
判断 Jalapeño 是否真正压低 API 成本,可以持续观察三个信号:OpenAI 是否公布独立复测或生产环境数据,芯片在内部推理流量中的占比是否明显提高,以及 API 的价格、限额和速度档位是否发生变化。如果未来出现同模型、同精度、同上下文长度条件下的单位标记成本数据,其参考价值将高于单纯的峰值每瓦性能。
总结
Jalapeño 的首批结果说明,针对大模型推理重新设计芯片、内存和网络,有机会同时改善能效与交互速度。这种优势具备降低 OpenAI 单位服务成本的技术基础,尤其适合高并发、低延迟和多步骤智能体场景。但现阶段还不能据此断言 API 将降价,更不能把厂商基准中的倍数直接等同于价格降幅。真正的验证标准,是量产后的整机成本、利用率、稳定性以及 OpenAI 是否把效率收益传递给开发者。
事件及资料日期:OpenAI 于 2026 年 8 月 25 日发布 Jalapeño 首批测试结果;TechCrunch 于 2026 年 8 月 25 日报道;EE Times 于 2026 年 8 月 27 日发布技术分析。以上信息处于当前日期 2026 年 8 月 29 日之前七天的范围内。