(源初/文)在三款测试模型中,Jalapeno 在峰值吞吐量下每瓦特产生的 AI 工作量是竞争系统的1.5 至 1.9 倍,同时延迟降低了1.7 至 3.6 倍。
针对 Agent(智能体)等高互动性工作负载,其优势进一步扩大到2.1 至 4.1 倍的性能提升。在测试的最大模型 Kimi K2.5 上,Jalapeno 展现出比对比硬件高出约1.5 倍的能效比(每瓦性能),以及3.4 倍的低延迟。
OpenAI 表示,为了保持对比的一致性,他们使用各芯片公布的额定功耗对结果进行了标准化处理。Jalapeno 的标称功耗为 700 瓦,不过公司透露,在实际测试中,测得的功耗一直保持在 550 瓦或以下。
该芯片的设计旨在专门优化语言模型推理的两个不同阶段:计算密集的 Prefill(预填阶段)和更依赖内存带宽的 Decode(解码阶段)。
OpenAI 指出,Jalapeno 将模型状态和缓存数据保留在单个连接系统本地,从而减少了以往数据在不同芯片间传输时常出现的通信延迟。
AI 本身也在该芯片的研制中发挥了作用。OpenAI 解释称,其旗下模型协助设计了 Jalapeno,将从概念提出到 Tapeout(流片)的开发周期缩短至 9 个月。
工程师们还利用公司的 Codex 工具,在 2 个月内让另外三款开源模型实现了强劲的性能表现。其中,由 AI 生成的部分模型组件代码,运行速度比人类工程师编写的版本快了高达1.8 倍。
OpenAI 计划在今年年底前开始在其自家基础设施中部署 Jalapeno,并将其定位为多代产品路线图中的首款芯片;其后续迭代产品已在开发中。公司同时补充道,除使用自研芯片外,还将继续购买来自 Nvidia(英伟达)及其他供应商的芯片,以满足日益增长的计算需求。
值得注意的是,Jalapeno 未与 Nvidia 最新推出的 Vera Rubin 芯片进行对比测试(后者近期才开始出货),且该芯片完全专为推理而设计,并非针对 Nvidia 仍占据主导地位的模型训练工作负载。
来源:飞象网



