昨晚,OpenAI公布了与博通联合自研的首款AI推理芯片Jalapeño的首轮公开测试成绩。该芯片从设计之初就只有一个目标:承载现代大模型的推理部分工作。
在SemiAnalysis发布的公开基准测试InferenceX上,Jalapeño运行了GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T三款模型。结果显示,Jalapeño每瓦完成的AI工作比英伟达GB200、GB300多1.5至1.9倍,端到端延迟缩短至对照系统的约30%至60%。
运行DeepSeek R1时,一次8K输入、1K输出的推理从5.99秒降到1.65秒,最低token间隔则由5.90ms压到1.43ms。Sam Altman在谈及此事时言简意赅。这一目标与当下AI Agent的流行紧密相关,Agent需要连续调用模型几十次,推理延迟累积会影响效率。
