OpenAI自研Jalapeño芯片实测超越Nvidia Blackwell:每瓦性能碾压,延迟降低3.6倍

OpenAI自研Jalapeño芯片实测超越Nvidia Blackwell:每瓦性能碾压,延迟降低3.6倍

当 OpenAI 决定自己造芯片,AI 算力格局要变天了。

8月25日,OpenAI 发布了自研推理芯片 Jalapeño 的首批实测数据。结果令人震惊:在多项关键指标上,这颗与 Broadcom 合作打造的 ASIC 芯片,竟然超越了 Nvidia 当前最先进的 Blackwell GPU。

这不是实验室里的概念验证,而是 OpenAI 即将在年底部署到生产环境的真实芯片。一场 AI 推理芯片的新战争,正式打响。

一、Jalapeño 实测数据:每瓦性能碾压 Blackwell

OpenAI 在官方博文中披露了 Jalapeño 的对比测试结果。核心数据如下:

能效比(AI 工作负载/瓦特):Jalapeño 达到 Blackwell 的 1.5 到 1.9 倍。这意味着处理相同的 AI 推理任务,Jalapeño 只需要不到 Blackwell 一半的电力。

延迟(响应时间):Jalapeño 的延迟降低到 Blackwell 的 1/1.7 到 1/3.6。对于 ChatGPT 这样需要实时响应的产品,这个差距意味着用户体验的质变。

适用场景:Jalapeño 在低延迟和高吞吐两种极端场景下都表现出色,说明这颗芯片不是”偏科生”,而是全面型选手。

OpenAI 在博文中写道:”OpenAI 模型也加速了 Jalapeño 的开发。”这句话暗示了一个有趣的正反馈循环——OpenAI 用自家模型优化自家芯片,再用更好的芯片跑更强的模型。

二、从 9 个月到量产:Broadcom 的速度与 OpenAI 的野心

Jalapeño 的诞生速度本身就是行业奇迹。

2026 年 6 月 24 日,OpenAI 和 Broadcom 联合发布了这颗芯片。从设计到流片,整个周期只用了 9 个月。要知道,传统芯片从设计到量产通常需要 18-24 个月。

Broadcom 提供了定制 ASIC 的设计和制造能力,而 OpenAI 贡献了对 LLM 推理工作负载的深度理解。两者的结合产生了一颗专门为大语言模型推理优化的芯片——不是通用 GPU,而是”为这个特定任务而生”的专用处理器。

芯片采用超大规模光罩(massive reticle-sized)设计,这在业界极为罕见,意味着单颗芯片的面积接近光刻机的物理极限。更大的芯片面积 = 更多的计算单元 = 更高的推理吞吐量。

三、为什么 Nvidia 被超越?自研芯片的逻辑

要理解 Jalapeño 为什么能超越 Blackwell,需要看清一个底层逻辑:通用芯片 vs 专用芯片。

Nvidia 的 GPU 是为图形渲染设计的,后来被”借用”来做 AI 计算。它的强大在于通用性——什么都能跑,但什么都不是最优解。Blackwell 是 Nvidia 最新的 AI 专用 GPU,但仍然是 GPU 架构,保留了大量图形渲染相关的冗余电路。

Jalapeño 则完全不同。它从第一行代码开始就是为 LLM 推理设计的。没有图形渲染单元,没有通用计算的冗余,每一个晶体管都在为”让下一个 token 更快生成”服务。这种极致的专用化,让它在特定任务上能以更少的能耗完成更多的工作。

这不是 Nvidia 的技术失败,而是商业逻辑的必然。当一个客户(OpenAI)的推理工作负载大到一定程度,自研专用芯片的经济账就算得过来了。

四、AI 芯片格局:从 Nvidia 一家独大到多极竞争

Jalapeño 的出现,标志着 AI 芯片市场从”谁买得到 Nvidia”进入”谁造得出更好的芯片”的新阶段。

对 Nvidia 的影响:短期影响有限。OpenAI 明确表示将继续使用 Nvidia 和其他合作伙伴的加速器来满足不断增长的算力需求。Jalapeño 是补充,不是替代。但长期来看,如果每个大型 AI 公司都开始自研芯片,Nvidia 的市场份额将被逐步蚕食。

对 Broadcom 的意义:这是 Broadcom 在 AI 芯片代工领域的标志性胜利。如果说台积电是 GPU 的制造者,Broadcom 正在成为定制 AI 芯片的设计伙伴。

对 AI 行业的启示:自研芯片不再是 Google TPU 那样的”学术实验”,而是大型 AI 公司的标配。当你的推理成本占到运营成本的大头时,造自己的芯片就成了理性选择。

但有一个关键变量:Nvidia 的下一代芯片 Rubin 已经在向客户出货,采用更先进的 HBM4 内存。Jalapeño 超越的是”上一代”Blackwell,面对 Rubin 时结果可能不同。这场芯片竞赛,远没有到终局。

五、小结:推理芯片是 AI 的下一个战场

Jalapeño 的实测数据证明了一件事:在 AI 推理这个价值数千亿美元的市场上,Nvidia 的护城河不是不可逾越的。

OpenAI 用 9 个月造出了一颗能超越 Blackwell 的芯片。明年,它会用 Rubin 级别的技术造出更强的下一代。当每个 AI 巨头都有自己的芯片团队时,算力成本将加速下降,AI 应用的普及也将随之提速。

芯片战争的下半场,已经开始了。

Cerebras CS-4发布:30倍推理速度改写算力格局,SRAM路线正面挑战英伟达GPU霸权

Cerebras CS-4发布:30倍推理速度改写算力格局,SRAM路线正面挑战英伟达GPU霸权

据36氪8月19日报道,AI芯片公司Cerebras System于当地时间周二正式发布第四代晶圆级AI推理系统CS-4。这是Cerebras迄今为止最大胆的一次产品迭代:单个机架系统集成3颗WSE-3 Turbo晶圆级处理器,集成了4万亿个晶体管,号称在单用户场景下,每秒输出token的能力可达传统GPU服务器的30倍。更关键的是,这套系统全部采用SRAM(静态随机存取存储器)而非行业主流的DRAM(动态随机存取存储器),走了一条与英伟达完全不同的技术路线。

Cerebras表示,CS-4基于全新的Nexus机架式平台,计算、电源、互连三大子系统全部重新设计,整体组件数量减少了50%,制造自动化比例大幅提升。与上一代CS-3相比,WSE-3 Turbo在FP16稀疏AI算力、内存带宽、片上互联带宽和I/O带宽四个维度均实现了约2倍提升,性能几乎线性增长。值得注意的是,这套系统专注于AI推理而非模型训练,明确瞄准了当前AI应用落地中最大的瓶颈——推理延迟和成本。

为什么这件事值得关注

Cerebras CS-4的发布,本质上是AI算力市场的一次”范式挑战”。过去三年,英伟达凭借A100/H100/B200系列GPU几乎垄断了AI算力市场,其核心优势在于CUDA生态和大规模并行计算能力。但Cerebras选择了一条截然不同的路:用整片晶圆做芯片(WSE = Wafer Scale Engine),用SRAM替代DRAM,用硬件级的互联延迟(2微秒)替代软件调度。

这意味着什么?AI推理的游戏规则可能正在被改写。 当前大模型应用的最大痛点不是训练,而是推理——用户等待一个回答的时间、企业为每次API调用支付的成本,直接决定了AI产品的商业化天花板。Cerebras声称的30倍推理速度,如果在真实生产环境中得到验证,将对AI推理云服务的定价模型、AI应用的用户体验、以及企业AI部署的成本结构产生深远影响。

更值得关注的是Cerebras的客户生态。从其官方博客可以看到,OpenAI、GPT-5.6、Gemma 4、GLM-4.7等主流大模型均已支持在Cerebras平台上运行推理。这意味着CS-4不是”纸上谈兵”,而是已有真实模型验证的商业化产品。

对不同角色意味着什么

对AI应用开发者: 如果CS-4的30倍推理速度属实,你的AI应用的用户体验将发生质变——从”等待3秒出结果”变成”几乎实时响应”。这对聊天机器人、代码助手、实时翻译等延迟敏感型应用尤其重要。建议关注Cerebras推理API的开放时间和定价,提前评估迁移方案。

对企业IT决策者: AI推理成本是当前企业AI落地的最大障碍之一。Cerebras的SRAM路线虽然芯片成本更高,但推理效率的提升可能带来整体TCO(总拥有成本)的优势。建议在下次AI基础设施评估中,将Cerebras作为英伟达的替代选项纳入考量,尤其是推理密集型工作负载。

对投资者: AI芯片赛道正在从”训练为王”转向”推理为王”。Cerebras的CS-4、Etched的7亿美元融资(估值一个月翻倍至210亿美元)、以及英伟达自己推出推理专用芯片,都在印证这个趋势。推理芯片的市场空间可能比训练芯片更大——因为每个训练出来的模型,都需要无数次推理来服务终端用户。

SRAM vs DRAM:一条少有人走的路

Cerebras选择SRAM而非DRAM,是一个大胆的技术赌注。SRAM的优势是速度极快(纳秒级访问延迟),但密度低、成本高;DRAM密度高、成本低,但速度慢且需要刷新。英伟达的GPU全部使用HBM(高带宽DRAM),这已经是行业标准。

Cerebras的逻辑是:通过整片晶圆的巨大面积来弥补SRAM的密度劣势,同时用2微秒的片上互联来消除DRAM带来的延迟瓶颈。这有点像用”人海战术”来替代”精兵路线”——单个芯片面积是英伟达GPU的数十倍,但换来的是数量级的推理速度提升。

这条路线能否成功,取决于两个关键因素:一是良率(整片晶圆做芯片,任何一个缺陷都可能报废整片),二是成本(SRAM的单位比特成本远高于DRAM)。Cerebras此前的CS-2和CS-3已经证明了晶圆级芯片的可行性,CS-4则是在推理场景的进一步押注。

相关阅读

· Groq再融3.5亿美元转向neocloud:AI推理云成算力投资新战场 —— 另一家押注AI推理的玩家,从芯片到云服务的全栈布局

· Stripe以70亿美元收购OpenRouter:支付巨头押注AI模型路由入口 —— 模型路由与推理入口的争夺战正在升温

写在最后

Cerebras CS-4的发布,标志着AI算力市场从”英伟达一家独大”向”多路线竞争”的转变。SRAM vs DRAM、晶圆级 vs 芯片级、推理优先 vs 训练优先——这些技术路线的分化,最终将为AI应用开发者和企业带来更多的选择、更低的成本、更好的体验。

当然,30倍的速度提升仍需第三方独立验证,SRAM的良率和成本问题也尚未完全解决。但无论如何,Cerebras已经向市场证明:AI推理的未来,不只有英伟达一条路。

关注 AI商业快讯,每天一篇AI热点深度解读。