Cerebras CS-4发布:30倍推理速度改写算力格局,SRAM路线正面挑战英伟达GPU霸权

据36氪8月19日报道,AI芯片公司Cerebras System于当地时间周二正式发布第四代晶圆级AI推理系统CS-4。这是Cerebras迄今为止最大胆的一次产品迭代:单个机架系统集成3颗WSE-3 Turbo晶圆级处理器,集成了4万亿个晶体管,号称在单用户场景下,每秒输出token的能力可达传统GPU服务器的30倍。更关键的是,这套系统全部采用SRAM(静态随机存取存储器)而非行业主流的DRAM(动态随机存取存储器),走了一条与英伟达完全不同的技术路线。

Cerebras表示,CS-4基于全新的Nexus机架式平台,计算、电源、互连三大子系统全部重新设计,整体组件数量减少了50%,制造自动化比例大幅提升。与上一代CS-3相比,WSE-3 Turbo在FP16稀疏AI算力、内存带宽、片上互联带宽和I/O带宽四个维度均实现了约2倍提升,性能几乎线性增长。值得注意的是,这套系统专注于AI推理而非模型训练,明确瞄准了当前AI应用落地中最大的瓶颈——推理延迟和成本。

为什么这件事值得关注

Cerebras CS-4的发布,本质上是AI算力市场的一次”范式挑战”。过去三年,英伟达凭借A100/H100/B200系列GPU几乎垄断了AI算力市场,其核心优势在于CUDA生态和大规模并行计算能力。但Cerebras选择了一条截然不同的路:用整片晶圆做芯片(WSE = Wafer Scale Engine),用SRAM替代DRAM,用硬件级的互联延迟(2微秒)替代软件调度。

这意味着什么?AI推理的游戏规则可能正在被改写。 当前大模型应用的最大痛点不是训练,而是推理——用户等待一个回答的时间、企业为每次API调用支付的成本,直接决定了AI产品的商业化天花板。Cerebras声称的30倍推理速度,如果在真实生产环境中得到验证,将对AI推理云服务的定价模型、AI应用的用户体验、以及企业AI部署的成本结构产生深远影响。

更值得关注的是Cerebras的客户生态。从其官方博客可以看到,OpenAI、GPT-5.6、Gemma 4、GLM-4.7等主流大模型均已支持在Cerebras平台上运行推理。这意味着CS-4不是”纸上谈兵”,而是已有真实模型验证的商业化产品。

对不同角色意味着什么

对AI应用开发者: 如果CS-4的30倍推理速度属实,你的AI应用的用户体验将发生质变——从”等待3秒出结果”变成”几乎实时响应”。这对聊天机器人、代码助手、实时翻译等延迟敏感型应用尤其重要。建议关注Cerebras推理API的开放时间和定价,提前评估迁移方案。

对企业IT决策者: AI推理成本是当前企业AI落地的最大障碍之一。Cerebras的SRAM路线虽然芯片成本更高,但推理效率的提升可能带来整体TCO(总拥有成本)的优势。建议在下次AI基础设施评估中,将Cerebras作为英伟达的替代选项纳入考量,尤其是推理密集型工作负载。

对投资者: AI芯片赛道正在从”训练为王”转向”推理为王”。Cerebras的CS-4、Etched的7亿美元融资(估值一个月翻倍至210亿美元)、以及英伟达自己推出推理专用芯片,都在印证这个趋势。推理芯片的市场空间可能比训练芯片更大——因为每个训练出来的模型,都需要无数次推理来服务终端用户。

SRAM vs DRAM:一条少有人走的路

Cerebras选择SRAM而非DRAM,是一个大胆的技术赌注。SRAM的优势是速度极快(纳秒级访问延迟),但密度低、成本高;DRAM密度高、成本低,但速度慢且需要刷新。英伟达的GPU全部使用HBM(高带宽DRAM),这已经是行业标准。

Cerebras的逻辑是:通过整片晶圆的巨大面积来弥补SRAM的密度劣势,同时用2微秒的片上互联来消除DRAM带来的延迟瓶颈。这有点像用”人海战术”来替代”精兵路线”——单个芯片面积是英伟达GPU的数十倍,但换来的是数量级的推理速度提升。

这条路线能否成功,取决于两个关键因素:一是良率(整片晶圆做芯片,任何一个缺陷都可能报废整片),二是成本(SRAM的单位比特成本远高于DRAM)。Cerebras此前的CS-2和CS-3已经证明了晶圆级芯片的可行性,CS-4则是在推理场景的进一步押注。

相关阅读

· Groq再融3.5亿美元转向neocloud:AI推理云成算力投资新战场 —— 另一家押注AI推理的玩家,从芯片到云服务的全栈布局

· Stripe以70亿美元收购OpenRouter:支付巨头押注AI模型路由入口 —— 模型路由与推理入口的争夺战正在升温

写在最后

Cerebras CS-4的发布,标志着AI算力市场从”英伟达一家独大”向”多路线竞争”的转变。SRAM vs DRAM、晶圆级 vs 芯片级、推理优先 vs 训练优先——这些技术路线的分化,最终将为AI应用开发者和企业带来更多的选择、更低的成本、更好的体验。

当然,30倍的速度提升仍需第三方独立验证,SRAM的良率和成本问题也尚未完全解决。但无论如何,Cerebras已经向市场证明:AI推理的未来,不只有英伟达一条路。

关注 AI商业快讯,每天一篇AI热点深度解读。

发表评论