晶圆级AI推理加速器制造商Cerebras于8月18日宣布推出新一代芯片WSE-3 Turbo及基于该芯片的CS-4系统。与上代CS-3相比,CS-4实现了10倍的词元容量和2倍的处理速度提升,标志着其在AI推理专用硬件领域的又一次迭代。
WSE-3 Turbo延续了前代架构,集成90万个核心和44GB SRAM片上缓存,但FP16稀疏AI算力、内存带宽、片上互联带宽及I/O带宽均实现翻倍。CS-4系统可集成3块WSE-3 Turbo芯片,进一步提升了单机算力密度。据Cerebras官方数据,CS-4在OpenAI GPT-OSS模型上达到4465 Token/s的词元交付速度,较CS-3提升93%,并声称是GPU方案的30倍。对于超高参数模型,CS-4通过2微秒低延迟晶圆间互连,可在10T规模上实现超过1000 Token/s的词元输出。
CS-4原生支持推理负载拆分,可作为解码单元与异构的预填充硬件配套使用,发挥双方架构上的差异化优势。这一设计使客户能够根据推理任务的不同阶段灵活调配计算资源,优化整体效率。硬件层面,CS-4基于Cerebras全新的Nexus机架式平台,计算、电源、互连三大子系统经过重新设计,组件数量减少50%,制造自动化比例大幅提升,同时几乎完全消除了板级供电功率损耗,为WSE-3 Turbo提供了双倍电力供给。
此次发布正值AI推理市场对高吞吐、低延迟算力需求持续攀升的窗口期。Cerebras通过晶圆级集成方案,试图在GPU主导的推理市场中开辟差异化路径,其面向超大规模模型的性能表现,或将对云服务商和AI企业的算力选型产生直接影响。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。