9月17日,智谱创始人唐杰在社交媒体发布长文,首次系统披露了公司在推理基础设施(Infra)层面推进RSI(递归式自我改进)的战略布局。据其透露,智谱已构建一套由GLM-5.3驱动的推理基础设施系统,支撑其最新模型GLM-5.3-Flash——即此前以匿名形式引发关注的Ox-Alpha——在发布后六天内处理超过62万亿个Token,并全部运行于十万张国产芯片组成的集群之上。
这一部署规模在国产算力生态中具有标志性意义。长期以来,国产芯片在大规模集群部署中面临底层软件栈不成熟、算子兼容性不足、通信效率受限等系统性难题。唐杰在推文中指出,在十万张芯片量级的集群中,每天可能有数百张卡发生硬件故障、网络掉线或数据丢包。而从首次全量跑通到切换全部真实生产流量,智谱仅用两周时间完成,这一过程在传统模式下通常需要经验丰富的基础设施团队耗费数周乃至数月。
为应对国产芯片内存带宽有限、软件生态薄弱等约束,智谱采用了一套以软件补硬件的工程方案。具体而言,团队通过“节点内张量并行”与“层分割”策略,将模型按层拆分并在单服务器内实现多芯片协同计算,以通信换内存;启用ReplaySSM策略,在显存不足时丢弃数据、需要时由芯片实时重算,以计算换内存;同时采用W8A8量化将模型权重与激活压缩至8位,并对KV缓存按数据重要程度混用INT8、FP8、BF16三种精度进行动态压缩,以精度换容量。此外,团队将编码、预填充、解码三个阶段彻底解耦,提升调度灵活性。据披露,上述优化使端到端吞吐量提升3.2倍,国产芯片利用率与单Token成本已逼近英伟达水平。
值得关注的是,智谱此次技术路线的核心并非单纯的工程调优,而是将RSI理念引入Infra层,试图让AI系统具备自主诊断与优化推理基础设施的能力。唐杰在推文中将这一方向概括为“模型优化系统、系统反哺模型”的最小循环。
在实际工程中,推理系统的优化面临“稀疏反馈”困境:系统通常只输出“吞吐量下降20%”这类结果性指标,而无法直接定位问题源于底层代码、内存调度还是数据传输。传统排查依赖资深工程师的“工程直觉”,但这一过程难以量化且试错成本极高。智谱的解法是构建一套名为“密集反馈”的分层验证体系,将人类工程师的排查逻辑编码为AI可执行的反馈机制。
该体系分为三个层面:正确性反馈、系统行为反馈与性能反馈,分别对应“算得对不对”“卡在哪一步”以及“哪种解法最优”三类底层问题。以长上下文精度漂移为例,AI可通过正确性反馈体系追踪到KDA内核默认计算精度导致的舍入误差累积,并自动匹配更高精度的组合算法。在KV传输并发瓶颈场景中,系统行为反馈体系可自动拉取执行时序,识别计算与通信未重叠的异常时间片,并跨Python与C++语言边界追踪至底层接口实现。
智谱方面认为,在算力受到外部严格限制的背景下,中国AGI取得突破的关键不仅在于芯片数量,更在于能否通过软件高效调动和利用算力。通过RSI建立“底层解耦”能力,使AI自主适配不同硬件生态,是智谱试图掌握技术主动权的核心逻辑。唐杰在推文中表示,距离RSI的终局仍相差甚远,但“模型优化系统、系统反哺模型”的最小循环已经真实转动起来。
从行业视角看,智谱此次披露的Infra层RSI实践,为国产算力集群的大规模部署提供了一条可参照的工程路径。其核心价值在于,将“国产芯片不好用”的被动局面转化为“由AI自动挖掘硬件极限”的主动能力。若该模式得到验证与推广,或将影响国内大模型厂商在算力受限条件下的技术路线选择,推动行业从单纯追求芯片数量转向软件与系统层面的效率竞争。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。