9月17日,智谱GLM团队披露了递归自我改进(Recursive Self-Improvement,RSI)方向的首个工程化实践进展。该实践的核心是由GLM-5.3驱动的Infra Agent完成GLM-5.3-Flash推理基础设施的设计、调试与优化,实现模型对自身运行系统的反向改进。
根据官方博客披露的信息,Infra Agent在超过10万张国产芯片组成的集群上,从零完成了生产级推理服务的搭建。在不到两周的时间内,该系统将端到端吞吐提升至初始基线的3倍,硬件利用效率与单Token成本达到主流NVIDIA GPU相当水平。这套系统目前已投入真实使用场景。
在应用层面,GLM-5.3-Flash以匿名模型Ox-Alpha在OpenCode、OpenRouter平台上线,6天内Token调用量超过62万亿。这一数据从侧面验证了该系统在实际生产环境中的承载能力与稳定性。
递归自我改进被视为AI能力演进的重要方向之一,其核心逻辑是让AI系统参与自身运行基础设施的优化,而非仅停留在代码生成层面。智谱方面表示,此次实践中AI已参与整个推理系统的工程闭环。从行业角度看,这一进展意味着大模型厂商在推理成本优化和国产算力利用效率方面,正在探索一条不依赖人工调优的新路径。
值得注意的是,这是国内大模型厂商首次公开将“AI自我改进”能力应用于生产环境。此前,行业内对RSI的讨论多集中在理论层面或小规模实验阶段,工程化落地案例较少。智谱此次披露的实践,为国产算力集群上的推理系统优化提供了可参考的样本。
随着大模型推理需求持续增长,如何在异构算力环境下降低单位Token成本,已成为厂商竞争的关键维度。智谱GLM此次将AI引入基础设施优化环节,或为后续国产大模型在推理效率与成本控制方面提供新的工程思路。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。