9月11日至13日,2026中国算力大会在河北廊坊举行。会议期间,移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、清华大学、北京大学共同打造的国内首个国产GPU与类脑芯片大模型异构混合推理系统正式发布。
据官方披露的实测数据,在DeepSeek V4模型上,该系统相较同类国产GPU算力集群性价比提升一倍以上,业务运营成本降低40%以上。这一结果表明,通过异构算力协同,国产芯片在推理场景下的经济性瓶颈存在被系统性突破的可能。
该系统的核心设计思路被概括为“分而治之,协同增效”。具体而言,研发团队将大模型推理过程进行PD(Prefill/Decode)与AF(Attention/FFN)拆分,把不同计算模块部署到架构特性最匹配的芯片上。其中,Attention计算交由国产GPU承担,发挥其通用计算优势;FFN(MOE专家)等延时敏感模块则交由类脑芯片处理,利用其存算一体架构与片上大容量SRAM带来的低延迟特性。两类算力之间通过自研模型编译器、高速互联协议和统一推理引擎实现任务拆解、协同调度与结果聚合。
这一架构的提出,针对的是传统单GPU推理方案的固有瓶颈。随着大模型参数规模持续扩大,推理阶段的显存带宽压力与能耗成本成为制约部署经济性的关键因素。单纯依靠增加GPU数量来提升吞吐,边际效益递减明显。异构混合推理通过将不同计算特征的任务分配给最适合的芯片架构,在理论上可实现更高的能效比与更低的单位推理成本。此次发布的系统将这一思路进行了工程化落地,并给出了可量化的验证结果。
参与该系统的合作方覆盖了产学研多个环节。移动云公司作为运营主体,提供云平台与业务落地场景;中国电子科技南湖研究院与北京灵汐科技在类脑芯片领域有长期积累;上海天数智芯是国内通用GPU的代表性厂商;清华大学与北京大学则提供算法与架构层面的研究支撑。这种组合方式显示出国产算力生态正在从单点芯片突破转向系统级协同优化。
在应用场景方面,官方表示该系统可广泛适配Token工厂、AI代码生成、多智能体协同、智能制造等高实时性场景。同时,面向金融、安防、通信等对安全性有特殊要求的行业,系统提供全栈国产化推理底座,满足自主可控需求。全栈国产化的定位,使其在信创市场与关键基础设施领域具备明确的落地空间。
从行业影响来看,该系统的发布为国产算力在大模型推理领域的应用提供了新的技术路径。当前,国内AI推理需求快速增长,但高端GPU供应受限,如何用现有国产芯片资源支撑大规模模型服务,是产业界面临的现实问题。异构混合推理方案通过架构创新而非单纯制程追赶来提升性价比,为国产算力集群的建设与运营提供了一种可参照的范式。其后续在真实业务场景中的稳定性、编译器生态完善度以及跨芯片协同调度的效率,将是决定该方案能否规模化推广的关键因素。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。