9月22日,在2026杭州云栖大会上,阿里巴巴旗下半导体公司平头哥发布了新一代训推一体AI芯片真武V900,以及ICN Switch互联芯片、磐脉智能网卡、镇岳SSD主控和倚天CPU路线图,形成覆盖计算、存储、网络的全栈产品矩阵。据平头哥副总裁高慧在演讲中披露,真武V900搭载216GB显存,片间互联带宽达到1200GB/s,单芯片性能为上一代真武M890的3倍,原生支持FP8和FP4精度,计划于2027年第一季度进入量产销售。2028年第三季度,下一代产品真武J900也将推出。
真武V900的发布距离上一代产品仅过去数月。2026年5月,平头哥M890首次亮相,拥有144GB显存和800GB/s片间互联带宽,性能达到上一代810E的3倍。再向前追溯,2024年的真武810E已从早期单一推理芯片走向训推一体,采用自研并行计算架构和互联技术,并配套SAIL软件栈。从810E到M890再到V900,平头哥连续三代产品均在同步提升训练、推理、显存和低精度计算能力。据现场披露,基于真武M890的超节点已大规模应用,并跑通了Qwen3.8、Kimi K3等超2万亿参数规模模型。
产品迭代的背后是AI工作负载的结构性变化。当模型参数进入万亿规模后,MoE架构几乎成为默认选择,模型被拆分为大量专家,每个Token仅调用其中一部分,在扩大模型容量的同时控制单次实际参与计算的参数量。这一架构缓解了计算量压力,却将硬件挑战推向三个方向:算力、显存和互联。单颗M890的144GB显存已提升至V900的216GB,据平头哥介绍,只需10多张真武V900即可部署一个万亿规模大模型。但数万亿参数模型在部署时必须拆分到数十甚至上百颗芯片上,芯片间数据交换速度直接决定模型运行效率。为此,真武V900通过自研ICN Switch互联芯片连接后的超节点,具备原生内存语义和内存统一编址能力,可实现千卡全带宽高速互联,使上千颗芯片像一颗“超级芯片”一样协同工作。
伴随算力、显存与互联能力的增强,真武系列的客户覆盖范围同步扩大。在具身智能领域,众擎机器人基于真武搭建了千卡具身智能训练平台,覆盖模型训练、数据处理等环节,端到端训练效率提升34%,已有30多个模型可免适配直接跑通。在汽车场景中,小鹏将真武用于自动驾驶、智能座舱和企业大模型等多类AI业务,现场披露的数据显示,真武整机性能相比其对比的业界主流GPU提升70%,集群故障数量减少50%,同时通过替换过去多种不同卡型,将部分分散算力资源纳入统一资源池集中管理。截至目前,真武系列已服务超过650家企业客户,覆盖智驾、金融、大模型、具身智能、能源、制造等行业。
除AI芯片外,平头哥此次将磐脉智能网卡、镇岳SSD主控和倚天CPU纳入同一产品体系。其中,真武承担AI计算,ICN Switch负责AI芯片间高速互联,磐脉进入服务器与数据中心网络,镇岳负责SSD控制,倚天处理通用计算。倚天CPU的定位在Agentic时代尤为关键。传统AI训练中,计算主要集中在加速器,CPU更多承担数据准备、请求处理和调度。但在Agent场景下,一个任务需要搜索资料、读取文档、运行代码验证、保存中间状态并汇总多路结果,模型推理仅占任务链的一部分,其他环节持续占用CPU。据Intel在2026年Computex上公布的测算,前沿模型训练中一颗CPU大约搭配8颗GPU,而到Agentic AI负载,CPU密度已向1:1甚至更高变化。平头哥公布的倚天路线图显示,2027年将推出倚天720和730,其中倚天720为190核、12通道GDI、96 Lane PCIe,面向吞吐并发型场景;倚天730将成为第一代自研高性能核,支持两路同步和多线程,128 Lane PCIe,单核性能跑分最高可达上一代的1.4倍,面向延迟敏感型场景,为AI Head Node提供确定性的单核性能。
从单颗AI芯片到算、存、网全栈协同,平头哥此次发布反映出AI基础设施竞争维度的迁移。在Agentic负载推动下,算力需求正从训练为主进一步走向推理增长,应用形态从单轮请求变为连续多步任务,硬件竞争已从单芯片指标扩展到整个计算系统的协同能力。真武V900的量产时间定在2027年第一季度,届时其实际部署表现和生态适配进度,将检验这一全栈策略在万亿参数模型时代的竞争力。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。