国产GPU标称算力达国际主流七八成,实际Token输出仅为理论值一成

买卡是一道加法题,把卡用好却是一道乘法题。

国家数据局公布的数据显示,中国日均AI词元(Token)调用量已从2024年初的约1000亿飙升至2026年3月的超过140万亿。与此同时,中国信通院等机构的调研显示,国内智算中心GPU平均利用率不足30%。Token需求呈指数级暴涨,昂贵的加速卡却在机房中大量闲置,这一矛盾正成为AI基础设施领域的核心议题。

一个中小企业的技术负责人近期遇到典型困境:团队采购了一批国产GPU卡,计划在自有环境部署开源大模型用于内部知识库问答。硬件到货后,团队花费两周时间仍未能让模型正常运行。问题不在芯片本身——单看标称算力,这批国产卡可达国际主流产品的七八成,但模型实际运行时,输出速度仅为理论值的一成左右。GPUStack CEO秦小康给出类似对比:国产GPU芯片标称性能可达英伟达的70%至80%,但实际跑模型时,Token输出能力可能只有理论值的10%。问题根源在于上下层软件未能匹配,需要大量调优。

这类故障覆盖了企业部署大模型时八成以上的问题场景。模型本质上是无状态的参数文件,无法像程序一样直接运行,必须配套推理后端。英伟达有TensorRT-LLM,华为昇腾有MindIE,开源社区则有vLLM、SGLang等通用方案。模型、后端、硬件三者的组合构成企业真正面对的黑盒。秦小康指出,市面上主流显卡型号有几十种,Hugging Face上的公开模型超过3600个,中间还要对接十几种推理后端,每种后端又各有十余种优化方案,复杂度近乎呈阶乘级膨胀。

IDC调研显示,近半数企业的智算资源利用率处于51%至70%区间,6.7%的企业仅为31%至50%。不少自建智算项目存在重硬轻软问题,服务器和GPU上架后,缺乏统一算力调度平台、资源池化管理和动态分配机制。中科曙光高速网络互联产品部总工程师万伟判断,决定Token生成效率的不只是加速卡算力,更是算力、网络和存储三者之间的数据流转效率。模型规模越来越大,单块GPU已无法容纳完整模型,必须通过分布式架构拆分到多个节点。据测算,万卡级分布式训练中,网络通信耗时已占整体任务时间的30%到50%。

推理需求的爆发正在放大这一缺口。IDC预测,到2027年中国智能算力规模中推理占比将提高到72.6%;TrendForce数据显示,北美五大云服务商2026年推理算力增速预计达122%,超过训练算力增速56%的两倍以上。训练是阶段性、可提前排期的,推理却是全天候、贴着用户跑的,这意味着未来绝大多数GPU资源都要用于推理,而推理恰恰最考验软件功夫。

GPUStack将Token工厂作为核心概念,定位为算力的自来水系统。秦小康表示,过去大家追求获取硬件资源,现在用户需要的是把资源之上的模型真正跑好。Token工厂的角色类似自来水公司,负责完成Token的生产与供给,屏蔽底层资源波动,让终端用户拧开水龙头就能用。其CTO梁胜将当前行业状态类比为上世纪90年代的Windows——驱动需要不停调试优化,各种不兼容层出不穷。随着推理占比持续攀升,从硬件管理到模型一键部署的一体化方案,正在成为算力服务商竞争的新焦点。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
AI智能体推动漏洞披露量创历史新高,隐晦式安全设计范式宣告失效
上一篇 21小时前
METR与Redwood Research调查披露OpenAI智能体协作入侵Hugging Face事件细节
下一篇 21小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部