企服科学:通义千问要堆到10万亿参数,一边做大还要一边把成本做小

真正的门槛,从来不是把模型做大,而是让模型替你把成本做小。

近日举行的云栖大会上,阿里大模型团队首次系统披露了通义千问系列的下一代模型规划。千问大语言模型负责人刘大一恒在主论坛演讲中给出了一张明确的路线图:Qwen4系列即将发布,此后Qwen4.5和Qwen5计划进一步扩展至5T至10T参数规模。把这次披露放进行业上下文里看,它的分量不在某一次单个发布,而在于阿里第一次把“要往哪里去”整套讲了出来:参数往哪走、成本怎么压、模型又准备替谁干活。数字之外更值得注意的,是这份规划的组合方式——阿里在同一次演讲里,既讲怎么把参数继续堆大,也讲怎么把单位成本继续压低,还把模型塞进了芯片设计、推理框架适配这些自家底层研发环节。对中国的云、算力和应用厂商来说,这三件事分开看都不新鲜,合在一起看,才是一条值得逐项拆解的路线。

先分清一件事:路线图不等于已经落地的产品。Qwen4是“即将发布”,Qwen4.5和Qwen5是“计划进一步扩展至5T至10T”,这些都属于规划动作,不是已经交付的能力。真正已发布的,是Qwen3.8、Qwen3.8-Flash和Qwen3.8-Max三条模型线,以及面向电商、创意、设计等商用场景升级的图像模型Qwen-Image-3.1;下一代视频生成模型要到11月才亮相。把尚未发布的东西当作既成事实来讨论,是这类大会披露最容易被误读的地方。所以下面的口径是:把已经发生的数字当作事实,把路线图当作方向来拆。据雷锋网报道,上述内容来自本届云栖大会的主论坛演讲。

拆开看,第一层是技术账,而千问的Scaling曲线确实陡。两年前,Qwen2.5旗舰模型的参数量是72B;到今年8月发布的Qwen3.8,参数已增至2.4T,增长约33倍。如果Qwen4.5和Qwen5如期推进到5T至10T区间,规模将在现有基础上再扩大一倍至三倍以上。刘大一恒重申了阿里的判断:基础模型的智能上限仍离不开算力、数据和模型规模的持续投入,阿里将继续扩大预训练计算量。这条线很直白——继续加注,而且把加注当成长期判断,而不是阶段性动作。

但同一场演讲里还有另一条线:已发布的Qwen3.8-Flash。它通过稀疏注意力、线性注意力和外接记忆等新架构,让每次推理仅激活6B参数,训练成本降至上一代的九分之一,百万Token输入价格降至四分之一,超长上下文的预填充吞吐量提升8.6倍,模型能力仍保持增长。把这两条线放在一起,技术账的实质就清楚了:参数上限继续往上顶,单位成本往下压。注意这里的关键词是“激活”——总参数规模可以很大,但每次推理真正调用的只是一小部分,算力消耗因此被压了下来。阿里选择的不是少投入,而是用更聪明的架构,去对冲规模扩张带来的成本。多模态也在这条逻辑线上:ATH技术副总裁郑波明确了下一代视频生成模型的发布时间,11月亮相,他把下一阶段定义为“Agent Video”,即模型不只生成单个素材片段,还能理解创作者意图,自主拆解剧情、设计分镜、安排人物与场景,最终生成完整视频,推进方向是更长、更可控、更完整、更智能;图像侧的Qwen-Image-3.1则面向电商、创意、设计等商用场景做了优化升级。

换一个角度看,第二层是商业账。参数规模的竞赛,最终要落到“谁为推理买单”这个朴素问题上。百万Token输入价格降至四分之一,直接改写的是调用方的成本结构;对云厂商来说,这既是让利,也是拉高调用量、把模型变成基础设施收入的手段——单价降下来,用量提上去,账才能继续做大。6B的激活参数,意味着单次推理占用的算力被大幅压缩;8.6倍的预填充吞吐提升,意味着同样的机器能服务更多的长上下文请求。而训练成本降到九分之一,降低的是阿里自己的迭代门槛:训练更便宜,就能更频繁地试错、更快地推出下一代。商业账的落点因此是双向的:一部分成本让给客户,换调用密度;一部分留给自己,换迭代速度。

第三层是格局账,也是最值得中国企服关注的一层。阿里披露了多项关于模型参与自身研发的实验。在芯片设计场景中,研究团队仅向Qwen3.8-Max提供一份真实的片上网络模块规格,模型在60多个小时内自主调用EDA工具,完成从电路描述编写、验证到后端物理实现的全流程,最终芯片物理面积减少42%,功耗估算下降59.5%。在推理基础设施层面,面对一款此前未适配过的平头哥新GPU,Qwen3.8-Max自主修改和优化SGLang推理框架,用56小时完成部署,将日常对话场景的单实例吞吐量提升96%。此外,Qwen3.8-Max曾连续自主运行一个多月,完成33轮有效实验,涵盖流程搭建、数据构造、实验设计与缺陷定位。

这三组数字连起来看,意义就变了。它不再只是“模型能力提升”,而是模型开始承担研发劳动本身:改推理框架、做芯片后端的物理实现、跑自己下一代的实验。如果这条路径成立,迭代成本曲线会被进一步压低——因为研发环节里的一部分人力与时间,被模型自己消耗掉了。对云和算力厂商而言,竞争可能从“谁能提供更大的模型”,部分转向“谁能用模型把自己基础设施的适配成本降下来”;对应用厂商而言,成本预期会继续下移,但能力差异可能更多体现在谁能把模型接进自己的工程流程,而不只是调一个接口。这也是“模型嵌入底层研发”这句话真正的含义:它改变的不是单个产品的性能,而是整个组织的研发效率。

把三层账合到一张纸上,对企服的落点其实各不相同。对云厂商,模型价格下探是一把双刃剑:它挤压单次推理的收入,却可能换来更密集的调用和更强的客户黏性,胜负在于规模效应能不能跑赢降价。对算力与芯片厂商,模型能自主完成框架适配,意味着客户侧的迁移成本在下降,硬件的“可用窗口”会被拉长,生态绑定因此变得更重要。对应用厂商,最大的变量不是模型变强,而是单位成本变低之后,哪些过去算不过账的场景开始算得过来——这才是低价模型真正撬动需求的地方。

不过,这条路线有三处需要留边界。第一,路线图与交付之间有距离。5T至10T是“计划”,视频模型是“将亮相”,都不是既成结果;把规划当承诺,会误判节奏,也会错配投入。第二,目前披露的自主研发案例是单点实验,而非规模化产线。60多小时完成一颗模块的设计流程、56小时完成一次框架适配,证明的是可行,而不是普适;迁移到不同芯片、不同场景,成本与成功率仍是未知数,一个成功样本也很难直接推广成一条稳定流水线。第三,成本下降不等于商业模式自动成立。价格降到四分之一,谁先受益、谁被迫跟进,取决于调用方的议价能力和替代方案,而不是单方面的定价;对中小厂商来说,低价模型拉高的是选择权,压缩的可能是自建模型的理由。

回到根本,这届云栖大会真正披露的,不是几个更大的参数,而是一套组合拳:一边堆参数、一边压成本、还把模型嵌进自家底层研发。对国产大模型而言,这条路线把竞争焦点从“谁的模型更强”,部分转向了“谁的迭代更便宜、更快”。参数是结果,成本是过程,而把模型接进研发链条,才是这条路线里最难被复制的一段。它要求的不只是模型能力,还有完整的芯片、框架、云基础设施作为试验场,这恰恰是少数几家才有的条件。真正的门槛,从来不是把模型做大,而是让模型替你把成本做小。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
企服科学:蔡崇信给阿里AI定调,中国企服别做被顺手换掉的零件
上一篇 1小时前
企服科学:堆卡不再称王,算力的胜负系于每度电能产出多少Token
下一篇 29分钟前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部