大模型注意力架构现融合趋势:Kimi与DeepSeek技术路线在同一模型中交汇

如果具体的 Attention 技术正在变成可以流动和重组的零件,我们今天所谓一家模型公司的“技术路线”,到底还指什么?

大模型注意力机制(Attention)的技术路线正在从分流走向重组。近期披露的一份模型架构配置文件显示,GLM-5.3-Flash 的45层架构中,34层采用了Kimi路线的KDA线性注意力,另外11层则采用DeepSeek路线的KPool-DSA稀疏注意力。两种原本分属不同公司的技术方案,出现在同一张模型架构图里。

这一现象背后,是大模型Attention机制近年来持续演变的缩影。经典Transformer主要使用全局注意力(Full Attention),让模型直接访问完整的token级历史,信息保留最充分,但计算和KV Cache随上下文迅速增长,训练与推理成本高昂。线性注意力(Linear Attention)将历史压缩进更紧凑的状态以降低长序列计算成本,稀疏注意力(Sparse Attention)则保留较完整历史,仅选择部分重要信息参与计算。过去几年出现的各类高效注意力方案,主要沿后两个方向演化。

作为折中方案的混合注意力架构逐渐成为主流:不同机制被放进同一套模型分工,高效注意力负责降低成本,少量全局注意力保留直接访问完整历史的机会。但今年以来,混合架构中原本由全局注意力承担的角色,开始出现被稀疏注意力接替的迹象。8月发布的Qwen3.8-Flash-Next延续三层Gated DeltaNet配一层Attention的结构,但那一层原本负责全局精确读取的Attention,已被改造为Qwen Sparse Attention。

MiniMax的架构演进几乎完整经历了这一轮反复。2023年底,主导MiniMax-01网络架构设计的钟怡然与创始人闫俊杰交流后,MiniMax决定押注尚未经过大规模验证的线性注意力路线,超过80%的研发资源卷入其中。团队曾训练一版15B左右的纯Linear模型,效果接近Transformer,但模型进一步放大后,线性注意力在检索类任务上的压缩缺陷开始暴露。最终MiniMax将Full Attention加回,形成7:1混合注意力架构:每7层Lightning Attention后加入1层传统SoftMax Attention。2024年中,团队在约3700次预训练实验后启动4560亿参数的MiniMax-01训练,2025年1月模型发布时上下文长度推至400万token。

模型继续Scale后,第二轮问题出现在多跳推理场景:当模型需要经过多个中间步骤串联条件、推导与结论时,混合注意力出现比Full Attention更明显的能力损失。从Kimi的KDA到DeepSeek的KPool-DSA,再到Qwen的QSA,注意力技术正从公司专属路线演变为可流动、可重组的模块化组件。当架构层面的技术壁垒逐渐消解,模型公司的差异化竞争将更多转向数据、训练系统与工程能力的综合较量。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
OpenAI暂停新一代模型训练,Meta的Muse下载量超越ChatGPT同?
上一篇 3小时前
豆包个人助理产品定名“小豆” 计划推出独立App
下一篇 3小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部