9月23日,小米MiMo大模型负责人罗福莉通过社交媒体宣布,MiMo-V3即将采用全新架构,其核心组件HySparse 2于当日正式发布。据官方披露的数据,该架构在100万Token长度下,预填充计算量(FLOPs)降低5.02倍,KV缓存缩小4.5倍,同时在MRCRv2和RULER-v2评测中取得更高评分,AgentPPL与LongPPL指标则进一步降低。
罗福莉在阐述架构设计动机时指出,智能体(Agentic)推理是一种截然不同的工作负载。在每一轮交互中,一个简短的动作可能返回需要进行预填充的长文本观察结果,同时上下文还在不断增长。这一特性使得预填充成本、KV缓存大小和检索准确率同时处于关键路径上,成为制约智能体推理效率的核心瓶颈。HySparse 2的优化方向正是针对这一场景展开。
从技术实现来看,HySparse 2引入了两项关键机制。其一是KV桥接(KV Bridging),遵循YOCO(You Only Cache Once)思路,交叉解码器(cross-decoder)中的全注意力层利用自解码器(self-decoder)的隐藏状态构建其K/V。其二是KV重用(KV Reuse),在每个混合块内,稀疏层复用前一层全注意力层的KV缓存和选择索引。此外,该架构还包含两项改进:采用Token级别的选择替代此前的块(block)级别选择,并以近期Token的强制窗口替代独立的SWA(滑动窗口注意力)分支,从而使本地和全局Token共享同一个KV缓存。由于所有交叉解码器KV缓存均来自自解码器,预填充过程在自解码器完成时即可停止,进一步压缩了计算开销。
值得关注的是,就在HySparse 2发布的前一日凌晨,小米刚刚发布并开源了全新的Xiaomi MiMo-V2.6系列模型,包含Pro与Flash两个版本,均为原生全模态模型。小米方面表示,这是其探索RSI(递归自我改进)路径的关键一步,通过规模化扩展强化学习算力,让模型在持续的探索与反馈中拓展智能边界。短短两日内连续发布模型与架构更新,显示出小米在AI大模型领域的推进节奏正在加快。
从行业视角来看,长上下文与智能体推理已成为当前大模型竞争的重要方向。随着Agent应用场景从简单的问答向多轮工具调用、复杂任务编排延伸,推理过程中的预填充成本和KV缓存压力呈指数级上升,如何在保持检索准确率的同时降低推理开销,是各家厂商共同面临的工程难题。HySparse 2通过KV桥接与重用机制,在架构层面尝试将预填充计算与缓存占用解耦,若其宣称的性能提升在MiMo-V3上得到验证,将为智能体场景下的长上下文推理提供一种可参考的优化路径。
目前,HySparse 2的技术细节已通过论文公开,论文地址为https://arxiv.org/pdf/2609.26368。MiMo-V3的具体发布时间及完整性能表现尚未披露,后续进展值得持续关注。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。