随着大模型从实验室走向生产环境,推理环节正在成为吞噬算力的主要黑洞,而存储则从配角转变为决定推理性能的关键因素。东方证券在行业深度报告中判断,AI算力中心的核心挑战已从以算力为主,逐步转向存储与带宽为主。SEMI中国总裁冯莉在今年3月的演讲中披露,2026年全球AI基础设施支出将达到4500亿美元,其中推理算力占比首次超过70%,全球存储产值将在2026年首次超越晶圆代工,成为半导体产业的第一增长极。
大模型推理分为Prefill(预填充)和Decode(解码)两个阶段。在多轮对话场景中,大量重复问题的重复计算造成算力浪费,业界共识是用存储空间换计算时间,将重复生成的KV Cache缓存下来直接调取。但GPU的HBM(高带宽内存)容量有限且成本高昂,KV Cache随上下文长度和并发请求数线性增长,很快就能撑爆显存。中科曙光分布式存储产品部总经理石静指出,KV Cache在推理过程中的内存开销可达数十乃至数百GB,远超单张顶级GPU的显存容量,显存一旦占满,新请求无法进入,正在处理的请求开始卡顿。
解决显存墙有两条技术路线:一是在算法层面压缩KV Cache体积,二是将KV Cache从HBM卸载到CPU DRAM、本地SSD或分布式存储等更大容量、更低成本的介质上。后者已成为厂商重点布局的方向。开源的LMCache可在GPU、CPU和本地磁盘之间灵活存储KV Cache,实测数据显示在多轮问答和RAG场景中可实现3至10倍的延迟降低。谷歌云在2025年推出了基于Managed Lustre的外部KV Cache方案,据披露可将TCO降低35%,用约40%甚至更少的GPU支撑同样工作负载。
但这些方案大多是单机版,存在节点级资源孤岛问题。石静表示,LMCache虽能破除KV Cache的实例级隔离,但在HBM、DRAM、Local SSD三级仍存在节点级资源孤岛,导致资源利用率低,A节点缓存的KV Cache无法被B节点使用,只能各自重新计算。同时,模型推理引擎、框架原生组件、第三方KV组件各有元数据管理方式,三层嵌套缺乏全局视角,石静称之为“元数据迷雾”。更关键的问题在L4层(分布式存储层),分布式存储的强一致性锁机制带来较大延迟,长期被当作“冷数据仓库”使用,无法直接参与推理的实时数据流动。
针对这一卡点,中科曙光在2026中国国际大数据产业博览会期间发布了ParaCache,其核心思路是将KV Cache的管理从单机扩展到集群,在L1 HBM、L2 CPU DRAM、L3 SSD、L4分布式存储四个层级实现全局池化和动态调度。在L3层,ParaCache将集中式存储FlashNexus纳入缓存体系,通过存算解耦实现全局共享,单阵列提供160GB/s带宽能力,实测在TTFT、QPS、吞吐量等关键指标上比本地NVMe SSD有接近2倍的提升。在L4层,ParaStor F9000提供单框220GB/s带宽和1000万IOPS,ParaCache针对KV Cache应用做了定向优化:将offset覆盖写改为追加写降低延迟;在KV Cache场景下对锁机制做轻量化处理,基于目录去掉分布式锁;在PD分离架构下只让节点间传输增量KV,节省集群网络带宽。
在全局调度层面,ParaCache提出“Best-effort数据预取”机制,利用推理框架判断KV是否存在与调用数据获取之间的时间差,提前将已卸载到L3或L4的冷KV预取到所需层级。石静介绍,测试数据显示,在多轮对话场景下(30k初始输入叠加20轮对话),ParaCache让首次延迟降低了89%;在多并发场景下,相较于仅使用HBM的方案,吞吐量提升了近26倍;在与头部互联网厂商的在线推理业务合作中,TTFT降低了77%,P99 TTFT优化了84%。
KV Cache的池化共享正在成为AI基础设施演进的重要方向。随着推理算力占比持续提升,存储系统的性能与调度能力将直接影响大模型应用的落地效果,这一领域的竞争预计将进一步加剧。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。