AI推理过程中的KV Cache正在从服务器内部资源调度问题,演变为一个独立的存储产品品类。在近日举行的华为全联接大会上,华为推出了OceanStor M900,英伟达也已发布CMX Context Memory Storage。这类AI记忆存储产品将推理过程中已产生、可能再次复用的KV Cache进行分层管理和存储,在后续请求命中时减少重复计算,从而降低算力开销。
KV Cache外置的核心逻辑被业内概括为“以存换算”,即在计算成本与存储成本之间寻找平衡点。长期研究存储的学者章衡向雷峰网表示,假设KV Cache命中率从90%提升至95%,需要重新计算的部分将从10%降至5%,相当于重新计算部分的算力开销减少一半。但命中率继续提升意味着需要保存更多历史KV,尤其在高命中率区间,为覆盖最后几个百分点的长尾数据,所需存储容量可能明显增加。
存储位置的选择是另一关键问题。某头部存储厂商负责人李辉指出,若DRAM足够便宜且供应充足,全部放在DRAM中性能最优,但现实是DRAM既贵又缺,这为SSD留出了空间。这种替换并非1:1,从整体成本看,DRAM与SSD之间可能是1:N的关系,部分方案中甚至达到一比五乃至一比十。按相同容量计算,DRAM与企业级SSD的成本可相差数十倍。这一价差正推动内存卸载从资源不足时的兜底手段,进入新系统的初始设计。
不过,独立KV存储设备已经出现,真正承接KV Cache的SSD尚未形成成熟统一的产品品类。李辉透露,行业已开始讨论面向AI推理、尤其是KV Cache负载优化的SSD,但采购端大多数客户买的仍是普通企业级SSD,市场上主流产品仍来自三星、闪迪、美光等厂商的传统企业级SSD。核心原因在于KV Cache给SSD带来的负载特征尚未被完全摸清。李辉举例称,其接触到的一类方案最初对SSD耐写能力的要求约为3 DWPD,后来提高到9 DWPD,指标仍可能继续变化。
指标反复变化首先取决于KV Cache的保存时长。若缓存仅保存几分钟,数据频繁更新将推高SSD每日写入压力,对耐久度要求随之上升;若数据保存数周,写入频率下降后耐写能力不再是主要矛盾,容量需求则更为突出。当前不同业务中的数据生命周期可能从分钟、小时延伸至天甚至周。在应用形态和数据生命周期尚未稳定之前,SSD的容量、耐久度和性能指标难以提前确定。李辉表示,SSD是高度依赖规模的产品,若不同客户各自定义规格,市场将停留在定制化阶段。他估算,行业形成较统一的产品共识可能还需要6至12个月;即使标准确定,后续产品开发、验证和优化还可能再花约1年。
从区域市场看,北美已有客户因AI推理和KV Cache增加SSD采购,中国市场也开始出现加单,但速度相对较慢。目前国内SSD需求的大头仍在训练和常规推理,KV Cache相关需求尚处于方案阶段。KV Cache外置对DRAM负载的缓解较为直接,可减少服务器对大容量DRAM的依赖,但对HBM的缓解并不直接——外部存储更多影响首Token延迟,一旦开始生成Token,后续生成速度仍依赖高速显存。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。