9月底,字节团队发表论文《Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression》,指出DeepSeek V4系列模型存在因分块KV Cache压缩技术导致的周期性准确率波动问题。研究显示,在特定位置条件下,模型对同一问题的回答准确率可从91.5%骤降至71.3%,暴露出当前长上下文压缩方案的一项结构性缺陷。
该问题的发现源于一次代码补全测试。研究人员让DeepSeek-V4-Flash-Base补全一段FP8量化函数的最后一个Token,正确结果应为8。当在代码前加入纯装饰用的等号后,模型输出了32。进一步测试表明,错误与等号数量存在直接关联:等号数量除以4,余数为0或1时,模型错误率高达71.3%;余数为2或3时,正确率回升至91.5%。
字节团队将这一现象归因于分块KV Cache压缩技术引入的“相位敏感性”。该技术将连续Token按固定长度切割,每段内的Token通过可学习门控层压缩为摘要,以降低长上下文显存压力。但压缩后,Token在压缩段内的位置变得至关重要,门控层为不同位置分配不同权重。排在强势槽位的Token被加权保留,模型可精准作答;排在盲点槽位的Token几乎被忽略,模型则给出错误结果。注意力头也在训练中形成自然分工,部分专门处理段内靠前位置,部分处理靠后位置,进一步固化了薄弱环节。
为验证该问题的普遍性,研究人员构造了128K Token长度的“大海捞针”测试,包含约1.6万个键值对。在键值关系、问题和上下文总长度不变的情况下,仅调整其中一个键值对的位置,DeepSeek-V4-Flash-Base的准确率最大差距达40.2%,DeepSeek-V4-Pro-Base差距为34.8%。经过后训练优化后,两者差距仍分别有19.1%和14.8%。
DeepSeek在V4.1-Flash版本中将压缩步长从4减半至2,使准确率差距降至6.1%,但问题并未完全消除。字节团队随后用Qwen3-0.6B架构从头训练了一批模型,仅改变压缩机制。结果显示,所有采用分块压缩的模型均出现周期性准确率波动,波动周期严格等于压缩步长;未采用压缩的全注意力基线模型无此现象;去掉RoPE位置编码或改用平均分配门控权重,波动依然存在。这表明该问题是分块压缩方案本身的结构性缺陷。
业界已有研究指向“动态分块”作为潜在解决路径。该方案放弃按固定Token数量切分,转而根据语义和重要性动态调整边界:信息密度低的区域大块合并,关键转折和高密度信息区域精细拆分。这一思路要求从注意力数学基础、显存管理到硬件对齐进行全栈重构,包括从静态连续矩阵向拓扑稀疏矩阵演进,以及通过零填充算法解决GPU对规整矩阵运算的偏好问题。
该论文揭示的问题并非DeepSeek独有。在行业普遍追求降低长文本处理成本的背景下,任何采用分块压缩或稀疏化技术的模型都可能面临类似风险,包括开源的Llama 3系列。对于将大模型应用于合同审阅、代码生成等长上下文场景的企业而言,关键信息落入“信息盲区”可能导致输出结果出现难以察觉的系统性偏差。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。