字节Seed揭示DeepSeek-V4位置效应:同题准确率最大相差40.2个百分点

字节Seed研究团队近日在arXiv发表论文,揭示了DeepSeek-V4系列模型存在的一项系统性位置偏差:同一信息放在输入上下文的不同位置,模型检索准确率最大可相差40.2个百分点。

128K上下文实测:最大差距40.2个百分点

研究团队以DeepSeek-V4-Flash-Base为测试对象,在128K Token长上下文的大海捞针测试中发现:将同一条键值对信息置于不同位置时,DeepSeek-V4系列模型的检索准确率呈现明显周期性起伏。其中DeepSeek-V4-Flash-Base在不同位置间的最大准确率差距达40.2个百分点,DeepSeek-V4-Pro-Base差距34.8个百分点。

具体而言,当填充Token长度模4的余数为0或1时,模型倾向于给出错误答案32(概率71.3%);余数为2或3时,正确答案8的概率升至91.5%。整个过程以4个Token为周期重复。

进一步测试还发现,随着模型迭代,该差距逐步收窄:DeepSeek-V4-Flash-0731为19.1个百分点,DeepSeek-V4-Pro-0813为14.8个百分点,DeepSeek-V4.1-Flash-0910进一步降至6.1个百分点。

根因:KV Cache分块压缩引入相位敏感

研究团队将这一问题命名为「相位敏感性」(Phase Sensitivity),并锁定原因为DeepSeek-V4采用的分块KV Cache压缩机制。该技术将连续Token分组压缩以节省内存,但同一信息落在压缩窗口内的不同相对位置时,检索表现出现系统性差异。

团队以Qwen3-0.6B架构为基础进行对照实验,所有采用分块压缩的模型均出现与压缩步长对应的周期性波动,而全注意力基线模型则未出现同等程度的周期性波动。研究还发现,不同注意力头对不同相位的贡献存在差异,形成「相位专门化」(Phase Specialization)现象。

论文链接:https://arxiv.org/pdf/2609.36322

相关阅读:DeepSeek融资至少120亿美元:腾讯/CATL领投,估值750亿冲刺科创板IPO