字节Seed研究团队近日在arXiv发表论文,揭示了DeepSeek-V4系列模型存在的一项系统性位置偏差:同一信息放在输入上下文的不同位置,模型检索准确率最大可相差40.2个百分点。
128K上下文实测:最大差距40.2个百分点
研究团队以DeepSeek-V4-Flash-Base为测试对象,在128K Token长上下文的大海捞针测试中发现:将同一条键值对信息置于不同位置时,DeepSeek-V4系列模型的检索准确率呈现明显周期性起伏。其中DeepSeek-V4-Flash-Base在不同位置间的最大准确率差距达40.2个百分点,DeepSeek-V4-Pro-Base差距34.8个百分点。
具体而言,当填充Token长度模4的余数为0或1时,模型倾向于给出错误答案32(概率71.3%);余数为2或3时,正确答案8的概率升至91.5%。整个过程以4个Token为周期重复。
进一步测试还发现,随着模型迭代,该差距逐步收窄:DeepSeek-V4-Flash-0731为19.1个百分点,DeepSeek-V4-Pro-0813为14.8个百分点,DeepSeek-V4.1-Flash-0910进一步降至6.1个百分点。
根因:KV Cache分块压缩引入相位敏感
研究团队将这一问题命名为「相位敏感性」(Phase Sensitivity),并锁定原因为DeepSeek-V4采用的分块KV Cache压缩机制。该技术将连续Token分组压缩以节省内存,但同一信息落在压缩窗口内的不同相对位置时,检索表现出现系统性差异。
团队以Qwen3-0.6B架构为基础进行对照实验,所有采用分块压缩的模型均出现与压缩步长对应的周期性波动,而全注意力基线模型则未出现同等程度的周期性波动。研究还发现,不同注意力头对不同相位的贡献存在差异,形成「相位专门化」(Phase Specialization)现象。
论文链接:https://arxiv.org/pdf/2609.36322
相关阅读:DeepSeek融资至少120亿美元:腾讯/CATL领投,估值750亿冲刺科创板IPO
延伸阅读
- DeepSeek 公开 V4.1 训练底座 DSec:每秒 5000 沙盒1 周前
- DeepSeek Harness 安装教程,npx 一条命令跑起本地 AI 编程助手2 月前
- DeepSeek Harness 插件大盘点,20+ 社区插件让 DSH 真正好用起来2 月前
- 杭州政府联合智谱推出全城 Coding 补贴计划,个人年卡最高享 5.1 折4 周前
