一句话结论:字节Seed团队实证了DeepSeek-V4长上下文检索的周期性弱点源于分块KV缓存压缩,根源在Token相对于压缩窗口边界的位置,而非模型能力本身;该发现对评估和使用分块压缩模型具有普适性指导价值。
事件背景:DeepSeek为何「时灵时不灵」
2026年9月底,字节跳动Seed团队在arXiv发表论文《Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression》,首次系统揭示了一个长期被平均基准分掩盖的模型缺陷:DeepSeek-V4在处理长文本时,同一条信息放在不同位置,模型找到它的准确率可以相差高达40个百分点。
这一现象并非DeepSeek独有——团队用Qwen3-0.6B从零训练的对照实验证明,所有采用分块KV缓存压缩(chunked KV-cache compression)的模型都存在类似周期性弱点。
技术根因:分块压缩引入的「相位」坐标
主流大模型为降低长上下文推理的内存和计算成本,普遍采用KV缓存压缩技术。DeepSeek-V4在此基础上更进一步,使用固定步幅(stride)的分块压缩:将连续若干个Token打包成更少的缓存条目,每个Token由此获得了一个新位置坐标——团队称之为「相位」(phase),即该Token相对于压缩窗口边界的位置。
问题在于,相位不同,模型对该位置信息的检索能力也不同。在128K token(约13万词元)的「大海捞针」检索测试中,研究人员构造约1.6万个键值对,仅改变目标信息相对于压缩窗口边界的位置。结果显示:DeepSeek-V4-Flash-Base不同位置最大准确率差距达40.2个百分点;DeepSeek-V4-Pro-Base差距为34.8个百分点。
后训练(post-training)可以显著缩小这一差距:DeepSeek-V4.1-Flash-0910将步幅从4缩短为2后,差距降至6.1个百分点,但周期性模式仍然存在。
代码实验:装饰性文档字符串就能让答案「跳变」
论文中有一个极具说明力的对照实验。研究人员让DeepSeek-V4-Flash-Base补全一段FP8量化函数代码,正确答案是8。他们在该代码前加入纯装饰性的文档字符串(仅含重复等号),通过调整等号数量改变填充长度——代码本身和正确答案均未变。
结果:填充长度模4余0或1时,模型给出错误答案32(平均概率71.3%);余2或3时,模型给出正确答案8(平均概率91.5%)。整个过程以4个Token为周期反复横跳,与KV缓存压缩的步幅完全吻合。
机理分析:注意力头的「相位专门化」
团队进一步从零预训练了一族以Qwen3-0.6B为基础的小型Transformer,仅改变KV压缩设计,所有分块压缩变体均复现了与步幅匹配的周期性波动,而全注意力基线模型则未出现此现象——排除了偶然因素。
机制分析(mechanistic analysis)还发现,不同注意力头对不同相位的检索贡献存在系统性不对称,模型内部形成了「相位专门化」(phase specialization)现象:某些注意力头专门处理特定相位的Token,而同一信息换一个相位就被其他头处理,检索效果因此不同。
评测启示:平均分正在掩盖系统性缺陷
论文的核心诉求之一是重新审视长上下文模型的评估方法。传统基准测试(如大海捞针)通常报告平均准确率,但这一数字可以与系统性位置缺陷共存:一个模型可能在50%的位置接近满分,在另外50%的位置几乎完全失效,平均分依然亮眼。
团队建议:采用分块KV缓存压缩的模型,应在多个压缩相位下分别测量检索表现,例如在保持查询目标不变的前提下略微平移输入文本,以暴露相位差异。
缓解路径:架构调整与后训练
目前已验证有效的缓解路径有两条。一是架构层面的调整——DeepSeek-V4.1-Flash将压缩步幅从4缩短为2后,差距从40.2个百分点降至6.1个百分点,周期也从4 Token缩短为2 Token,说明减少压缩粒度有助于缓解相位敏感性。二是后训练——即便不改变架构,仅通过后训练也能显著提升各相位的检索准确率并缩小差距。
值得注意的是,去除RoPE(旋转位置编码)或改用平均压缩权重均无法消除该现象,表明相位敏感性是分块压缩结构的内在属性,而非某个具体实现的偶发缺陷。
数据对比:主要发现一览
下表汇总了论文核心测试结果:
| 模型版本 | 步幅 | 最大相位差距 | 后训练效果 |
|---|---|---|---|
| DeepSeek-V4-Flash-Base | 4 | 40.2个百分点 | 差距缩至19.1个百分点 |
| DeepSeek-V4-Pro-Base | 4 | 34.8个百分点 | 未报告 |
| DeepSeek-V4.1-Flash-0910 | 2 | 6.1个百分点 | 周期性仍存在 |
实验同时覆盖了不同历史预算(120K字符 vs 480K字符),结果显示:较大的历史预算能让模型在更多步骤上保持上下文完整性,减少因信息丢失导致的检索失败。
结语与FAQ
这个发现对普通用户有什么影响?
如果你使用基于DeepSeek-V4的长上下文应用(如长文档分析、代码库问答),结果可能出现看似无规律的波动:同样的问题,换一个问法或改变输入长度,答案质量可能相差甚远。该发现提示用户和开发者对分块压缩模型应保持警觉,尤其在关键信息检索场景。
其他模型是否也有这个问题?
字节Seed团队的对照实验表明,所有采用分块KV缓存压缩的模型都会出现类似问题,并非DeepSeek独有。这意味着任何使用类似压缩技术的模型都可能存在「相位敏感性」缺陷,需要在评估时特别关注不同位置的表现差异。
这个问题能被彻底修复吗?
目前来看,完全消除相位敏感性需要架构层面的根本性改变。步幅缩短能显著缓解(6.1个百分点 vs 40.2个百分点),但无法彻底消除;后训练可以提升各相位表现,但周期性仍存在。该问题的彻底解决可能需要全新的缓存压缩范式。
相关阅读:
· Nous Research融资15亿美元:开源Agent如何撑起15亿估值 —— Nous Research报告显示,其开源Agent在全球AI推理量中承担约2.5%Token使用量,与本文DeepSeek-V4的Token处理能力形成对照
· Qwen-Image-2.1-Turbo开源:8步出图,把采样调度写进权重里 —— 阿里云通义千问团队在视觉模型中同样采用权重内嵌调度策略,与DeepSeek-V4的缓存架构优化思路相互印证
· 谷歌云发布Gemini Agent,综合成本降至三分之一,90%财富100强已入场 —— 上下文窗口管理是Gemini Agent降本的核心技术之一,与本文相位敏感性对长上下文影响的讨论高度相关
论文来源:arXiv:2609.36322(2026年9月28日提交)
作者:字节跳动Seed团队(主要作者:Yiyuan Ma、Xin Dong;部分成员同时隶属普林斯顿大学、斯坦福大学、加州大学伯克利分校,核心工作于字节Seed实习期间完成)
相关阅读:联想代码智能体登顶全球第一:71%问题解决率超DeepSeek-V4
延伸阅读
- AI 恶意软件 ClosedQuorum 现身 Win11:入侵后自主决策2 周前
- 字节Seed揭示DeepSeek-V4位置效应:同题准确率最大相差40.2个百分点3 小时前
- 字节Seed发现DeepSeek-V4位置怪癖:同一信息换个位置检索准确率相差40.2%14 小时前
- DeepSeek 公开 V4.1 训练底座 DSec:每秒 5000 沙盒1 周前
