字节跳动Seed研究团队近日发表论文,揭示国产大模型DeepSeek-V4系列的一项关键缺陷:输入信息的位置对模型表现有显著影响,同一条信息放在不同位置,检索准确率最大可相差40.2个百分点。
每隔4个Token周期性变化
研究人员以128K长上下文检索任务为测试场景,发现DeepSeek-V4-Flash-Base的表现随信息输入位置呈周期性波动——每隔约4个Token,准确率就会经历一轮「对→错→对」的轮回。测试中正确答案应补全为「8」,但填充长度落在某些特定区间时,模型会错误地输出「32」。这一现象在代码补全任务中同样成立。
根因:长上下文优化技术副作用
团队进一步追溯,发现这一现象与DeepSeek-V4采用的长上下文优化技术直接相关。该技术原本旨在降低模型处理长文本时的显存占用并提升效率,但压缩过程意外导致信息在特定位置上被「遮蔽」,模型时神时鬼,表现极不稳定。字节Seed已将问题归因于DeepSeek-V4自身架构特性,建议社区在长上下文任务中重点关注输入布局策略,并已将代码与测试数据开源供社区复现与进一步研究。
对长上下文应用的警示
这一发现对使用DeepSeek-V4处理长文档的企业级应用具有直接警示意义:同样的检索请求,可能仅因措辞长度不同就得到截然不同的答案。字节Seed建议开发者在构建长上下文应用时,对关键信息进行多位置交叉验证,以规避该偏差对业务决策的影响。
相关阅读:DeepSeek融资至少120亿美元:腾讯/CATL领投,估值750亿冲刺科创板IPO
延伸:长上下文能力与资本同步推进
位置敏感性之外,DeepSeek 的训练底座与融资进度也值得对照。本站此前记录过 DeepSeek 公开的 V4.1 训练底座 DSec,可做到每秒 5000 个沙盒;融资方面,据彭博社 10 月 6 日报道,DeepSeek 本轮目标从 500 亿元人民币起跳,已签署的 Term Sheet 总额正向 1000 亿元人民币靠拢,估值由 520 亿美元升至 750 亿美元。
相关阅读:DeepSeek 公开 V4.1 训练底座 DSec:每秒 5000 沙盒|DeepSeek融资至少120亿美元:腾讯/CATL领投,估值750亿冲刺科创板IPO
延伸阅读
- DeepSeek 又调计费规则,周末全天按谷底价结算2 月前
- DeepSeek V4.1 Flash 正式发布:V4 Pro 将于 9 月 14 日退役,官网三入口合一4 周前
- 智谱 GLM-5.3-Flash 夜间免费用:9月3日至20日每晚23点至次日9点全免1 月前
- Kimi K3.1 后台标识泄露,100 万 Token 配三档推理2 周前
