DeepSeek V4.1 Flash发布:552B MoE架构,KV缓存缩437倍

深度求索(DeepSeek)于2026年9月10日发布 V4.1 Flash 模型,这是其全新模型结构系列的最小尺寸版本,具备原生多模态视觉理解能力,主打低成本、高吞吐、可扩展三大特性,已同步上线 DeepSeek API、发布技术报告,并开源模型权重至 Hugging Face。

552B MoE架构:输入激活仅8B

V4.1 Flash 为 552B 参数的混合专家(MoE)模型,采用全新 Causal-Encoder-Decoder 结构,特点是输入输出不对称——输入激活参数仅 8B,输出激活 16B,成本显著低于同尺寸竞品。深度求索表示,经更大规模强化学习后训练,V4.1 Flash 在基准测试中已全面超越 V4 Pro,并将作为官方合作伙伴 WorkBuddy(含 CodeBuddy)和 OpenCode 的推理底座。

KV缓存缩小437倍,Agent使用成本大降

新版模型对 KV Cache 进行了大幅压缩:与初代模型相比,HBM 需求降至1/4,SSD 需求降至1/8,整体缓存体积缩小至原来的1/437。深度求索解释,在 Agent 使用场景中缓存命中费用占比较高,压缩后单次任务成本明显下降。

V4 Pro退役、定价下调、峰谷计价

调用名称改为 deepseek-flash。北京时间9月14日12:00起,deepseek-v4-pro 的全部请求已路由至 V4.1 Flash 并按后者单价计费,V4 Pro 正式下线。得益于架构优化,V4.1 Flash 定价相应下调,并采用峰谷定价策略,闲时价格为高峰时段的一半,鼓励用户按实际需求灵活调整任务执行时间窗口。模型开源同步配套完整技术报告,方便社区进行推理适配与部署。

相关阅读:DeepSeek V4.1 Flash发布:552B MoE、KV缓存缩437倍、V4 Pro退役

更正:V4 Pro 强制下线计划已撤回

本文引用的官方公告称 V4 Pro 将于 9 月 14 日 12:00 下线,请求全部路由至 V4.1 Flash。据 DeepSeek 9 月 11 日发布的后续公告,这项强制迁移计划已经撤回:V4 Pro API 继续保留,计费方式不变,自动路由安排一并取消。上文中关于 V4 Pro 强制下线的表述,以此更正为准。撤回原因来自开发者反馈,生产环境通常已围绕旧模型调好提示词与 Agent 流程,模型被静默替换会让线上行为漂移,回归测试成本不低。