深度求索(DeepSeek)于2026年9月10日发布 V4.1 Flash 模型,这是其全新模型结构系列的最小尺寸版本,具备原生多模态视觉理解能力,主打低成本、高吞吐、可扩展三大特性,已同步上线 DeepSeek API、发布技术报告,并开源模型权重至 Hugging Face。
552B MoE架构:输入激活仅8B
V4.1 Flash 为 552B 参数的混合专家(MoE)模型,采用全新 Causal-Encoder-Decoder 结构,特点是输入输出不对称——输入激活参数仅 8B,输出激活 16B,成本显著低于同尺寸竞品。深度求索表示,经更大规模强化学习后训练,V4.1 Flash 在基准测试中已全面超越 V4 Pro,并将作为官方合作伙伴 WorkBuddy(含 CodeBuddy)和 OpenCode 的推理底座。
KV缓存缩小437倍,Agent使用成本大降
新版模型对 KV Cache 进行了大幅压缩:与初代模型相比,HBM 需求降至1/4,SSD 需求降至1/8,整体缓存体积缩小至原来的1/437。深度求索解释,在 Agent 使用场景中缓存命中费用占比较高,压缩后单次任务成本明显下降。
V4 Pro退役、定价下调、峰谷计价
调用名称改为 deepseek-flash。北京时间9月14日12:00起,deepseek-v4-pro 的全部请求已路由至 V4.1 Flash 并按后者单价计费,V4 Pro 正式下线。得益于架构优化,V4.1 Flash 定价相应下调,并采用峰谷定价策略,闲时价格为高峰时段的一半,鼓励用户按实际需求灵活调整任务执行时间窗口。模型开源同步配套完整技术报告,方便社区进行推理适配与部署。
相关阅读:DeepSeek V4.1 Flash发布:552B MoE、KV缓存缩437倍、V4 Pro退役
更正:V4 Pro 强制下线计划已撤回
本文引用的官方公告称 V4 Pro 将于 9 月 14 日 12:00 下线,请求全部路由至 V4.1 Flash。据 DeepSeek 9 月 11 日发布的后续公告,这项强制迁移计划已经撤回:V4 Pro API 继续保留,计费方式不变,自动路由安排一并取消。上文中关于 V4 Pro 强制下线的表述,以此更正为准。撤回原因来自开发者反馈,生产环境通常已围绕旧模型调好提示词与 Agent 流程,模型被静默替换会让线上行为漂移,回归测试成本不低。
延伸阅读
- DeepSeek Harness 桌面版上线:6 元赠金跑 1.2 亿 token2 周前
- 美团 LongCat-2.5-Preview 发布:1.6T参数、1M上下文,多模态进基座2 周前
- 联想代码智能体登顶全球第一:71%问题解决率超DeepSeek-V41 天前
- DeepSeek-V4-Flash-Vision-Exp 权重开源:168GB、MIT 协议,48 个 Safetensors 分片可私有化部署3 周前
