DeepSeek V4.1 Flash发布:552B MoE、KV缓存缩437倍、V4 Pro退役

2026年9月10日,DeepSeek正式发布V4.1 Flash——一个552B参数的MoE模型,采用全新Causal-Encoder-Decoder非对称结构,输入激活仅8B、输出激活16B,在Agentic Benchmark上全面超越V4 Pro,同时HBM需求降至上一代的1/4、SSD需求降至1/8,KV Cache累计压缩437倍。更关键的是:V4.1 Flash发布即同步降价,旧版V4 Pro将在9月14日被强制下线路由至此。本文用数据说清楚它强在哪里、贵不贵、以及谁该用它。

一、架构革新:非对称设计,小成本大智能

DeepSeek V4.1 Flash最大的结构变化是引入Causal-Encoder-Decoder架构——输入侧与输出侧不再对称。模型总参数552B,输入激活仅8B,输出激活16B。这意味着处理相同上下文时,实际计算的算力消耗远低于同等规模的对称模型。

作为对比,同期发布的Qwen3.8-Omni-Flash采用类似思路(每Token仅激活6B),但V4.1 Flash的独特之处在于它专为Agent场景设计:模型预训练阶段加入了大规模强化学习后训练(RL post-training),使模型在多步骤推理、工具调用、状态追踪等Agent核心任务上的表现显著提升。

二、基准测试:超越V4 Pro,逼近旗舰梯队

官方以Agentic Benchmark为标尺,将V4.1 Flash与DeepSeek V4 Pro、Qwen3.8-Max、GPT-6等主流旗舰模型横向对比,V4.1 Flash在所有测试维度均排名第一,全面超越V4 Pro。

模型 总参数量 激活参数量(输入/输出) Agentic Benchmark排名 多模态支持
DeepSeek V4.1 Flash 552B MoE 8B / 16B 第1名 原生多模态视觉理解
DeepSeek V4 Pro — — 被超越 —
Qwen3.8-Max 2.4T MoE — — 原生多模态
GPT-6.1 Sol — — 全球前列 原生多模态

需要注意的是:Agentic Benchmark主要衡量Agent任务能力(任务拆解、工具调用、状态管理),而非通用知识或编程能力,因此不能简单等同于综合榜单排名。但对实际部署Agent应用的用户而言,这个指标比MMLU更有参考价值。

三、KV Cache压缩:HBM需求降至1/4,累计缩小437倍

大模型推理成本中,KV Cache占用内存是最大的瓶颈之一。V4.1 Flash通过架构层面的稀疏注意力机制改进,将单次推理的KV Cache占用大幅压缩:

  • HBM(显存)需求:降至上一代V4系列的1/4
  • SSD(存储)需求:降至上一代的1/8
  • 相比初代DeepSeek模型:KV Cache已累计缩小437倍

对于Agent应用而言,缓存命中费用往往占总成本的较高比例。以一次100轮对话的Agent任务为例,V4.1 Flash的缓存费用约为V4 Pro的1/4,成本结构发生根本性改变。这一数据对有规模化部署需求的开发者最为关键。

四、API定价:V4 Pro强制退役,峰谷定价再优化

V4.1 Flash上线同步调整了定价体系,并引入更精细的峰谷定价机制:

计费维度 V4.1 Flash定价逻辑 与V4 Pro对比
模型名称 deepseek-flash(调用入口) V4 Pro 9月14日下线
兼容路由 deepseek-v4-flash、deepseek-v4-flash-vision-exp暂时路由至V4.1 Flash 完全兼容,无需改代码
计费模式 峰谷定价(闲时为高峰半价) 引导用户错峰使用
V4 Pro去向 9月14日12:00后请求全部路由至V4.1 Flash,按V4.1 Flash单价计费 永久降价75%变向实现

官方明确表示:V4.1 Flash在性能、费用、速度、总用时等各项指标上已全面超越V4 Pro,因此有序下线V4 Pro。换句话说,这不是简单的模型迭代,而是一次升维打击——用更低的成本获得更强的Agent能力。

五、开源策略:全力支持推理适配,大规模部署开放合作

DeepSeek在官方公告中表示,将全力支持开源社区对新模型的推理适配,并明确提出规模化部署的合作意向:

  • 权重开源:V4.1 Flash权重已上传Hugging Face(DeepSeek-V4.1-Flash),采用MIT协议
  • 技术报告:官方同步发布DeepSeek-V4.1-Flash技术报告,详细描述架构设计与训练方法
  • 规模化合作:具备2k GPU卡+存储集群条件的团队可联系DeepSeek进行深度合作

对比来看,V4 Pro永久降价75%后单百万Token仅需2分钱,V4.1 Flash预计将进一步拉低价格底线。这延续了DeepSeek”价格屠夫”的定位,但这次不只是降价——而是把价格降建立在架构效率提升的基础上。

FAQ:关于DeepSeek V4.1 Flash的几个关键问题

Q1:V4.1 Flash和V4 Flash是什么关系?
V4.1 Flash是V4 Flash的下一代升级版,采用全新Causal-Encoder-Decoder架构,各项指标全面超越。V4 Flash和V4 Flash Vision Exp已下线,调用入口统一为deepseek-flash。

Q2:V4 Pro还能用吗?会不会突然涨价?
V4 Pro已于9月14日12:00后永久下线,请求自动路由至V4.1 Flash,按V4.1 Flash价格计费。不会出现额外费用。

Q3:V4.1 Flash适合什么场景?
最适合需要多步骤推理、工具调用、长程记忆管理的Agent应用。相比纯聊天场景,KV Cache压缩带来的成本优势在长对话/多轮任务中体现最明显。

小结

DeepSeek V4.1 Flash的核心竞争力不在于参数量的堆砌,而在于架构效率的质变:用不对称设计把激活参数压到8B/16B,用稀疏注意力把KV Cache压缩到初代的1/437,用RL后训练让Agent任务表现超越前代旗舰。这是一套从底层架构到产品定价完全围绕”规模化Agent部署”重新设计的产品思路。随着V4 Pro的退役,DeepSeek正式进入”Flash系列”主导的性能价格比竞争阶段——这对开发者意味着更低的接入成本,对行业意味着推理效率的军备竞赛进入新层级。

后续更新:V4 Pro 退役计划已撤回

本文引用的官方公告称 V4 Pro 将于 9 月 14 日 12:00 下线,请求全部路由至 V4.1 Flash。9 月 11 日 DeepSeek 已宣布撤回该强制迁移计划,V4 Pro API 继续保留、计费方式不变,自动路由安排一并取消。正文中关于强制下线的表述,以此后续公告为准。

撤回的直接原因是开发者反馈。生产环境通常已经围绕旧模型调好了提示词与 Agent 流程,模型被静默替换会让线上行为漂移,回归测试成本不低。这次调整说明模型服务进入存量阶段后,厂商推进版本迭代时必须把用户的迁移成本算进去。

迁移到 V4.1 Flash 的实际步骤

官方把调用入口简化为 deepseek-flash,旧模型名在一段时间内继续路由过去,给存量系统留出了窗口。迁移工作集中在两件,一是把模型名换掉,二是用真实流量跑一轮对照,确认输出格式与响应风格没有影响下游解析。

峰谷定价对成本敏感的场景意味着错峰调用能进一步压价,值得在调度层做一层优化。不过要注意缓存命中率的变化,缓存便宜的前提是调用模式真的命中缓存,任务设计不变的话,省下的幅度会小于账面数字。

相关阅读