7月的最后一天,DeepSeek 终于在更新日志里放出了重量级消息。官方于今日(2026年7月31日)正式发布 DeepSeek-V4-Flash 公开测试版(Public Beta),这标志着 V4-Flash 从今年4月24日发布的预览版正式毕业,成为可投入生产环境的正式版本。
与预览版相比,V4-Flash-0731 保持了相同的模型架构和参数规模(总参284B,激活13B),仅通过重新后训练(re-post-training)实现了 Agent 能力的显著跃升。官方公布的基准测试数据显示,V4-Flash 正式版在多项关键指标上已大幅超越此前的 V4-Pro 预览版:
Terminal Bench 2.1 达到 82.7,NL2Repo 为 54.2,Cybergym 为 76.7,DeepSWE 为 54.4,Toolathlon verified 为 70.3。此外,在更具挑战性的 Agent Last Exam(25.2)和 Automation Bench 公开测试集(25.1)中也有不错表现,DSBench-FullStack 和 DSBench-Hard 则分别是内部全栈开发测试集和 Coding Agent 难题测试集,分别达到 68.7 和 59.6。
官方同时说明,在公开基准测试集的 Coding Agent 任务中,V4-Flash 正式版使用即将发布的 DeepSeek Harness 极简模式作为框架,配置 max effort level、topp=0.95、temperature=1.0 进行测试。这意味着 DeepSeek 自研的 Harness 编程工具将随 V4-Flash 正式版同步问世,为开发者提供更完整的 Coding Agent 工作流支持。
另一个值得关注的更新是:V4-Flash-0731 原生支持 Responses API 格式,并针对 OpenAI Codex 进行了专门适配。开发者可以通过配置直接用 Codex 调用 DeepSeek-V4-Flash 作为后端模型,实现更灵活的 Agent 集成。
需要注意的是,本次更新仅针对 DeepSeek-V4-Flash API,DeepSeek-V4-Pro API 和 APP/网页端模型暂不受影响。官方在更新日志中明确表示:「DeepSeek-V4-Pro 正式版将稍后发布」。因此,期待「满血版」V4-Pro 的开发者仍需耐心等待。
从定价来看,V4-Flash 延续了 DeepSeek 一贯的高性价比路线,输入 $0.14/M tokens、输出 $0.28/M tokens,比动辄数美元每百万 token 的闭源旗舰模型便宜数十倍。此次 Agent 能力的大幅增强,配合即将发布的 Harness 编程工具,V4-Flash 有望成为开源 Coding Agent 领域的新标杆。
相关阅读
这条线上还有几篇站内文章可以接着看:
- DeepSeek V4 Pro 正式版突袭上线,Agent 跑分直逼 Fable 5,API 价格一分没涨
- 智谱发布 GLM-5.3:基座没换只炼后训,编程提升 50% 登顶开源
- DeepSeek 上线首个多模态模型 V4-Flash-Vision-Exp:一千张图 1.15 元,视觉 Agent 直逼 Opus 4.8
延伸阅读
- 阿里通义 Wan2.2 开源视频生成模型解析:MoE 架构还原电影镜头语言,Apache 2.0 开放权重4 天前
- MiniMax-M1 开源推理模型解析:4560 亿参数、100 万 Token 上下文,54 万美元完成训练4 天前
- needle 开源:2-bit 量化、最小 8MB 端侧模型5 天前
- CogView4 开源文生图模型解析:首个支持汉字生成,DPG-Bench 综合评分开源第一4 天前
