7月的最后一天,DeepSeek 终于在更新日志里放出了重量级消息。官方于今日(2026年7月31日)正式发布 DeepSeek-V4-Flash 公开测试版(Public Beta),这标志着 V4-Flash 从今年4月24日发布的预览版正式毕业,成为可投入生产环境的正式版本。
与预览版相比,V4-Flash-0731 保持了相同的模型架构和参数规模(总参284B,激活13B),仅通过重新后训练(re-post-training)实现了 Agent 能力的显著跃升。官方公布的基准测试数据显示,V4-Flash 正式版在多项关键指标上已大幅超越此前的 V4-Pro 预览版:
Terminal Bench 2.1 达到 82.7,NL2Repo 为 54.2,Cybergym 为 76.7,DeepSWE 为 54.4,Toolathlon verified 为 70.3。此外,在更具挑战性的 Agent Last Exam(25.2)和 Automation Bench 公开测试集(25.1)中也有不错表现,DSBench-FullStack 和 DSBench-Hard 则分别是内部全栈开发测试集和 Coding Agent 难题测试集,分别达到 68.7 和 59.6。
官方同时说明,在公开基准测试集的 Coding Agent 任务中,V4-Flash 正式版使用即将发布的 DeepSeek Harness 极简模式作为框架,配置 max effort level、topp=0.95、temperature=1.0 进行测试。这意味着 DeepSeek 自研的 Harness 编程工具将随 V4-Flash 正式版同步问世,为开发者提供更完整的 Coding Agent 工作流支持。
另一个值得关注的更新是:V4-Flash-0731 原生支持 Responses API 格式,并针对 OpenAI Codex 进行了专门适配。开发者可以通过配置直接用 Codex 调用 DeepSeek-V4-Flash 作为后端模型,实现更灵活的 Agent 集成。
需要注意的是,本次更新仅针对 DeepSeek-V4-Flash API,DeepSeek-V4-Pro API 和 APP/网页端模型暂不受影响。官方在更新日志中明确表示:「DeepSeek-V4-Pro 正式版将稍后发布」。因此,期待「满血版」V4-Pro 的开发者仍需耐心等待。
从定价来看,V4-Flash 延续了 DeepSeek 一贯的高性价比路线,输入 $0.14/M tokens、输出 $0.28/M tokens,比动辄数美元每百万 token 的闭源旗舰模型便宜数十倍。此次 Agent 能力的大幅增强,配合即将发布的 Harness 编程工具,V4-Flash 有望成为开源 Coding Agent 领域的新标杆。