8 月 12 日晚上,DeepSeek 的 API 文档悄悄更新了一行字,模型版本从 V4 Pro 预览版换成了 DeepSeek-V4-Pro-0813。没有发布会,没有预告海报,官方博客连更新日志都还没发,V4 Pro 正式版就这么上线了。最先察觉到变化的是正在调 API 的开发者,他们说思维链输出的风格明显不一样了。
这一等就是 111 天。4 月 24 日 DeepSeek 发布 V4 Preview 时,V4 Pro 和 V4 Flash 一起亮相,Pro 是整条产品线的旗舰,总参数量 1.6T,每个 Token 激活约 49B 参数,支持 100 万 Token 上下文。7 月 31 日 V4 Flash 正式版先到,官方当时特意说明这次只更新 Flash,Pro 正式版随后就发。如今最后一块拼图终于补上,V4 这一代的产品轮廓完整了。
Agent 能力是这次升级的重头戏。从流出的跑分图看,Terminal Bench 2.1 拿到 87.9 分,Fable 5 是 88.0,差距已经缩小到小数点后一位。在 AI 安全智能体基准 Cybergym 和工作流智能体 AutomationBench 上,V4 Pro 正式版直接反超了 Fable 5。最夸张的是 DeepSWE,这个针对长周期真实软件工程的测试,预览版只有 12.8 分,正式版一口气冲到 62.7。HLE、Terminal Bench 这些榜单上,对 Opus 4.8 基本是全方位压制。
参数层面,100 万 Token 上下文配合 38.4 万 Token 最大输出,处理长代码库和长文档比上一代从容不少,多步骤 Agent 任务一次调用就能装下更多内容。思考模式和非思考模式都保留,默认走思考模式。JSON 结构化输出、工具调用、Responses API、Anthropic API 兼容这些 Agent 开发的标配全部就位,对话前缀延续和 FIM 补全也开放了测试版支持,FIM 只能在非思考模式下用。
价格是另一个看点。输入 3 元、输出 6 元每百万 Token,缓存命中输入只要 0.025 元,和预览版一模一样。要知道 8 月 6 日 DeepSeek 刚预告过要大幅上调 API 定价,这次转正反而没动价格。不过定价页上那句涨价提示还挂着,说涨幅可能比较大,重度调用方最好留意后续通知。
至此 DeepSeek V4 的分层也清楚了。Flash 输入 1 元输出 2 元,并发上限 2500,扛高频低成本的流量。Pro 贵三倍,并发压到 500,把算力留给复杂推理、长上下文编码和更难的 Agent 任务。两条轨道,各管一摊。
社区里也有吐槽。有网友对比了网页版和 API 的思维链输出,说 API 端的话术读起来生硬、语序别扭,像是压缩过的山顶洞语。这种风格牺牲了一部分写作质量,但能大幅减少 Token 消耗,考虑到现在的重心全在 Coding 和 Agent 上,也算一种取舍。同一晚马斯克的 Grok 4.6 也上线了,两个旗舰撞在同一天,接下来有得比了。
官方博客的详细解读大概白天就会补上。DeepSeek 那边还有 Harness 这个官方编程工具在内测,据说会和 Pro 组成黄金搭档。凌晨上线的模型,今天白天应该就有人拿它跑任务了,第一批实测数据已经在路上。
