8月21日,DeepSeek 在 API 平台上悄悄挂出了一个新模型,DeepSeek-V4-Flash-Vision-Exp。这是 V4 系列第一个带眼睛的版本,名字里的 Exp 是 experimental 的意思,明摆着告诉你是来试水的。
它干的事很简单,在 V4-Flash 的文本能力基础上加了图像理解。推理、写代码、当 agent 这些老本事一点没丢,现在还能看图说话,截图、图表、照片都能喂进去分析。上下文窗口保持 100 万 token,最大输出 38.4 万 token,跟 V4-Flash 完全一致。
关键是价格。图像按最多 384 tokens 计费,沿用 V4-Flash 的定价,算下来一千张图大概 1 块 1 毛 5,折合美元不到两毛。这个价位放在多模态模型里基本是白菜价,之前 DeepSeek 就靠价格屠夫的名号打天下,这回把视觉也拖进了价格战。
性能上 DeepSeek 放出的自测数据挺能打。多模态 agent 基准里,Agents Last Exam 拿到 27.3 分,Anthropic 的 Claude Opus 4.8 是 25.7 分,反超了。图像理解测试 ZeroBench 是 35.0 对 34.0,也赢了。ApexBench 上 36.5 对 39.4,还差一点。安全基准 Cybergym 从 V4-Flash 的 76.7 掉到 75.3,小幅回落。整体看,DeepSeek 的说法是视觉 agent 能力已经逼近 Opus 4.8。
配套动作也没落下。同一天上线了免费的 Files API,图片可以先上传拿 file_id 反复引用,不用每次重新传;DeepSeek Harness 更新到 0.1.1,开箱就支持这个新模型。
不过 DeepSeek 这次藏了不少细节。参数量没公布,技术报告没发,视觉基准测试结果也没给,连会不会像以前那样开源到 Hugging Face 都没松口。有分析说它被归在 V4-Flash 产品线而不是 V4-Pro,还挂着 Exp 后缀,这路子跟当年 V3.2-Exp 一样,先用实验版验证技术方向,收一波社区反馈,再推正式版。至于底层是原生训练的多模态架构,还是给 V4-Flash 外挂一个视觉编码器,现在谁也说不准。
从时间点上看,这步棋走得挺急。DeepSeek 正在筹备 IPO,Bloomberg 报道说 2026 年就可能提交申请,2027 年上市。国内阿里、月之暗面在追,美国那边 Anthropic、OpenAI 也没闲着,这时候把视觉能力补上,等于给估值故事加了一块拼图。
一千张图一块一毛五,视觉 agent 叫板 Opus 4.8。这个 Exp 版能跑多远,就看开发者愿不愿意接住它了。
