2026年10月1日,黑森林实验室(Black Forest Labs)正式开放 FLUX 3 Image 的计量 API,同步透露开源权重将在数周内发布,第三方消息将日期指向 10 月 6 日。消息一出,图像生成社区迅速将 FLUX 3 与 Midjourney V7、DALL-E 3、Ideogram 4.5 等闭源竞品拉入对比表格。
一句话结论:FLUX 3 的核心突破不是「生成更好看」,而是「让你在已经满意的图上只改一个地方,其余像素纹丝不动」,配合最高 4K 输出和最多 10 张参考图,它正在把 AI 图像从一次性生成品变成可持续编辑的生产资料。
像素级多轮编辑:只改你要改的地方
FLUX 3 Image 最核心的能力是「非破坏性编辑」。开发者用边界框(bounding box)把画面切成 0 到 1000 的网格,每个框有独立 ID,只修改指定区域,其余像素保持不变。官方实测数据:去除一只猫保留 80.7% 像素,更换 T 恤图案保留 89.7%,改发色这类高难度操作也保留了 67.8%。
这种能力直接解决了一个行业痛点:多轮编辑漂移。传统模型每改一次,人脸变、噪点变、光照漂,十轮之后面目全非。FLUX 3 和 Ideogram 4.5 同期押注同一技术点,说明行业共识已从「生成好看」转向「生产可用」。两家的核心卖点都是「局部修改保真度」,但实现路径不同:Ideogram 强调「反复编辑不降质」,FLUX 3 强调像素级精确控制和批量可编程性。
对于影视和广告行业的实际工作流,这意味着素材从「一次性消耗品」变成「可持续维护的数字资产」。一张 4K 产品图可以在不重新生成整图的情况下更新季节性配色、替换模特服装、调整文字标签,每次修改的边际成本接近于零。
边界框排版:让语言模型也能控制图像布局
边界框是 JSON 格式,长宽坐标标准化为 0–1000 网格。这意味着一个语言模型可以直接生成边界框坐标,再交给 FLUX 3 执行——图像生成由此变成一个可计划的 Agent 任务,而非反复手动调提示词。
这对两类场景意义最大:一是电商批量生成同款产品不同背景的 Banner,商品位置固定、背景批量替换,每个 Banner 的商品区域坐标相同,只需改变背景区域的提示词;二是影视分镜中同一角色跨场景的连续性控制,角色位置写进边界框参数即可保持角色在画面中的相对位置不变。
另一个容易被忽视的优势是分辨率无关性:同一套边界框坐标可以从 768p 一路升到 4K,团队可以先用小图快速draft,确认构图后再升分辨率渲染最终成品,不必每次都在 4K 下试错。
定价与开放节奏
按分辨率阶梯计价,10 月 8 日 15:00 UTC 前全部五折:
| 分辨率 | 标准价(美元/张) | 发布折扣价(至 10/8) |
|---|---|---|
| 768 像素 | $0.041 | $0.0205 |
| 1K(默认) | $0.048 | $0.024 |
| 1.5K | $0.070 | $0.035 |
| 2K | $0.10 | $0.050 |
| 4K | $0.607 | $0.3035 |
参考图每张至少 256×256 像素,最高 16MP,在提示词中用「image 1/image 2」指定位次,不额外计费。企业客户可谈判商业权重授权,在自有基础设施上微调和部署。开源权重(FLUX 3 Dev)将在数周内开放下载,具体大小、许可证和硬件需求尚未公布。开源权重一旦放出,将成为第一个可在消费级 GPU 上跑的生产级 4K 多模态模型——参考 FLUX 1 和 FLUX 2 在社区积累的大量微调模型和本地部署教程,FLUX 3 的生态迁移成本将非常低。
95% 算力给视频:图像能力是「顺带」的
黑森林实验室透露,FLUX 3 家族超过 95% 的训练算力投给了视频档,音频相关标记占比不足 0.5%,图像能力继承自视频优先训练过程。这一信息有两层含义。
第一层:FLUX 3 的图像档不是独立研发的,而是视频训练的副产物,但效果已足以与专门优化的闭源模型(Midjourney V7、DALL-E 3)正面对抗,甚至在文本渲染准确性和画面一致性上有优势。这对于一个「副产物」来说相当惊人。
第二层:真正的重头戏是 FLUX 视频档。10 月 6 日若开源权重如期发布,开发者将首次拿到一个在视频和图像上同时达到生产级别的多模态基座,且全部可自托管。对比当前视频生成市场(Runway Gen-3、Kling 可灵等均为闭源 API),开源视频基座的缺席一直是一大空白。
深度开发者选型建议
对于已经在用 Midjourney 或 DALL-E 3 的团队,FLUX 3 的定价(4K 约 $0.30)与竞品相近,真正有差异的是编辑保真度和 API 的结构化程度。如果你需要批量生成海报、分镜、电商素材,边界框的可编程性是独特优势。如果你对图像生成是偶发需求,当前折扣期(至 10 月 8 日)是低成本测试窗口。
对于想自托管的开发者,开源权重是真正的决策点。参考 FLUX 1 和 FLUX 2 在开源社区的接受程度(大量 LoRA 微调、ComfyUI 节点、本地部署脚本),FLUX 3 若保持相同的开放节奏,将成为第一个可在消费级 GPU 上跑的生产级 4K 多模态模型。10 月 6 日的窗口,值得密切关注。
FAQ
FLUX 3 和 FLUX 3 Image 是什么关系?
FLUX 3 是一个多模态模型家族,涵盖图像、视频、音频和机器人动作预测。FLUX 3 Image 是其中图像能力的 API 封装,已上线;FLUX 3 Dev(开源权重基座)尚未发布。
开源权重发布后能否商用?
具体许可证尚未公布。商业权重(可谈判授权)现已对大企业开放;社区版开源权重通常为研究或非商业用途,具体条款等官方公告。
FLUX 3 和 Ideogram 4.5 哪个更好?
两者都主打听从指令的局部编辑能力,具体效果因场景而异。Ideogram 在文字渲染和艺术风格上有积累,FLUX 3 在结构化控制和视频-图像统一基座上有潜力。建议在两者折扣期各跑一批实际素材再决策。
相关阅读
相关阅读:FLUX 3 开源权重 10 月 6 日即将发布(本文姊妹篇,快讯版) · Cloudflare Clef 决策模型:39ms 延迟、Apache 2.0 开源(决策模型赛道最新动态) · Jev 估值百亿美元:前 OpenAI 工程师做「不做聊天的 AI」(决策模型赛道姊妹篇)
延伸阅读
- OpenAI 偷偷测试新图像模型,代号 mona-lisa-1,专治 AI 塑料感皮肤1 月前
- 阿里达摩院语构上线:自然语言构建、协作与发布智能应用,AI 原生开发平台怎么用2 周前
- GPT-Image-2.5 双模型上线:Flare 求快 Sunburst 求准,延迟最高降 50%2 周前
- 苹果正式推送 iOS 27:Siri AI 可读屏并操作应用,老机型启动速度最高提升 30%2 周前
