结论先行:蚂蚁集团 inclusionAI 团队全栈开源了统一图像生成与编辑模型 LLaDA-Image。它是一枚从零训练的 6B 单流 DiT(Diffusion Transformer),配合 LLaDA2.0-mini 扩散语言模型负责理解,一套权重同时支持文生图与指令式图像编辑。在 Qwen-Image-Bench 上取得中英 53.53 / 53.38 的开源第一成绩,总分区间介于 GPT Image 1 与 Imagen 4.0 Ultra 之间。
核心数据一览
| 项目 | 参数 / 说明 |
|---|---|
| 模型 | LLaDA-Image(Base / Turbo 双版本) |
| 生成侧架构 | 从零训练的 6B 单流 DiT |
| 理解侧 | LLaDA2.0-mini 扩散语言模型(16B 总参、1B 激活的 MoE) |
| 训练样本 | 累计约 2.2 亿生成训练样本,其中 9800 万真实图片 |
| 纯图监督占比 | 超过 90% |
| Qwen-Image-Bench | 53.53(英)/ 53.38(中),开源模型双榜第一 |
| 推理步数 | Base 约 50 步;Turbo 经 TwinFlow 蒸馏压缩至 2–4 步 |
| 开源协议 | Apache 2.0 |
| 权重格式 | BF16、FP8,社区另有 GGUF / INT8 量化 |
核心方法:先学会画,再学会听话
LLaDA-Image 最反直觉的设计在数据配方上。生成侧累计约 2.2 亿训练样本中,超过 90% 采用纯图片监督——预训练阶段完全不看 caption,让同一张图像经过随机遮挡后既充当条件、又充当生成目标,直接建立视觉先验。图文对被集中留到后期的 SFT 阶段做语言对齐。
这样做的好处是降低了对海量高质量图文配对数据的依赖。传统文生图模型高度依赖带描述的图片数据,而 caption 的标注质量本身就是一个瓶颈。把”看懂世界的样子”和”听懂人类的指令”拆成两个阶段,各用最合适的数据源,是这个设计的本质。
六阶段训练流水线
| 阶段 | 内容 | 分辨率预算 |
|---|---|---|
| 1 | 理解骨干 CoT 微调 | — |
| 2 | 纯图像预训练 | 256×256 |
| 3 | 纯图像中期训练,多宽高比分桶 | 约 512×512 |
| 4 | 图文对齐与高分辨率迁移 | 约 1024×1024、约 2048×2048 |
| 5 | T2I / I2I 1:1 联合训练,产出统一模型 | — |
| 6 | TwinFlow 蒸馏,产出 Turbo 版 | — |
第 4 阶段的 caption 由 Qwen3.6-35B-A3B 与 Qwen3-VL-235B-A22B-Instruct 生成,并在物体、属性、关系和 OCR 四个维度上做了校验。
架构:理解与生成各司其职
理解侧:LLaDA2.0-mini
文本、视觉条件与结构化推理由 LLaDA2.0-mini 处理,它是一个 16B 总参、1B 激活的扩散式 MoE 语言模型。注意这里的”理解”不是给用户看的对话能力,而是把指令转成生成侧可用的条件。
轻量接口:RQA + Transformer Connector
两侧之间用 Residual Query Adapter(RQA)通过交叉注意力抽取与生成相关的信息,再由 Transformer Connector 把隐状态投影到 DiT 的条件空间。这个设计避免了让庞大的理解模型直接参与每步去噪,从而控制计算开销。
生成侧:单流 DiT
文本条件 token、时间步嵌入与图像 token 在每一层 Transformer 内部都进行交互,预测 Flow Matching 的速度场。工程细节上,全 DiT 使用无可学习参数的 RMSNorm 来解决长程训练中的尺度漂移,优化器选用 Muon。
TwinFlow 蒸馏:把 50 步压到 2–4 步
TwinFlow 的做法是让同一个 DiT 主干同时扮演两种角色——正时间方向负责生成,负时间方向负责追踪学生分布。共享主干使得蒸馏过程不需要额外部署一个判别器网络,最终把推理从约 50 步压缩到 2–4 步。
| 版本 | 采样步数 | 适用 |
|---|---|---|
| LLaDA-Image Base | 约 50 步 | 高质量出图,细节表现力强 |
| LLaDA-Image Turbo | 2–4 步 | 快速预览、批量迭代 |
成绩与短板:把两件事一起看
强项:中英双榜第一,长文本与编辑都在水准之上
| 基准 | 成绩 | 说明 |
|---|---|---|
| Qwen-Image-Bench(英) | 53.53 | 开源模型第一 |
| Qwen-Image-Bench(中) | 53.38 | 开源模型第一 |
| LongText-Bench | 0.923(英)/ 0.913(中) | 长文本渲染能力强 |
| GEdit-Bench | 7.336(英)/ 7.294(中) | 指令式编辑得分 |
官方口径的总分区间是”介于 GPT Image 1 与 Imagen 4.0 Ultra 之间”。考虑到长文本渲染达到 0.923,这个模型对海报、标题类需要图上精准排字的场景适配度明显优于多数同体量开源模型。
短板:计数能力明确偏弱
技术报告自己也点出了 GenEval 计数项只有 0.53。这与”90% 纯图预训练”的设计取向直接相关——缺乏细粒度的图文对齐监督时,”画三个苹果”这类需要精确数量对应的任务就容易失手。用之前先做一次针对性验证,比事后返工划算。
部署选择
| 方式 | 适用对象 |
|---|---|
| Python 原生推理 | 需要自定义流水线的开发者 |
| ComfyUI 可视化工作流 | 创作者、设计侧用户 |
| SGLang 高性能推理 | 需要吞吐的 API 服务部署 |
| BF16 / FP8 / GGUF / INT8 | 按显存预算选择精度 |
权重、训练代码、推理代码与完整数据配方均已开放至 GitHub、Hugging Face 与魔搭,技术报告编号 arXiv:2609.03796。
FAQ
1. LLaDA-Image 和我们常说的 LLaDA 是什么关系?
LLaDA 原本是蚂蚁主导的扩散式语言模型(Large Language Diffusion with mAsking)路线,用掩码扩散而非自回归做文本生成。LLaDA-Image 沿用了这一技术血脉——理解侧仍用 LLaDA2.0-mini 扩散语言模型,生成侧则换成从零训练的 6B DiT。
2. 为什么强调”统一”生成与编辑?
传统做法往往把文生图和图像编辑拆成两套模型或两个分支,”统一”意味着一套权重同时覆盖两种任务,编辑时能更好保留原图主体结构、按自然语言指令修改画面内容。对部署方而言,省掉的是多模型切换带来的显存与运维成本。
3. Turbo 版画质会掉很多吗?
蒸馏必然有代价,但 TwinFlow 的设计目标就是在少步数下维持基础画质。实际选型建议按用途分层:预览与批量筛选用 Turbo,交付定稿用 Base。
小结
LLaDA-Image 提供了一个值得琢磨的样本:在大家都卷数据规模和参数的时候,它把突破口放在了数据配方的分工上——九成样本先不看文字,用纯图把视觉先验建牢,再用少量高质量图文对做语言对齐。中英双榜第一是对这套思路的验证,而 GenEval 计数 0.53 则诚实地标出了它的代价边界。加上连训练配方、框架与完整数据都一并开源的姿态,这份 release 对做文生图研究的人来说,参考价值高于成绩本身。
相关阅读
这条线上还有几篇站内文章可以接着看:
