先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。
先看成绩:在 Qwen-Image-Bench 上,LLaDA-Image 的英文、中文总分分别达到 53.53 和 53.38,在技术报告列出的开源模型中拿下双榜第一。
Qwen-Image-Bench 中英文综合成绩。模型按两条轨道的平均分排序;LLaDA-Image 在报告列出的开源模型中取得中英文双榜第一。
榜单给出了它在主流模型中的量化坐标。再回到最直观的生成效果,先来做一道 “真假图片” 判断题。
下面这组图里,哪些是真实照片?
人物、动物、食物与风景等 LLaDA-Image 生成样例。
答案是:一张也没有。
更关键的是,为这个 6B DiT 建立视觉先验时,团队没有把 caption 作为预训练条件:2.2 亿累计生成训练样本中,超过 90% 采用纯图片监督。
从林间抓拍、家庭照片和街边市场,到雪山、洞穴与中式园林,这些看似来自手机或相机的画面,全部由同一个模型生成。换到海报、广告和中英文排版,它又能给出下面这样的结果:
LLaDA-Image 的海报、文字渲染、艺术与设计类生成样例,展示模型覆盖多种视觉创作任务的定性效果。
这套模型来自 Inclusion AI,名为 LLaDA-Image。其核心是一套从零训练的 6B 参数 Diffusion Transformer(DiT),一套权重统一支持文生图和指令图像编辑;进一步蒸馏得到的 LLaDA-Image-Turbo,只需 2—4 个采样步。
真正让这项工作显得不一样的,是它重新回答了一个基础问题:训练高质量文生图模型,图文对一定要从预训练第一天就上场吗?
LLaDA-Image 给出的答案是:可以先从图片本身建立视觉生成先验,再在后续 SFT 中使用经过描述与一致性检查的图文对完成语言对齐。换句话说,先学会画,再学会听话。
这条路线从纯图片预训练一路延伸到语言对齐、统一生成 — 编辑训练和少步蒸馏。生成训练各阶段累计处理约 2.2 亿个样本,最终交出了开篇榜单所示的中英文双榜开源第一成绩。
-
GitHub:github.com/inclusionAI/LLaDA-Image
-
模型:https://huggingface.co/collections/inclusionAI/llada-image
-
魔搭:https://modelscope.cn/collections/inclusionAI/LLaDA-Image
-
arxiv:https://arxiv.org/pdf/2609.03796
后端和生成都是扩散模型
LLaDA-Image 采用从理解到生成的全扩散架构:理解侧使用 LLaDA2.0-mini,这是一款拥有 16B 总参数、激活 1B 参数的混合专家(MoE)扩散语言模型(dLLM),负责理解指令;生成侧使用从零训练的 6B DiT,负责将理解结果转化为图像。同一套系统可同时支持文生图和指令图像编辑。
图文对,可能并不是生成训练的 “入场券”
传统文生图路线通常从训练早期就把图片与文字说明绑定在一起。要让配对数据达到训练要求,还需要生成或人工补充详细 caption,并经过幻觉检测、文字转录校验和图文一致性过滤。
LLaDA-Image 换了一种分工:预训练和中期训练不把 caption 作为条件,而是由图像自身产生条件信号;到了需要语言监督的 SFT 阶段,再引入图文对完成文本 — 视觉对齐。报告显示,团队在这一阶段使用 Qwen3.6-35B-A3B 和 Qwen3-VL-235B-A22B-Instruct 为图像生成描述,并进一步校验物体、属性、关系与文字转录。
在这套分工里,两类数据被放到了各自更擅长的位置。原始图像保留材质、光影、局部结构和小物体等完整视觉信息;文本描述则擅长提炼语义,把自然语言概念接入已经形成的视觉空间。
纯图片负责建立视觉世界,图文对负责把语言接入这个世界。
尤其在早期低分辨率训练中,直接从实际裁剪区域提取条件,可以让条件与 256 X 256 的训练目标天然对应,并保留更多有效细节。于是,未经文本配对的图片也能直接参与吞吐量最大的视觉学习阶段,高质量配对资源则集中用于后续语言对齐。
这套分工也对应着一种更灵活的数据组织方式:先让图片直接参与视觉学习,再把配对数据集中配置到语言对齐阶段。
完整流程可以概括为六个阶段:
1. 先对理解骨干进行思维链监督微调(CoT SFT);
2. 在
像素预算下进行纯图像预训练;
3. 在约
像素预算和多宽高比桶上进行纯图像中期训练;
4. 依次在约
和
像素预算下引入图文对,完成文本对齐与高分辨率迁移;
5. 以文生图(T2I)和图像编辑(I2I)1:1 混合训练,得到统一的 LLaDA-Image;
6. 使用 TwinFlow 蒸馏,得到 2—4 步推理的 LLaDA-Image-Turbo。
这里的关键,是前两个生成阶段直接从图像自身获得条件信号。从方法接口看,图像通过基础质量筛选后即可参与预训练和中期训练;大模型 captioning 与图文对齐管线则在后续 SFT 阶段发挥作用。
一张图,同时提供 “题目” 和 “答案”
给定一张训练图片,系统先用冻结的 SigLIP-VQ 视觉编码器把它变成图像 token,再随机遮掉其中一部分。保留下来的稀疏视觉 token 与一条固定辅助指令一起进入冻结的多模态理解模型,形成 DiT 的条件;完整图片的 VAE 潜变量则作为生成目标。
换句话说,图片既是条件的来源,也是完整生成目标:模型需要完成一个从局部视觉线索恢复完整图像的任务。
-
条件和目标来自同一块实际训练图像,两者天然对齐;
-
随机遮挡确保模型需要根据上下文推断完整内容;
-
恢复缺失内容的目标驱动 DiT 学习物体结构、上下文关系与视觉组成规律;
-
冻结视觉编码器和理解骨干,只更新 Residual Query Adapter(RQA)、连接器和视觉生成器。
由于条件直接从裁剪后的图像提取,团队可以从高分辨率原图中随机截取原生分辨率为
或适度更大的局部区域,只做温和缩放后用于
训练,从而在低分辨率预训练中保留更多局部细节。
到了中期训练,像素预算提升到约
,训练仍沿用图像自条件和遮挡补全,并开始采用多宽高比桶。模型先适应更高分辨率与不同画幅,再切换到文本条件,将分辨率适配和条件模态转换分成两个阶段,过渡也更加平滑。
技术报告给出的 SFT 加权数据分布估计。训练内容覆盖自然、设计、人物与少量合成数据;图像预训练和中期训练只使用真实图像。
这条 “视觉优先” 的路线让真实图像的优势随着训练推进逐步显现。报告称,以真实图像为主的配方能够持续提升生成真实感,并展现出更高的长期能力上限。SFT 阶段因此一直让真实图像占绝对多数,同时在后期定向增加文字密集图像与人像数据。
从统计口径看,报告所说的 2.2 亿样本是图像生成管线各阶段的累计样本处理量;理解骨干的 CoT SFT 采用独立口径统计。
一个模型,怎样同时负责生成和编辑?
LLaDA-Image 的模型主体可以分为三部分:负责理解条件的 dLLM 视觉语言模型、连接理解与生成空间的轻量接口,以及真正生成图像的单流 DiT。
LLaDA-Image 架构。文本经 RQA、LLaDA2.0-mini 和 Connector 进入单流 DiT;编辑任务额外接收参考图像的语义特征和干净 VAE 潜变量。
先理解,再交给 DiT 生成
理解模块建立在 LLaDA2.0-mini 扩散语言模型之上。它不只是把提示词变成一组静态文本嵌入,而是作为统一的多模态语义接口,处理文本、训练时的视觉条件和结构化推理信息。
语言模型与图像生成器分别面向语义理解和视觉去噪,二者需要一套专门接口完成表示转换。为此,团队在中间加入了两层桥梁:
-
RQA 在理解模型前放入一组可学习查询,通过交叉注意力从输入中提取与生成最相关的信息;
-
Transformer Connector 再把理解模型的隐藏状态投影到 DiT 所需的条件空间。
视觉生成部分则是一套纯单流 DiT。文本条件 token、时间信息和图像 token 进入同一组 Transformer 模块,在每一层直接交互,最终预测 Flow Matching(流匹配)速度场。
编辑时,参考图像不经过语言模型
生成和编辑共享同一个理解接口与 DiT 主干,但参考图片走的是一条独立通道。
编辑指令仍由 RQA—dLLM—Connector 路径处理;参考图则完全绕过语言模型,同时提供两类互补信息:
-
SigLIP-VQ 特征提供高层语义信息,帮助模型识别参考图里 “是什么”;
-
干净的 FLUX2-VAE 潜变量直接提供像素级证据,帮助保留原有身份、结构、纹理与背景。
这两类信号形成了互补:高层语义帮助模型理解编辑对象与指令,像素条件则强化身份、结构和纹理的一致性。两种参考信号一起进入同一个 DiT,使一套权重可以同时承担开放式生成与参考保持编辑。
编辑训练阶段,团队以 1:1 混合 T2I 与 I2I 数据。文生图样本在这里相当于 “能力回放”,持续巩固模型的开放生成、画质和文本对齐能力,让生成与编辑在共享主干上协同演进。
下面是报告中的四组编辑示例:
|
编辑指令 |
输入图像 |
LLaDA-Image 输出 |
|
改为吉卜力动画风格 |
|
|
|
把 “Stay /fresh” 改成 “Keep /fresh” |
|
|
|
去掉女性身上的红色包 |
|
|
|
给手绘图上色:女孩肉色皮肤、黑发,小熊棕色 |
|
|
LLaDA-Image 指令图像编辑示例。
训练稳定性:为什么要拿掉 Norm 里的可学习参数?
对于一个需要长程训练的 6B 参数 DiT,稳定的网络 scaling 和 gradient norm 是整套工程得以持续扩展的基础。
团队在长程训练监控中发现,LayerNorm 或常规 RMSNorm 里的可学习参数会持续改变特征尺度;这种变化在深层网络和长训练周期中累积后,可能表现为 scaling 波动,并在后期带来 gradient norm(梯度范数)快速上升。
基于这一发现,LLaDA-Image 将归一化层设为无仿射参数形式,在整套 DiT 中统一使用无可学习参数的 RMSNorm。这个改动看起来很小,却直接针对长程训练中逐步累积的尺度漂移:它按照均方根对特征做归一化,并以固定形式维持尺度一致性。
优化器方面,团队在所有生成训练阶段都采用 Muon,将其定位为训练系统中的工程选择;归一化层的无参数设计则直接负责改善 scaling 与后期 gradient norm 的稳定性。
训练计划同样是渐进式的:
图像预训练、
多宽高比中期训练、
文本对齐、
分辨率迁移、定向增强,再到生成 — 编辑联合训练。进入 SFT 后,团队还把时间步采样向高噪声区域倾斜,因为这里决定了去噪早期的整体结构,误差也更容易沿后续轨迹累积。
临近收敛时,团队合并相邻训练状态的权重,以平滑不同 mini-batch 数据构成带来的指标波动。这些渐进训练、时间步采样和 checkpoint 处理共同组成了完整工程流程;其中,无可学习参数的 RMSNorm 专门改善长程训练中的 scaling 与 gradient norm 稳定性。
从 50 步到 2—4 步:同一个 DiT 的 “正负两班制”
基础版 LLaDA-Image 追求完整的多步生成能力,技术报告把它列为 50 步采样。部署时,团队再用 TwinFlow 将它蒸馏为 LLaDA-Image-Turbo,把推理压缩到 2—4 步。
TwinFlow 建立在分布匹配蒸馏(DMD)之上。传统 DMD 训练通常同时需要:
-
一个冻结的真实分布 score 模型;
-
一个在线跟踪学生分布的 fake-score 模型;
-
一个真正要部署的生成器。
传统 DMD 为生成器和在线 fake-score 估计器分别维护相应角色;TwinFlow 则进一步思考,能否用一套共享主干完成这两项工作。
TwinFlow 最巧妙的地方,可以概括成同一个 DiT 的 “正负两班制”:正时间负责生成,负时间负责跟踪学生分布。 具体来说,
表示生成器更新,
表示 fake-score 更新;两者共享主干、使用两个输出头,训练时以 1:2 的比例交替更新生成器与 fake-score 分支。
到了推理阶段,系统只保留生成头,fake-score 输出头完成训练使命后退出,部署开销与单生成头保持一致。
在 Qwen-Image-Bench 上,基础版的英文、中文总分分别为 53.53 和 53.38;4 步评测的 Turbo 则达到 50.98 和 50.27。同一模型家族由此形成两种互补部署档位:基础版侧重完整质量,Turbo 侧重推理速度。
九成样本不带文本,最终做到了什么?
技术报告用 Qwen-Image-Bench 作为主要综合生成基准。该基准包含 1,000 条分层提示词,考察画面质量、美学、提示词对齐、现实世界保真和创意生成,并分别提供英文与中文评测。
下面进一步选取报告中分数相近的部分开源与闭源模型进行比较:
Qwen-Image-Bench 部分模型结果,分数来自技术报告。各模型均采用标准推理设置和原始提示词进行比较。
最直观的参照是:把开源与闭源模型放进同一张榜单,LLaDA-Image 在中英文两条轨道上的总分,均位于 GPT Image 1 与 Imagen 4.0 Ultra 之间。
在报告列出的开源模型中,LLaDA-Image 的英文总分领先第二名 Z-Image-Turbo 1.87 分,中文领先 0.67 分;质量、美学和提示词对齐三个分项,在中英文开源模型中也均排名第一。
文字生成方面,LLaDA-Image 在 LongText-Bench 英文和中文部分分别达到 0.923、0.913。在包含广告、海报、表情包和街景等多文字区域的 CVTG-2K 上,其平均单词准确率为 0.875、归一化编辑距离(NED)为 0.945、CLIPScore 为 0.818;在包含 2—5 个文字区域的不同难度设置下,单词准确率保持在 0.857—0.892。
指令编辑方面,LLaDA-Image 在 GEdit-Bench 英文、中文轨道上的总分分别为 7.336 和 7.294。这组结果展示了一套共享权重同时完成文生图与双语图像编辑的能力,也体现了统一模型路线的价值。
报告还给出了两个传统诊断基准:GenEval 总分为 0.85,DPG-Bench 总分为 87.48。其中 GenEval 的单物体和双物体得分分别为 1.00 和 0.98,属性绑定为 0.84;计数能力目前为 0.53,也是后续可以继续提升的方向。
“全栈开源”,这次具体开放了什么?
榜单成绩提供了一个醒目的结果,完整开放的训练链条进一步扩展了这项工作的研究价值。LLaDA-Image 把从 “图片如何变成视觉先验” 到 “模型如何压缩到 2—4 步” 的路径连了起来。
具体来看,这次开放覆盖了五个关键环节:
-
模型权重:同时提供基础版、Turbo 版及二者对应的 FP8 权重,覆盖 50 步质量优先、2—4 步少步推理和低精度部署等不同使用场景;
-
训练与推理代码:开放模型训练和推理所需的核心实现;
-
数据构建与纯图片训练配方:包含图片筛选、
预训练与约
多宽高比中期训练; -
统一生成 — 编辑配方:包括文本对齐、高分辨率迁移,以及 T2I、I2I 以 1:1 混合的联合训练;
-
TwinFlow 蒸馏方案:公开从 50 步基础模型走向 2—4 步 Turbo 的少步生成路径。
这里的 6B 参数对应核心 DiT;完整系统还包括冻结的 LLaDA2.0-mini 理解骨干、视觉编码器、VAE、RQA 和 Connector。模块边界和各阶段配方一并给出,使研究者既可以观察完整系统如何协同,也可以按自身需求复用其中的纯图片预训练、统一编辑或少步蒸馏模块。
“开源 SOTA” 的口径同样清晰:它指 LLaDA-Image 在技术报告所列模型及标准评测设置下,取得 Qwen-Image-Bench 英文、中文开源模型第一。与此同时,同一套权重还覆盖双语长文本渲染与指令图像编辑,形成了从综合生成、文字能力到编辑能力的完整验证。
报告也给出了下一步方向:继续扩展世界知识、提高长文本与多区域排版的稳定性,并推进原生 2K 生成。对于社区而言,这套开放框架也为后续探索留下了清晰接口。
SGLang Day-0 支持 LLaDA-Image 推理
在 LLaDA-Image 开源之际,InclusionAI 与 SGLang 社区协作完成了 Day-0 推理适配。针对模型的多组件推理链路,双方完成了少步采样、序列并行和 FP8 推理等适配。基于 SGLang Diffusion,用户可通过同一套推理框架部署 Base、Turbo 及相应的 FP8 版本,支持文生图和图像编辑,并可通过兼容 OpenAI Images API 的接口提供服务。
结语
LLaDA-Image 的核心路线可以压缩成八个字:先学会画,再学会听话。 纯图片承担大规模视觉先验学习,图文对集中完成语言对齐;生成、编辑与快速部署,则继续接到同一套系统中。
模型权重、训练代码与详细配方的同步开放,让这个 6B DiT 从图片出发、走过语言对齐与统一编辑、最终落到 2—4 步部署的全过程,都成为可以研究和继续推进的技术路径。
当图文对不再是预训练的入场券,纯图片也就从 “等待配上文字的数据”,变成了视觉生成预训练的主角。
© THE END
转载请联系本公众号获得授权
投稿或寻求报道:liyazhou@jiqizhixin.com







