LLaDA-Image:全扩散架构,无需图文对预训练
前天
LLaDA-Image 是 Inclusion AI 推出的全扩散架构文生图模型,核心为从零训练的 6B 参数 DiT,一套权重可支持文生图与指令图像编辑,还可蒸馏为仅需 2—4 个采样步的 LLaDA-Image-Turbo。该模型采用「先学会画,再学会听话」的训练路线,预训练和中期超 90% 的累计 2.2 亿训练样本采用纯图片监督建立视觉先验,后续 SFT 阶段用经校验的图文对完成语言对齐。其在 Qwen-Image-Bench 中英文榜单开源模型中均获第一,在文字生成、指令编辑等任务上表现优异,还通过无参数 RMSNorm 保障训练稳定性,采用 TwinFlow 实现快速蒸馏。目前模型权重、训练代码和完整配方已全栈开放,且已适配 SGLang 推理框架。
全扩散架构、无需图文对预训练,LLaDA 杀穿开源文生图
机器之心 / 腾讯网
体验专业版特色功能,拓展更丰富、更全面的相关内容。