首页/ 资讯/ LLaDA-Image 蚂蚁集团开源的统一图像生成与编辑模型

LLaDA-Image 蚂蚁集团开源的统一图像生成与编辑模型

灵犀编辑部 2026-09-08 3 阅读

LLaDA-Image是什么

LLaDA-Image 是蚂蚁集团 inclusionAI 开源的 6B 参数统一图像生成与编辑模型。模型采用先纯图预训练、后语言对齐的创新路线,用全扩散架构(LLaDA2.0-mini 理解 + 6B DiT 生成)实现文生图、指令编辑和中英文字渲染。Turbo 版仅需 2–4 步可出图,在 Qwen-Image-Bench 中英文双赛道均获开源第一。

LLaDA-Image

LLaDA-Image的主要功能

  • 文本到图像生成 :根据自然语言描述生成高保真、细节丰富的照片级图像。

  • 指令式图像编辑 :上传参考图并输入自然语言指令,精准修改指定区域同时保持其余部分不变。

  • 中英双语文字渲染 :在生成图像中准确呈现中文和英文文本,支持海报、排版及艺术字设计。

  • VQ 条件生成 :基于视觉量化(VQ)token 作为条件输入,实现可控的图像生成。

  • 参考图编辑 :以上传图片为参考,进行风格迁移、内容修改等编辑操作。

  • Turbo 快速推理 :蒸馏版模型仅需 2–4 步采样可生成 1024×1024 高质量图像。

LLaDA-Image的技术原理

  • 全扩散统一架构 :模型由理解模块 LLaDA2.0-mini(基于 MoE 的扩散语言模型)和生成模块 6B DiT 组成,两者后端均为扩散模型,通过 Connector 桥接,实现语义理解与像素生成的解耦。

  • 分阶段训练策略 :采用先学会画,再学会听话的路线,先进行纯图像预训练和中期训练建立强视觉生成先验,再引入成对语言监督完成文本-视觉对齐。

  • 高质量数据构建 :生成训练累计使用约 2.2 亿样本,其中 98% 为真实图像;语言对齐阶段的图文描述由 Qwen 系列大模型生成并校验,确保指令跟随的准确性。

  • 高效训练优化 :全链路使用参数无关的 RMSNorm 替代 LayerNorm,并采用 Muon 优化器,提升大规模训练的稳定性和效率。

  • Twin-DMD 快速蒸馏 :Turbo 版本通过 Twin-DMD 蒸馏技术将 Base 模型压缩,2–4 步采样可生成 1024×1024 高质量图像,实现速度与质量的平衡。

如何使用LLaDA-Image

  • 环境配置 :安装 Python 3.11、PyTorch 2.8、Diffusers 0.39.0 及 FlashAttention 2.8.3 等依赖,搭建本地推理环境。

  • 获取权重 :从 Hugging Face 或魔搭 ModelScope 下载 LLaDA-Image(高保真版)或 LLaDA-Image-Turbo(快速版)的模型文件。

  • 文本生成图像 :加载模型后输入描述文本,Base 版设置 50 步、guidance scale 5.0,Turbo 版设置 2–4 步、guidance scale 1.0,生成 1024×1024 图像。

  • 指令编辑图像 :上传参考图并输入自然语言编辑指令(如将背景换成海边),模型自动保持未编辑区域不变。

  • 注意尺寸规范 :文生图与 VQ 条件生成的输入尺寸需为 16 的倍数,编辑任务需为 32 的倍数。

LLaDA-Image的核心优势

  • 开源性能领先 :在 Qwen-Image-Bench 中英文双赛道均获开源模型第一,整体得分超越 FLUX.2 Max 等主流开源模型。

  • 统一生成编辑 :单一模型同时支持高质量文生图与精细指令式图像编辑,无需切换不同模型。

  • 极速推理 :Turbo 蒸馏版仅需 2–4 步采样即可生成 1024×1024 高保真图像,大幅缩短等待时间。

  • 中英文字渲染 :具备出色的中英文文本生成能力,可胜任海报、排版、艺术字等设计类任务。

  • 照片级真实感 :基于 98% 真实图像的预训练数据,生成结果具有自然光照、丰富细节和高度真实感。

LLaDA-Image的项目地址

  • GitHub仓库 :https://github.com/inclusionAI/LLaDA-Image

  • HuggingFace模型库 :https://huggingface.co/collections/inclusionAI/llada-image

  • arXiv技术论文 :https://arxiv.org/pdf/2609.03796

LLaDA-Image的同类竞品对比

对比维度 | LLaDA-Image | FLUX.2 [dev]


对比维度

LLaDA-Image

FLUX.2 [dev]

开发团队

蚂蚁集团 inclusionAI

Black Forest Labs

参数量

6B(DiT)+ 扩散语言理解模块

32B(dense)

底层架构

全扩散统一架构(DiT + dLLM)

Flow Matching

生成与编辑

单一模型统一支持文生图与指令编辑

需配合 FLUX Kontext 分支实现编辑

快速推理

Turbo 版 2–4 步出图

Klein 蒸馏分支 4 步出图

中英文字渲染

原生支持,海报与排版效果突出

英文优秀,中文支持相对有限

训练数据透明度

论文披露 2.2 亿样本、98% 真实图像

未公开具体数据构成

LLaDA-Image的应用场景

  • 电商视觉设计 :根据商品描述一键生成产品主图,或通过指令快速替换背景、调整光影,降低拍摄与后期成本。

  • 营销海报制作 :用出色的中英文字渲染能力,直接生成带品牌 Slogan、活动信息的商业海报与社交媒体配图。

  • 社交媒体内容创作 :为博主和创作者提供照片级人像、风景及生活方式图像生成,支持风格化编辑与快速出图。

  • 游戏与影视概念设计 :基于文本快速产出角色、场景概念图,并通过指令迭代修改细节,加速前期创意流程。

  • 个人摄影修图 :上传照片后用自然语言指令完成去杂物、换天空、调色调等操作,保持未修改区域不变,替代复杂修图软件。

相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐