ERNIE-Image 对决 Qwen-Image-2512:8B 后发先至,20B 老牌劲旅的正面交锋

Aug 3, 2026

ERNIE-Image 对决 Qwen-Image-2512:8B 后发先至,20B 老牌劲旅的正面交锋

2025 年 12 月 31 日,阿里 Qwen 团队赶在跨年夜放出了 Qwen-Image-2512——20B 参数的 MMDiT 升级版,官方用"超过 10,000 轮盲测、开源文生图排名第一"给自己定了调。四个月后,百度 ERNIE-Image 团队开源了只有 8B 参数的 ERNIE-Image,一句"用 8B 打出接近 20B 模型的成绩"把战火直接烧到了 Qwen 家门口。

两个模型都是 Apache 2.0,都能免费商用,都在中文文字渲染上下了重注。但它们的路线截然相反:Qwen 把参数堆到 20B,用规模换上限;ERNIE 把参数压到 8B,用架构巧思和外部增强器换效率。这是开源文生图世界里最经典的一道选择题:你要 20B 的从容,还是 8B 的轻快?

ERNIE-Image 官方示例作品

架构路线:两条不同的路

Qwen-Image-2512 延续了 Qwen-Image 的多模态扩散 Transformer(MMDiT)架构——文本和图像 token 在同一个 Transformer 里联合建模,20B 参数全部用于主干。这一代升级重点很明确:消除"AI 感"、提升自然细节、强化文字渲染的版式与多模态组合能力。

ERNIE-Image 走的是"紧凑 + 增强"路线:8B 单流 DiT 主干,搭配一个 3B 的 Prompt Enhancer(PE)。PE 基于 Ministral 3B 微调,把用户简短输入扩写成结构化描述,再喂给 DiT。参数省下来的部分,用外部增强器补齐。SFT 版 50 步推理,Turbo 版(DMD + RL 蒸馏)只需 8 步。

基准数据:各有山头

两边官方的基准表放在一起看,结论非常清晰——文字渲染 ERNIE 占优,综合指令遵循各有千秋

基准 ERNIE-Image Qwen-Image-2512
GenEval 总体 0.8856(开源第一) 0.8683(Qwen-Image)
LongText-Bench 平均 0.9733(开源第一) 0.9604
OneIG-EN 总体 0.5750(第3) 0.5300
OneIG-EN 文字 0.9788 0.9900
OneIG-EN 推理 0.3566(全场最佳) 0.2920

LongText-Bench 上,ERNIE-Image 的英文 0.9804、中文 0.9661 双双领先;OneIG-EN 的文字单项 Qwen-2512 略胜,但 ERNIE 在推理维度拿下全场最高分。Qwen 的牌面则在 AI Arena——超过 10,000 轮人类盲测中排名开源第一。

Qwen-Image-2512 AI Arena 开源榜排名

快速上手:显存决定门槛

这是两者差距最直观的地方。ERNIE-Image 全精度权重约 16GB,官方明说 24GB 显存的消费级显卡就能跑,ComfyUI 搜节点即用,Diffusers、SGLang、fal.ai、Replicate、SiliconFlow 全部就位。

Qwen-Image-2512 的 20B 全精度权重约 40GB,想本地跑通常要 GGUF 量化或 offload,门槛明显更高。不过 Qwen 生态更老、资料更多,且 Qwen-Image 2.0 提供了 API-only 的 4 步生成路径——不在乎自托管的话,云端调用反而很快。

# ERNIE-Image:一行 Diffusers
from diffusers import ErnieImagePipeline
pipe = ErnieImagePipeline.from_pretrained("baidu/ERNIE-Image", torch_dtype=torch.bfloat16)

Qwen-Image-2512:官方推理脚本

from qwen_image import QwenImagePipeline
pipe = QwenImagePipeline.from_pretrained("Qwen/Qwen-Image-2512", torch_dtype=torch.bfloat16)

文字渲染:中文海报谁更强

ERNIE-Image 的招牌就是"海报、漫画、多语言排版",LongText-Bench 开源第一的成绩单摆在那里。实测社区反馈也一致:长文本、密集排版、中英混排,ERNIE 更稳。Qwen-2512 这一代把文字渲染从"能出字"推进到"版式更合理、图文组合更忠实",官方示例里连带时间轴的 PPT 幻灯片都能一张生成。

Qwen-Image-2512 文字渲染示例

对设计师来说,中文海报、电商 Banner、信息图这类"文字即主体"的场景,两个模型都够用;但追求长段落高可读性时,ERNIE 的 LongText-Bench 领先优势是实打实的。

写实细节:Qwen 的主场

Qwen-Image-2512 这一代的升级重点全在"真实感":人像皮肤纹理、发丝细节、水流与 foliage 的层次。官方对比图里,同样的提示词,2512 版本的人脸明显更接近照片,背景物体的质感也更扎实。

Qwen-Image-2512 人像写实度对比

Qwen-Image-2512 自然细节对比

ERNIE-Image 的写实能力不弱——8B 参数在 GenEval 拿下开源第一——但它的设计重心是"结构化生成",写实人像并非主打。要拍"照片级"作品,Qwen-2512 的底子更厚。

编辑能力:一边有,一边等

这里出现了 2026 年最尴尬的对比:Qwen 的编辑模型 Qwen-Image-Edit 早已开源(Apache 2.0),在 Arena 图像编辑榜以 1241 Elo 排开源第一,支持文字编辑、风格迁移、视角旋转甚至多图编辑;而 ERNIE-Image 的官方编辑模型至今未发布,社区从四月等到八月。

对需要"生成 + 编辑"完整工作流的用户,Qwen 全家桶现在就能闭环;ERNIE 用户只能靠 img2img + 遮罩的变通方案撑场。

生态与许可:都是 Apache 2.0

许可层面两者完全一致——Apache 2.0,商用零限制,这在国内开源模型里是最高规格。生态上 Qwen 出道早、教程多;ERNIE 后发但铺得快:CivitAI 官方 LoRA 训练、AMD Day-0 支持、Intel OpenVINO、Krita 插件,半年内把主流平台走了一遍。

选型建议:按需求站队

  • 显存有限、想本地跑:ERNIE-Image,24GB 起步,Turbo 版 8 步出图
  • 追求照片级写实:Qwen-Image-2512,20B 的细节上限更高
  • 中文长文本排版:ERNIE-Image,LongText-Bench 开源第一
  • 需要原生编辑能力:Qwen-Image-Edit,唯一开源的完整编辑方案
  • 商用落地:两者皆可,Apache 2.0 无法律摩擦

百度用 8B 证明"小模型也能打",阿里用 20B 守住"大模型的上限"。这场对决没有输家——开源社区才是最大的赢家。

ERNIE-Image Team

ERNIE-Image 对决 Qwen-Image-2512:8B 后发先至,20B 老牌劲旅的正面交锋 | Blog