ERNIE-Image 8B Turbo 开源模型深度解析:从基准测试到 LoRA 微调完整指南

Apr 27, 2026

ERNIE-Image 8B Turbo 开源模型深度解析:从基准测试到 LoRA 微调完整指南

00 引言

百度文心大模型团队开源了 ERNIE-Image,一款基于单流 DiT 架构的 8B 参数文生图模型。仅需 24GB 显存的消费级显卡即可运行,在指令遵循、文字渲染等主流 benchmark 上全面领先开源模型,尤其擅长海报、漫画分镜、多面板布局等强控制力场景。团队同步推出 ERNIE-Image Turbo,8 步推理即可生成高保真图像。

体验地址:魔搭创空间
开源地址:ERNIE-Image / ERNIE-Image-Turbo


01 模型介绍

ERNIE-Image 基于 DiT 架构,参数量 80 亿(8B),仅需 24GB 显存即可生成媲美顶级商业模型的复杂图像。在 GenEval、OneIG、LongTextBench 等主流评测中全面领先开源模型,整体效果接近 NanoBanana、Seedream 4.5 等最先进模型。

核心特性

特性 说明
小模型,强性能 8B 参数规模在主流评测中位列开源第一,效果逼近 NanoBanana 2.0、Seedream 4.5 等顶级闭源模型
精准文字渲染 高密度文本、长文本及版式敏感任务表现稳定,完美适配海报、信息图、类 UI 图像
复杂指令跟随 对多主体关系、细节约束、知识密集型 Prompt 保持强理解与精准执行能力
结构化生成突出 在海报、漫画、分镜、故事板等任务中,能更好保持布局逻辑与画面组织
多元风格覆盖 支持写实摄影、动漫二次元、胶片、超现实主义、剪影、老照片及电影感柔光风格
消费级硬件友好 24GB VRAM 即可部署运行,大幅降低研究与生产环境部署门槛

Prompt Enhancer(提示词增强器)

ERNIE-Image 在详细、结构化的长 prompt 下表现最佳,但实际使用中用户往往只输入一句简短描述。为此,团队内置了 3B 参数的轻量级 Prompt Enhancer,自动将简短输入扩展为更详细、结构化的 prompt。在海报、动漫、网页布局、游戏截图等结构化视觉任务中效果尤为明显。


02 基准测试结果

ERNIE-Image 在四个主流文生图评测基准上进行了评估:GenEval(组合生成)、OneIG-EN / OneIG-ZH(中英文开放域图像生成)和 LongTextBench(长文本渲染保真度)。

基准 排名 得分
GenEval(组合生成) #1 0.8856
LongTextBench(长文本渲染) #2 0.9733
OneIG-ZH(中文开放域) #2 0.5543
OneIG-EN(英文开放域) #3 0.5750

关键洞察:在 LongTextBench 上排名第 2,中英文长文本渲染均表现出色;在 OneIG 的 Text 维度上也保持高竞争力,体现了多语言文字生成的核心优势。上述成绩仅来自 8B 参数的 DiT 架构,是同性能水平下最具参数效率的模型之一。


03 模型定位与横向对比

在开源文生图赛道中,ERNIE-Image-Turbo 8B 的参数量处于中游水平,但凭借出色的可控性、指令遵循与文本渲染能力,具备强竞争力。

模型 参数量 架构/特点 适用场景与硬件要求
ERNIE-Image-Turbo 8B 8B 单流 DiT + LDM + 内置 3B 提示增强器 复杂指令跟踪、精准文本渲染、结构化图像生成
HunyuanImage-3.0(腾讯) 80B (MoE, ~13B 活跃) 原生多模态自回归 复杂提示/知识推理/中英渲染,需数据中心级硬件
FLUX.2 [dev](Black Forest) 32B Rectified Flow Transformer 提示遵循/细节/连贯性极强,量化后可跑消费级 GPU
FLUX.1 [dev/schnell] ~12B 经典 DiT / Flow Matching 文本渲染一流,社区生态最丰富(ComfyUI 等)
SD 3.5 Large(Stability) 8.1B(MMDiT) 最新 SD 主力,支持 1MP+ 提示遵循/排版显著提升,LoRA/微调生态最完善
Qwen-Image 2.0(阿里) ~7B 轻量高效,统一生成+编辑 强中文/多语言渲染,原生 2K 分辨率,适合信息图
Z-Image-Turbo ~6B 高效实时/边缘部署 低资源环境,速度快

核心洞察:参数量 ≠ 绝对能力。ERNIE-Image 以 8B 参数实现 SOTA 级可控性,在复杂指令跟踪、精准文本渲染、结构化生成三大领域显著优于多数开源模型。


04 推理部署指南

1. Diffusers 推理

pip install git+https://github.com/huggingface/diffusers
import torch
from diffusers import ErnieImagePipeline

pipe = ErnieImagePipeline.from_pretrained(
"Baidu/ERNIE-Image-Turbo",
torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
prompt="这是一张呈现城市街道场景的摄影作品",
height=1264,
width=848,
num_inference_steps=8,
guidance_scale=1.0,
use_pe=True
).images[0]

image.save("output.png")

2. SGLang 推理(服务端部署)

git clone https://github.com/sgl-project/sglang.git
sglang serve --model-path baidu/ERNIE-Image-Turbo

3. Diffsynth 推理(低显存优化)

pip install -U diffsynth==2.0.8
from diffsynth.pipelines.ernie_image import ErnieImagePipeline, ModelConfig
import torch

vram_config = {
"offload_dtype": torch.bfloat16, "offload_device": "cpu",
"onload_dtype": torch.bfloat16, "onload_device": "cpu",
"preparing_dtype": torch.bfloat16, "preparing_device": "cuda",
"computation_dtype": torch.bfloat16, "computation_device": "cuda"
}

pipe = ErnieImagePipeline.from_pretrained(
torch_dtype=torch.bfloat16, device="cuda",
model_configs=[
ModelConfig(model_id="PaddlePaddle/ERNIE-Image", origin_file_pattern="transformer/diffusion_pytorch_model*.safetensors", **vram_config),
ModelConfig(model_id="PaddlePaddle/ERNIE-Image", origin_file_pattern="text_encoder/model.safetensors", **vram_config),
ModelConfig(model_id="PaddlePaddle/ERNIE-Image", origin_file_pattern="vae/diffusion_pytorch_model.safetensors", **vram_config)
],
tokenizer_config=ModelConfig(model_id="PaddlePaddle/ERNIE-Image", origin_file_pattern="tokenizer/"),
vram_limit=torch.cuda.mem_get_info("cuda")[1] / (1024 ** 3) - 0.5
)

image = pipe(
prompt="一只黑白相间的中华田园犬",
height=1024, width=1024, seed=42,
num_inference_steps=50, cfg_scale=4.0
)
image.save("output.jpg")


05 提示词(Prompt)书写规则与最佳实践

ERNIE-Image 强烈依赖长、详细、结构化的提示词。模型几乎不主动"脑补",必须显式描述一切。

✅ 核心规则

  • 长提示远优于短提示:短提示 → 字面解读、布局混乱、文本错误、缺少叙事
  • 必须显式描述:文本内容、排版位置、逻辑关系、视觉层次、叙事流
  • 善用增强器:输入简短想法 → 3B PE 自动扩展 → 人工微调
  • 语言选择:中文优先(语义控制极强),中英混用/纯英文亦可

🏗️ 结构化写作框架

  1. 主体描述(Subject):对象、场景、人物、动作
  2. 细节与关系(Details & Relations):位置、互动、光影、材质、数量、视角
  3. 布局与构图(Composition):分镜、海报布局、多面板、文字位置/字体
  4. 风格与氛围(Style):艺术风格、时代、情绪、光线
  5. 质量提升词(Quality Boosters):高细节、锐利、电影级照明、无水印、商业级
  6. 负面提示(Negative Prompt):如 --no 模糊、低分辨率、变形

📥 复杂场景提示词示例

一张影棚微距摄影照片,展现了一个手工聚合物粘土质感的微缩立体模型。画面中央是一家小巧的奥利奥主题商店,整体呈现竖向构图。商店的屋顶由几块巨大的奥利奥夹心饼干交错搭建而成,饼干呈现深黑色,中间夹着厚实的白色奶油层,表面带有经典的压花纹理和清晰的英文字母 "OREO"。

06 模型 LoRA 训练

DiffSynth-Studio 支持了 ERNIE-Image 模型的图生图 LoRA 训练,显存管理自动适配。

训练命令

accelerate launch examples/ernie_image/model_training/train.py \
  --dataset_base_path data/diffsynth_example_dataset/ernie_image/ \
  --dataset_metadata_path data/diffsynth_example_dataset/ernie_image/metadata.csv \
  --max_pixels 1048576 \
  --dataset_repeat 50 \
  --learning_rate 1e-4 \
  --num_epochs 5 \
  --output_path "./models/train/Ernie-Image-T2I_lora" \
  --lora_rank 32 \
  --use_gradient_checkpointing

07 核心洞察与使用建议

  • 规则驱动型模型:不按它的提示词规则写,效果会大打折扣
  • 结构化场景王者:海报、漫画分镜、UI 界面、游戏截图、信息图是它的绝对优势区
  • 文本渲染优势:适合生成含大量中英文文字的图片
  • 工作流建议:简短构思 → 3B Prompt Enhancer → 人工核对排版与文字 → 生成
  • 参数量 ≠ 绝对能力:以 8B 参数实现 SOTA 级可控性
  • 消费级硬件友好:24GB VRAM 即可部署,Diffsynth 框架最低 3GB VRAM 可运行

参考来源:魔搭 ModelScope 社区 — ERNIE-Image 团队开源发布

ERNIE-Image Team