ERNIE-Image 生成 + Qwen-Image-Edit 编辑:开源双模型混合管线实战
ERNIE-Image 的官方编辑模型从四月等到八月,Beta 一推再推。但社区早就用脚投票给出了答案:生成用 ERNIE-Image,编辑用 Qwen-Image-Edit。前者是文字渲染与版式控制的开源第一,后者是 Arena 图像编辑榜 1241 Elo 的开源第一。两个 Apache 2.0 模型拼在一起,恰好补全了 ERNIE 生态缺失的"生成 + 编辑"闭环。

为什么是这两个模型的组合
ERNIE-Image 的强项是"从零到一":海报、漫画、多语言排版、结构化视觉生成,LongText-Bench 0.9733 开源第一。它的短板也明确——官方编辑模型缺席,社区只能靠 img2img + 遮罩变通。
Qwen-Image-Edit 恰好补上这一环。它基于 20B Qwen-Image 打造,Apache 2.0 全开放,输入图像同时喂给 Qwen2.5-VL(视觉语义控制)和 VAE 编码器(视觉外观控制),实现语义编辑与外观编辑双通道。
Qwen-Image-Edit 的核心能力
精确文字编辑:中英双语,直接增删改图中的文字,保留原字体、大小和风格。这是从 Qwen-Image 的文字渲染能力延伸过来的,也是绝大多数编辑模型做不到的。
语义编辑:改内容不动语义——IP 创作、物体旋转、场景替换,改完还是"同一张图"。
外观编辑:风格迁移、元素增删改,属于低层视觉操作。

| 能力 | 说明 | 典型场景 |
|---|---|---|
| 文字编辑 | 中英双语,保留原字体/大小/风格 | 海报改文案、漫画改对白 |
| 语义编辑 | 保持视觉语义的内容修改 | 换物体、旋转视角、IP 创作 |
| 外观编辑 | 风格与元素层面操作 | 风格迁移、背景替换 |
| 多图编辑 | Edit-2511 支持最多 3 张参考图 | 多图融合、角色一致性 |
混合管线设计
整条管线的分工:ERNIE-Image 负责生成底稿,Qwen-Image-Edit 负责精修编辑。
电商海报工作流
- ERNIE-Image 生成产品主视觉(文字渲染强,价格/卖点文案一次到位)
- Qwen-Image-Edit 修改局部——换背景、改促销文案、调色
- 可选二遍精修:img2img 低 denoise 或 SUPIR 放大
漫画工作流
- ERNIE-Image 生成分镜底稿
- Qwen-Image-Edit 改对白气泡文字(保留原字体风格)
- 多图编辑保持角色一致性
品牌物料工作流
- ERNIE-Image 生成版式框架
- Qwen-Image-Edit 替换 logo、标语、产品图
- 语义编辑确保"换完还是同一套设计"

ComfyUI 落地配置
两个模型在 ComfyUI 里都有原生工作流。Qwen-Image-Edit 需要三个文件:
📂 ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── qwen_image_edit_fp8_e4m3fn.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen_2.5_vl_7b_fp8_scaled.safetensors
│ ├── 📂 vae/
│ │ └── qwen_image_vae.safetensors
│ └── 📂 loras/
│ └── Qwen-Image-Lightning-4steps-V1.0.safetensors
FP8 量化 + Lightning 4 步 LoRA 后,RTX 4090D(24GB)首代约 55 秒,后续约 34 秒。ERNIE-Image 侧沿用官方 ComfyUI 模板(diffusion model + ministral-3-3b 文本编码器 + flux2-vae)。
代码级调用(Diffusers)
# 生成:ERNIE-Image
from diffusers import ErnieImagePipeline
pipe = ErnieImagePipeline.from_pretrained("baidu/ERNIE-Image", torch_dtype=torch.bfloat16)
image = pipe("促销海报:夏日冰饮,大字号标题'冰爽一夏'", num_inference_steps=50).images[0]
编辑:Qwen-Image-Edit
from diffusers import QwenImageEditPipeline
editor = QwenImageEditPipeline.from_pretrained("Qwen/Qwen-Image-Edit", torch_dtype=torch.bfloat16)
edited = editor(image=image, prompt="把标题文字改成'冰爽特惠',背景换成海边").images[0]
与闭源编辑方案的对比
| 维度 | ERNIE + Qwen-Edit 混合 | GPT Image 2 (1463 Elo) | MAI-Image-2.5 (1401 Elo) |
|---|---|---|---|
| 许可 | Apache 2.0 全开放 | 闭源 API | 闭源 API |
| 文字编辑 | ✅ 中英双语 | ✅ | ✅ |
| 本地部署 | ✅ 24GB 可跑 | ❌ | ❌ |
| 成本 | 电费 | 约 $48/1k imgs | 按量计费 |
| 可控性 | 全参数可调 | 黑盒 | 黑盒 |

适用场景
- 电商与广告:生成 + 改文案 + 换背景一条龙,全本地部署
- 漫画与插画:分镜生成 + 对白编辑,角色一致性靠多图编辑
- 品牌设计:版式框架 + 元素替换,语义编辑保住设计语言
- 内容生产:批量生成底稿 + 逐个精修,成本趋近于零
开源世界的解法从来不是等一个全能模型,而是把两个最强的专才拼在一起。ERNIE-Image 负责"生",Qwen-Image-Edit 负责"改",中间用 ComfyUI 或 Diffusers 无缝衔接——这是 2026 年 8 月最务实的开源图像工作流。