ERNIE-Image ComfyUI 官方支持与自定义节点完全指南

Jun 8, 2026

ERNIE-Image ComfyUI 官方支持与自定义节点完全指南

摘要:ComfyUI 现已正式支持 ERNIE-Image,从 v0.19.1 版本开始即可在模板中直接加载官方工作流。本文深入解析 ERNIE-Image 在 ComfyUI 中的部署方式、Pixaroma Note 等自定义节点的实际应用、ControlNet 组合工作流、以及从单图生成到批量生产的高级技巧。无论你是 ComfyUI 新手还是有经验的工作流开发者,都能找到提升效率的实用方案。


ComfyUI 官方支持的里程碑

2026 年初,ComfyUI 官方宣布对 ERNIE-Image 的 Day-0 支持,这意味着:

  1. 原生集成:ComfyUI v0.19.1+ 内置 ERNIE-Image 工作流模板
  2. 一键加载:通过 Templates → ERNIE-Image 直接获取完整工作流
  3. 自动模型下载:所需模型文件通过 HuggingFace 自动获取
  4. 双模型支持:ERNIE-Image Base(50 步高质量)和 ERNIE-Image-Turbo(8 步快速迭代)

这标志着 ERNIE-Image 从"社区手动适配"进入了"官方生态支持"阶段。


ComfyUI 中的 ERNIE-Image 核心架构

ERNIE-Image 在 ComfyUI 中的工作流由以下核心节点组成:

[CLIP Text Encode] → [ERNIE-Image Diffusion Model] → [VAE Decode] → [Save Image]
        ↑                       ↑                           ↑
   Prompt Text          ernie-image.safetensors      flux2_ae.safetensors
   (或 PE 输出)          (或 turbo.safetensors)

关键组件说明:

组件 文件 作用 来源
扩散模型 ernie-image.safetensors 主生成模型(8B DiT) Comfy-Org/ERNIE-Image
Turbo 模型 ernie-image-turbo.safetensors 蒸馏加速版(8 步) Comfy-Org/ERNIE-Image
Prompt Enhancer ministral-3-3b.safetensors 3B 提示词增强器 baidu/ERNIE-Image
文本编码器 CLIP/CLIPViT 文本条件编码 内置
VAE flux2_ae.safetensors FLUX.2 变分自编码器 FLUX.2

注意:ERNIE-Image 使用 FLUX.2 的 VAE(flux2_ae.safetensors),而非传统的 SD VAE。这是 ComfyUI 配置中最常见的错误来源之一。


快速上手:从安装到出图

第一步:更新 ComfyUI

cd ComfyUI
git pull origin master
# 确保版本 ≥ v0.19.1

第二步:加载 ERNIE-Image 工作流

  1. 打开 ComfyUI Web 界面
  2. 点击 Templates 标签
  3. 搜索 ERNIE-Image
  4. 选择 ERNIE-Image 或 ERNIE-Image-Turbo 工作流
  5. 点击 Load 加载

第三步:下载模型文件

ComfyUI 会自动检测缺失的模型并提示下载。模型文件位于:

  • ComfyUI/models/diffusion_models/ernie-image.safetensors(Base)
  • ComfyUI/models/diffusion_models/ernie-image-turbo.safetensors(Turbo)
  • ComfyUI/models/vae/flux2_ae.safetensors(VAE)
  • ComfyUI/models/text_encoders/ministral-3-3b.safetensors(PE)

第四步:生成第一张图

  1. 在 CLIP Text Encode 节点输入提示词
  2. 设置采样器(Turbo 推荐 Euler,步数 8;Base 推荐 DPM++ 2M,步数 20-50)
  3. 设置 CFG Scale(Turbo: 1.0,Base: 5.0-7.0)
  4. 点击 Queue Prompt 开始生成

自定义节点:Pixaroma Note 与 Resolution 节点

Pixaroma Note:富文本提示词编辑器

来源: YouTube Ep14 教程中的自定义节点

解决的问题:ERNIE-Image 的文字渲染能力强大,但 ComfyUI 默认的文本输入框对多行、多语言、复杂结构的提示词支持有限。

功能:

  • 富文本编辑:支持多段落、换行、缩进
  • 彩色文本标注:用颜色区分提示词的不同部分(主体、背景、风格、文字)
  • 高亮标记:快速定位关键参数
  • 列表/代码块:结构化提示词组织

安装:

cd ComfyUI/custom_nodes
git clone https://github.com/Pixaroma/comfyui-pixaroma-nodes
pip install -r requirements.txt

典型工作流:

[Pixaroma Note (提示词编辑)] → [CLIP Text Encode] → [KSampler] → [VAE Decode] → [Save Image]

Resolution 节点:智能分辨率计算

解决的问题:ERNIE-Image 的最佳输出分辨率因场景而异——海报设计需要高宽比,社交媒体配图需要特定尺寸,而产品图需要正方形。

功能:自动根据提示词内容或预设模板计算最佳输出分辨率。

典型用法:

  • 社交媒体封面:1280×640(2:1)
  • 产品图:1024×1024(1:1)
  • 海报设计:1024×1536(2:3)
  • YouTube 封面:1280×720(16:9)

高级组合工作流

工作流 1:ControlNet + 超级分辨率

场景:将线稿转换为高质量插图或 3D 风格渲染图

[Load Image (线稿)] → [Canny Edge Detect] → [ControlNet] → [KSampler (ERNIE-Image)] → [ESRGAN Upscale] → [Save Image]

关键配置:

  • ControlNet 强度:0.5-0.8
  • 采样器:DPM++ 2M Karras
  • 步数:30-50
  • 放大倍率:2x-4x

工作流 2:图像到视频(WanVideo + GIMM-VFI)

场景:将 ERNIE-Image 生成的静态图像转换为短视频

[ERNIE-Image Generate] → [WanVideo I2V] → [GIMM-VFI (帧插值)] → [Save Video]

说明:这是 ComfyUI 官方推荐的组合工作流,利用 WanVideo 进行图像到视频转换,再通过 GIMM-VFI 提升帧率。

工作流 3:FP8 混合精度放大

场景:在有限显存下实现高质量高分辨率输出

[KSampler (FP8 Base, 512×512)] → [KSampler (FP8 Upscale, 1024×1024)] → [Save Image]

关键配置:

  • 第一阶段:512×512,FP8 模型,20 步
  • 第二阶段:1024×1024,FP8 模型,15 步,低噪声
  • 总显存占用:比 BF16 1024×1024 直接生成减少约 60%

工作流 4:ICEdit + Flux + ESRGAN 局部重绘

场景:对 ERNIE-Image 生成结果的特定区域进行精细化修改

[Load Image] → [ICEdit Inpaint] → [Flux Style Transfer] → [ESRGAN Upscale] → [Save Image]

批量生产工作流

对于电商产品图、社交媒体批量配图等场景,ComfyUI 支持批量提示词输入:

# 使用 Wildcard 或文本文件批量输入
# prompts.txt 每行一个提示词
prompt1: 白色背景上的蓝色运动鞋,产品摄影风格
prompt2: 白色背景上的红色耳机,产品摄影风格
prompt3: 白色背景上的黑色手表,产品摄影风格

ComfyUI 批量配置:

  1. 使用 Load Text 节点读取 prompts.txt
  2. 配合 Batch Prompt 节点拆分提示词
  3. 每个提示词独立生成一张图
  4. Save Image 节点自动按序号保存

云端方案:Floyo H100 云端工作流

如果你没有本地 GPU,Floyo 提供了云端运行 ERNIE-Image Turbo 的方案:

对比本地部署:

维度 Floyo 云端 本地 ComfyUI
初始成本 $0 GPU 硬件成本
单次生成成本 ~$0.05-0.10 电费(几乎可忽略)
延迟 网络延迟 + 排队 本地无延迟
隐私 数据上传云端 完全本地
适合场景 偶尔使用、无 GPU 高频使用、有 GPU

常见问题

Q: ERNIE-Image Base 和 Turbo 在 ComfyUI 中有什么区别?

特性 Base Turbo
参数 8B DiT 8B DiT (蒸馏)
步数 20-50 8
质量 最佳 接近 Base
CFG Scale 5.0-7.0 1.0
速度 较慢 快 3-6 倍
推荐场景 最终出图、印刷品 快速迭代、预览

Q: Prompt Enhancer 在 ComfyUI 中如何启用?

在 CLIP Text Encode 节点前添加 ERNIE PE 节点,连接 ministral-3-3b.safetensors。简短提示词会先经过 PE 扩展,再输入到主模型。

Q: 显存不足怎么办?

  1. 使用 Turbo 模型(显存需求更低)
  2. 启用 --lowvram 启动参数
  3. 使用 FP8 量化模型
  4. 降低输出分辨率后放大

总结

ComfyUI 对 ERNIE-Image 的官方支持标志着开源文生图生态的成熟。从基础工作流到自定义节点、从单图生成到批量生产、从本地部署到云端方案,ERNIE-Image 在 ComfyUI 生态中的集成度正在快速提升。

关键推荐:

  1. 新手:使用官方模板快速上手,先跑通 Base 模型
  2. 进阶用户:搭配 Pixaroma Note 编写复杂提示词
  3. 生产用户:批量工作流 + ControlNet 组合,实现自动化生产
  4. 无 GPU 用户:Floyo 云端方案零门槛体验

关键词: ernie-image comfyui ernie-image comfyui workflow comfyui ernie-image official support ernie-image pixaroma nodes comfyui ernie-image controlnet ernie-image batch generation comfyui

ERNIE-Image Team