ERNIE-Image ComfyUI 官方支持与自定义节点完全指南
摘要:ComfyUI 现已正式支持 ERNIE-Image,从 v0.19.1 版本开始即可在模板中直接加载官方工作流。本文深入解析 ERNIE-Image 在 ComfyUI 中的部署方式、Pixaroma Note 等自定义节点的实际应用、ControlNet 组合工作流、以及从单图生成到批量生产的高级技巧。无论你是 ComfyUI 新手还是有经验的工作流开发者,都能找到提升效率的实用方案。
ComfyUI 官方支持的里程碑
2026 年初,ComfyUI 官方宣布对 ERNIE-Image 的 Day-0 支持,这意味着:
- 原生集成:ComfyUI v0.19.1+ 内置 ERNIE-Image 工作流模板
- 一键加载:通过
Templates→ERNIE-Image直接获取完整工作流 - 自动模型下载:所需模型文件通过 HuggingFace 自动获取
- 双模型支持:ERNIE-Image Base(50 步高质量)和 ERNIE-Image-Turbo(8 步快速迭代)
这标志着 ERNIE-Image 从"社区手动适配"进入了"官方生态支持"阶段。
ComfyUI 中的 ERNIE-Image 核心架构
ERNIE-Image 在 ComfyUI 中的工作流由以下核心节点组成:
[CLIP Text Encode] → [ERNIE-Image Diffusion Model] → [VAE Decode] → [Save Image]
↑ ↑ ↑
Prompt Text ernie-image.safetensors flux2_ae.safetensors
(或 PE 输出) (或 turbo.safetensors)
关键组件说明:
| 组件 | 文件 | 作用 | 来源 |
|---|---|---|---|
| 扩散模型 | ernie-image.safetensors |
主生成模型(8B DiT) | Comfy-Org/ERNIE-Image |
| Turbo 模型 | ernie-image-turbo.safetensors |
蒸馏加速版(8 步) | Comfy-Org/ERNIE-Image |
| Prompt Enhancer | ministral-3-3b.safetensors |
3B 提示词增强器 | baidu/ERNIE-Image |
| 文本编码器 | CLIP/CLIPViT | 文本条件编码 | 内置 |
| VAE | flux2_ae.safetensors |
FLUX.2 变分自编码器 | FLUX.2 |
注意:ERNIE-Image 使用 FLUX.2 的 VAE(
flux2_ae.safetensors),而非传统的 SD VAE。这是 ComfyUI 配置中最常见的错误来源之一。
快速上手:从安装到出图
第一步:更新 ComfyUI
cd ComfyUI
git pull origin master
# 确保版本 ≥ v0.19.1
第二步:加载 ERNIE-Image 工作流
- 打开 ComfyUI Web 界面
- 点击
Templates标签 - 搜索
ERNIE-Image - 选择
ERNIE-Image或ERNIE-Image-Turbo工作流 - 点击
Load加载
第三步:下载模型文件
ComfyUI 会自动检测缺失的模型并提示下载。模型文件位于:
ComfyUI/models/diffusion_models/ernie-image.safetensors(Base)ComfyUI/models/diffusion_models/ernie-image-turbo.safetensors(Turbo)ComfyUI/models/vae/flux2_ae.safetensors(VAE)ComfyUI/models/text_encoders/ministral-3-3b.safetensors(PE)
第四步:生成第一张图
- 在
CLIP Text Encode节点输入提示词 - 设置采样器(Turbo 推荐
Euler,步数 8;Base 推荐DPM++ 2M,步数 20-50) - 设置 CFG Scale(Turbo: 1.0,Base: 5.0-7.0)
- 点击
Queue Prompt开始生成
自定义节点:Pixaroma Note 与 Resolution 节点
Pixaroma Note:富文本提示词编辑器
来源: YouTube Ep14 教程中的自定义节点
解决的问题:ERNIE-Image 的文字渲染能力强大,但 ComfyUI 默认的文本输入框对多行、多语言、复杂结构的提示词支持有限。
功能:
- 富文本编辑:支持多段落、换行、缩进
- 彩色文本标注:用颜色区分提示词的不同部分(主体、背景、风格、文字)
- 高亮标记:快速定位关键参数
- 列表/代码块:结构化提示词组织
安装:
cd ComfyUI/custom_nodes
git clone https://github.com/Pixaroma/comfyui-pixaroma-nodes
pip install -r requirements.txt
典型工作流:
[Pixaroma Note (提示词编辑)] → [CLIP Text Encode] → [KSampler] → [VAE Decode] → [Save Image]
Resolution 节点:智能分辨率计算
解决的问题:ERNIE-Image 的最佳输出分辨率因场景而异——海报设计需要高宽比,社交媒体配图需要特定尺寸,而产品图需要正方形。
功能:自动根据提示词内容或预设模板计算最佳输出分辨率。
典型用法:
- 社交媒体封面:1280×640(2:1)
- 产品图:1024×1024(1:1)
- 海报设计:1024×1536(2:3)
- YouTube 封面:1280×720(16:9)
高级组合工作流
工作流 1:ControlNet + 超级分辨率
场景:将线稿转换为高质量插图或 3D 风格渲染图
[Load Image (线稿)] → [Canny Edge Detect] → [ControlNet] → [KSampler (ERNIE-Image)] → [ESRGAN Upscale] → [Save Image]
关键配置:
- ControlNet 强度:0.5-0.8
- 采样器:DPM++ 2M Karras
- 步数:30-50
- 放大倍率:2x-4x
工作流 2:图像到视频(WanVideo + GIMM-VFI)
场景:将 ERNIE-Image 生成的静态图像转换为短视频
[ERNIE-Image Generate] → [WanVideo I2V] → [GIMM-VFI (帧插值)] → [Save Video]
说明:这是 ComfyUI 官方推荐的组合工作流,利用 WanVideo 进行图像到视频转换,再通过 GIMM-VFI 提升帧率。
工作流 3:FP8 混合精度放大
场景:在有限显存下实现高质量高分辨率输出
[KSampler (FP8 Base, 512×512)] → [KSampler (FP8 Upscale, 1024×1024)] → [Save Image]
关键配置:
- 第一阶段:512×512,FP8 模型,20 步
- 第二阶段:1024×1024,FP8 模型,15 步,低噪声
- 总显存占用:比 BF16 1024×1024 直接生成减少约 60%
工作流 4:ICEdit + Flux + ESRGAN 局部重绘
场景:对 ERNIE-Image 生成结果的特定区域进行精细化修改
[Load Image] → [ICEdit Inpaint] → [Flux Style Transfer] → [ESRGAN Upscale] → [Save Image]
批量生产工作流
对于电商产品图、社交媒体批量配图等场景,ComfyUI 支持批量提示词输入:
# 使用 Wildcard 或文本文件批量输入
# prompts.txt 每行一个提示词
prompt1: 白色背景上的蓝色运动鞋,产品摄影风格
prompt2: 白色背景上的红色耳机,产品摄影风格
prompt3: 白色背景上的黑色手表,产品摄影风格
ComfyUI 批量配置:
- 使用
Load Text节点读取prompts.txt - 配合
Batch Prompt节点拆分提示词 - 每个提示词独立生成一张图
Save Image节点自动按序号保存
云端方案:Floyo H100 云端工作流
如果你没有本地 GPU,Floyo 提供了云端运行 ERNIE-Image Turbo 的方案:
- 链接: https://www.floyo.ai/workflows/ernie-turbo-text-to-image-workflow
- 硬件: H100 云端 GPU
- 优势:无需本地安装,浏览器直接使用
- 成本: 按使用时间计费,适合偶尔使用的用户
对比本地部署:
| 维度 | Floyo 云端 | 本地 ComfyUI |
|---|---|---|
| 初始成本 | $0 | GPU 硬件成本 |
| 单次生成成本 | ~$0.05-0.10 | 电费(几乎可忽略) |
| 延迟 | 网络延迟 + 排队 | 本地无延迟 |
| 隐私 | 数据上传云端 | 完全本地 |
| 适合场景 | 偶尔使用、无 GPU | 高频使用、有 GPU |
常见问题
Q: ERNIE-Image Base 和 Turbo 在 ComfyUI 中有什么区别?
| 特性 | Base | Turbo |
|---|---|---|
| 参数 | 8B DiT | 8B DiT (蒸馏) |
| 步数 | 20-50 | 8 |
| 质量 | 最佳 | 接近 Base |
| CFG Scale | 5.0-7.0 | 1.0 |
| 速度 | 较慢 | 快 3-6 倍 |
| 推荐场景 | 最终出图、印刷品 | 快速迭代、预览 |
Q: Prompt Enhancer 在 ComfyUI 中如何启用?
在 CLIP Text Encode 节点前添加 ERNIE PE 节点,连接 ministral-3-3b.safetensors。简短提示词会先经过 PE 扩展,再输入到主模型。
Q: 显存不足怎么办?
- 使用 Turbo 模型(显存需求更低)
- 启用
--lowvram启动参数 - 使用 FP8 量化模型
- 降低输出分辨率后放大
总结
ComfyUI 对 ERNIE-Image 的官方支持标志着开源文生图生态的成熟。从基础工作流到自定义节点、从单图生成到批量生产、从本地部署到云端方案,ERNIE-Image 在 ComfyUI 生态中的集成度正在快速提升。
关键推荐:
- 新手:使用官方模板快速上手,先跑通 Base 模型
- 进阶用户:搭配 Pixaroma Note 编写复杂提示词
- 生产用户:批量工作流 + ControlNet 组合,实现自动化生产
- 无 GPU 用户:Floyo 云端方案零门槛体验
关键词: ernie-image comfyui ernie-image comfyui workflow comfyui ernie-image official support ernie-image pixaroma nodes comfyui ernie-image controlnet ernie-image batch generation comfyui