ERNIE-Image × Wan 2.6 图生视频完整工作流:从静态图像到 1080P 动画的 ComfyUI 全链路
从 ERNIE-Image 的高质量静态图像出发,通过 Wan 2.6、LTX 2.3 等最新视频模型,在 ComfyUI 中构建完整的 "文生图 → 图生视频" 自动化管线。
从 Stable Diffusion 到 FLUX.2,开源图像生成经历了多次范式升级。但一个始终未解的问题是:如何让静态图像动起来?
2026 年 6 月,Wan 2.6、LTX 2.3、Seedance 2.0 等视频生成模型已经成熟到可以支持 1080P 输出,ERNIE-Image 作为 8B 参数的开源文生图旗舰,恰好提供了最理想的静态图像起点。
本文将展示如何将这些技术串联成完整的 ComfyUI 工作流,让 AI 创作的静态图像变成流畅的动态视频。
为什么选择 ERNIE-Image 作为起点
ERNIE-Image 在图像到视频场景中有三个核心优势:
高质量静态图像:8B DiT 架构在字符一致性、场景细节和光照表现上位列开源模型前列。
精准的指令遵循:ERNIE-Image 的 3B Prompt Enhancer 和强大的指令跟随能力,确保生成的静态图像与你的创意描述高度一致。
多风格覆盖:从写实摄影到动漫插画,ERNIE-Image 的风格多样性为不同类型的视频内容提供了丰富的起点。
2026 年 6 月视频模型生态全景
| 模型 | 参数 | 核心优势 | VRAM 需求 | 适用场景 |
|---|---|---|---|---|
| Wan 2.6 | 14B MoE | 运动质量、1080P 原生支持 | 24GB+ | 通用 I2V、电影运动 |
| LTX 2.3 | 2.6B | 速度最快、量化友好 | 8GB+ | 快速迭代、低配硬件 |
| Seedance 2.0 | 未知 | 多镜头一致性、音频同步 | 24GB+ | 多镜头电影、广告 |
| Kling 3.0 | 闭源 | 4K 输出、角色一致性 | API | 角色驱动叙事、长视频 |
Wan 2.6 是开源领域的最佳选择——MoE 架构在保持运动质量的同时控制推理成本,ComfyUI 官方节点已原生支持。
基础工作流:ERNIE-Image → Wan 2.6 I2V
环境准备
# 1. 安装 ComfyUI
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
pip install -r requirements.txt
2. 下载 ERNIE-Image 模型
从 https://huggingface.co/Comfy-Org/ERNIE-Image
放置到 models/diffusion_models/
3. 下载 Wan 2.6 模型
从 https://huggingface.co/Wan-AI
放置到 models/unet/ 或 models/diffusion_models/
工作流节点链
[CLIP Text Encode] → [ERNIE-Image Sampler] → [Save Image]
↓
[Load Image] ← [生成的静态图像]
↓
[Wan2.6 ImageToVideo] → [Save Video]
ERNIE-Image 图像生成配置
{
"model": "ernie-image-base.safetensors",
"vae": "flux2_vae.safetensors",
"clip": "clip_l.safetensors",
"scheduler": "dpmpp_2s_ancestral",
"steps": 8,
"cfg": 5.0,
"width": 1024,
"height": 768,
"use_pe": true
}
关键提示:生成用于视频转化的静态图像时,建议使用 1024×768 分辨率(16:9),这既是 ERNIE-Image 的舒适区,也是 Wan 2.6 的最佳输入尺寸。
Wan 2.6 I2V 配置
{
"model": "wan2.6_i2v_fp8.safetensors",
"vae": "wan_vae.safetensors",
"motion_bucket_id": 128,
"frames": 81,
"fps": 24,
"resolution": "1024x576",
"guidance_scale": 6.0,
"steps": 30
}
参数调优指南:
motion_bucket_id:控制运动强度(64=轻微,128=中等,256=强烈)frames:81 帧 ≈ 3.4 秒 @24fpsresolution:Wan 2.6 支持最高 1080P,但 1024×576 在 24GB 显存上最稳定
进阶工作流 A:ERNIE-Image → Wan 2.6 → 1080P 升级
Wan 2.6 原生支持 1080P 输出,不再需要 Topaz Video AI 后处理:
[ERNIE-Image 生成 1024x768]
↓
[Wan 2.6 I2V @1024x576, 81 frames]
↓
[WAN 2x Upscaler VAE] → 2560x1280 输出
↓
[Save Video @1080P]
使用 WAN 2x Upscaler VAE 节点可以将 1024×576 的视频放大到 2560×1280(2.5K),保持运动一致性和画面质量。
进阶工作流 B:多模型对比选择
低显存方案(8-12GB)
[ERNIE-Image Turbo NVFP4 @4.78GB]
↓
[LTX 2.3 I2V @量化版]
↓
[Save Video @720P]
LTX 2.3 是目前最轻量级的 I2V 模型,支持 FP8 量化后可在 8GB 显存运行。缺点是运动质量不如 Wan 2.6,但速度优势明显。
平衡方案(16-24GB)
[ERNIE-Image FP8 @14GB]
↓
[Wan 2.6 I2V FP8 @20GB]
↓
[Save Video @1080P]
FP8 版本的 ERNIE-Image 和 Wan 2.6 在 24GB 显卡(如 RTX 4090、RTX 5070 Ti)上可以串联运行。
旗舰方案(48GB+)
[ERNIE-Image BF16 @29GB]
↓
[Wan 2.6 FP16 I2V @48GB]
↓
[WAN 2x Upscaler VAE]
↓
[Save Video @4K]
双卡 A100 或 RTX 6000 Ada 配置可以跑全精度管线。
批量生产管线
结合 EI-093 的多提示词批量生成工作流,可以构建完整的批量图生视频管线:
[Prompt Multi Batch (100 个不同 prompt)]
↓
[ERNIE-Image 批量生成静态图像]
↓
[Wan 2.6 I2V 批量转视频]
↓
[批量输出 100 段短视频]
实际案例:电商产品展示视频批量生成——用 ERNIE-Image 生成 100 个产品在不同场景的静态图,再通过 Wan 2.6 批量转化为展示视频。
硬件需求汇总
| 配置 | VRAM | 可运行方案 | 输出质量 |
|---|---|---|---|
| RTX 4060 Ti 16GB | 16GB | ERNIE-Image FP8 + LTX 2.3 量化 | 720P |
| RTX 4070 Ti 16GB | 16GB | ERNIE-Image FP8 + Wan 2.6 FP8(降分辨率) | 720P-1080P |
| RTX 4090 24GB | 24GB | ERNIE-Image FP8 + Wan 2.6 FP8 | 1080P |
| RTX 5090 32GB | 32GB | ERNIE-Image FP8 + Wan 2.6 FP16 | 1080P-4K |
| A100 80GB | 80GB | ERNIE-Image BF16 + Wan 2.6 FP16 | 4K |
常见问题排查
问题 1:Wan 2.6 节点找不到模型文件
- 检查模型文件名是否与节点 README 中指定的完全一致
- 确认文件放置在
models/unet/或models/diffusion_models/目录
问题 2:生成视频帧数太少
- 增加
frames参数(81=3.4秒,161=6.7秒) - 降低分辨率以减少显存占用
问题 3:运动不自然
- 调整
motion_bucket_id(64=轻微,128=中等) - 确保 ERNIE-Image 生成的静态图像质量足够高(运动质量受输入图像质量影响)
问题 4:显存不足
- 使用 FP8 量化版本
- 降低输出分辨率和帧数
- 在 Wan 2.6 节点前添加
Clear Cache节点释放 ERNIE-Image 占用的显存
总结
ERNIE-Image 与 Wan 2.6 的组合,让开源社区第一次拥有了完整的 "文本 → 静态图像 → 动态视频" 管线。8B 参数的 ERNIE-Image 提供高质量的静态起点,14B MoE 的 Wan 2.6 负责赋予画面生命力。
与 EI-056 中介绍的 LTX 2.3 / Wan 2.2 方案相比,Wan 2.6 带来了三个实质性升级:原生 1080P 支持、更流畅的运动质量、更好的 ComfyUI 官方节点集成。对于内容创作者来说,这意味着可以在一台 24GB 显存的消费级显卡上,完成从创意到成片的全流程。