ERNIE-Image 多模态 Agent 实战:从文本到图像到视频的全自动管线
摘要:在 AI Agent 时代,单一的图像生成模型已经不够用。本文介绍如何构建一个基于 ERNIE-Image 的多模态 Agent 工作流——从用户自然语言输入,自动经过 Prompt 增强、图像生成、美学评分、图像到视频转换,最终输出专业级内容。全程使用开源模型,完全可本地部署。
背景:为什么需要多模态 Agent?
2026 年的 AI 图像生成已经不再是"输入 prompt,输出图片"的简单流程。专业用户需要的是一个完整的自动化管线:
- 用户用简单语言描述需求 → 2. AI 自动增强 prompt → 3. 图像生成 → 4. 美学评分筛选 → 5. 图像到视频转换 → 6. 最终输出
ERNIE-Image 生态天然适合构建这样的管线——它本身就包含了 Prompt Enhancer(3B)、美学评估模型(ERNIE-Image-Aes,8B)和主生成模型(8B),再加上 ComfyUI 的可视化编排能力,可以构建一个完整的多模态 Agent 系统。
系统架构:四阶段管线
阶段一:Prompt 增强(Prompt Enhancer 3B)
用户输入:"一只在月球上奔跑的狗"
Prompt Enhancer 自动增强为:"一只金毛犬在月球表面奔跑,尘土飞扬,地球在背景中可见,电影级光影,8K 超高清,HDR,动态模糊效果,科幻电影风格"
这是 ERNIE-Image 生态中独特的一环——大多数图像生成模型的 prompt 增强要么依赖用户手动编写,要么需要外部 LLM。ERNIE-Image 内置了基于 Ministral 3B 微调的 Prompt Enhancer,专门为图像生成任务优化。
阶段二:图像生成(ERNIE-Image 8B / Turbo)
使用增强后的 prompt,通过 ERNIE-Image Base(50 步,高质量)或 Turbo(8 步,快速)生成图像。
关键参数配置:
- Sampler:dpmpp_2s_ancestral(社区验证的最佳采样器)
- CFG Scale:5.0-7.0(中等引导强度)
- Steps:50(Base)或 8(Turbo)
- Resolution:根据需求选择 1024×1024 或自定义宽高比
阶段三:美学评分(ERNIE-Image-Aes 8B)
生成的图像通过 ERNIE-Image-Aes 美学评估模型打分。该模型在 ERIA-1K 基准上达到 SRCC 0.7445、PLCC 0.7598,远超之前的开源美学评估模型。
评分策略:
- 分数 ≥ 7.0:保留用于后续处理
- 分数 5.0-7.0:备选,可能需要微调 prompt 后重新生成
- 分数 < 5.0:丢弃,调整 prompt 后重试
阶段四:图像到视频转换(Wan 2.7 / LTX 2.3)
通过 ComfyUI 的图像到视频节点,将静态图像转换为动态视频。目前支持的方案:
- Wan 2.7:高质量图像到视频,支持 1080P 输出
- LTX 2.3 Sulphur:快速视频生成,适合实时预览
- Hunyuan3D 2.0:如果需要 3D 纹理化模型
实战 ComfyUI 工作流搭建
环境准备
# 1. 安装 ComfyUI
git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI
pip install -r requirements.txt
2. 下载 ERNIE-Image 模型
Base 模型: https://huggingface.co/baidu/ERNIE-Image
Turbo 模型: https://huggingface.co/baidu/ERNIE-Image-Turbo
3. 安装必要的自定义节点
pip install comfyui-easy-install
或手动安装需要的节点
节点连接逻辑
[用户输入文本]
↓
[CLIP Text Encode (PE Enhancer)] → 增强后的 prompt
↓
[ERNIE-Image DiT Sampler] → 图像输出
↓
[ERNIE-Image-Aes Scorer] → 美学分数
↓
[条件判断: 分数 ≥ 7.0?]
↓ Yes
[Wan 2.7 Image-to-Video] → 视频输出
↓
[最终结果保存]
关键配置要点
VRAM 管理:同时加载多个模型(PE 3B + DiT 8B + Aes 8B + Video 模型)需要 48GB+ VRAM。建议使用 SGLang 独立部署 PE,或使用 FP8/GGUF 量化版本。
批量处理:ComfyUI 的 Batch 模式支持一次生成多张图像,通过美学评分自动筛选最佳结果。
错误处理:当美学评分低于阈值时,自动回退到修改 prompt 重新生成的循环。
实际应用案例
案例 1:电商产品视频自动生成
需求:电商卖家需要为新产品生成宣传视频
工作流:
- 输入产品名称和卖点:"一款智能手表,黑色表盘,运动风格"
- PE 自动增强 prompt,加入光影、场景描述
- ERNIE-Image 生成产品图(多角度:正面、侧面、佩戴效果)
- ERNIE-Image-Aes 筛选最佳角度
- Wan 2.7 将产品图转换为 10 秒产品展示视频
- 输出可直接用于电商平台的宣传素材
成本对比:
- 传统方案(设计师+摄影师+视频剪辑):¥5,000-20,000/产品
- ERNIE-Image Agent 方案:¥0(本地部署)或 ≈ ¥50/产品(云端 API)
案例 2:社交媒体内容批量生产
需求:内容创作者需要为不同平台生成定制化视觉内容
工作流:
- 输入核心主题:"AI 技术改变生活"
- PE 为不同平台生成不同风格的 prompt
- ERNIE-Image 批量生成多尺寸图像(1:1 Instagram、16:9 YouTube、9:16 TikTok)
- 每张图包含对应平台的文字信息(标题、标签)
- 最佳结果通过 Wan 2.7 生成短视频版本
- 自动输出各平台格式
效率提升:从 2 天工作量缩减到 30 分钟
案例 3:学术研究可视化
需求:科研人员需要将复杂数据转化为直观图表
工作流:
- 输入数据描述和数据可视化需求
- PE 增强 prompt,包含具体的图表类型、配色方案
- ERNIE-Image 生成出版级质量图表
- ERNIE-Image-Aes 确保视觉质量
- 输出可用于学术论文的图表
优势:ERNIE-Image 的文字渲染能力使其特别适合生成带标注的科学图表
部署方案对比
| 方案 | VRAM 需求 | 成本 | 适用场景 |
|---|---|---|---|
| 本地 A100 80GB | 80GB | 自有 GPU | 专业级批量生产 |
| 本地 RTX 5090 | 32GB(FP8) | 自有 GPU | 个人创作者 |
| Google Colab 免费 | 16GB(T4) | ¥0 | 学习和小规模使用 |
| RunPod A100 | 40-80GB | ≈ $0.5-2/小时 | 中等规模生产 |
| SiliconFlow API | 无需 GPU | ≈ ¥0.11/张 | 轻度使用 |
| Civitai API | 无需 GPU | Buzz 计费 | 按需使用 |
常见问题与解决方案
问题 1:VRAM 不足
解决方案:
- 使用 FP8 量化(显存减少 ~50%)
- 使用 GGUF 格式(支持 Q4/Q8 量化)
- 通过 SGLang 独立部署 PE,释放主 GPU 内存
- 在 ComfyUI 中使用 "Force Dispatch" 节点动态加载模型
问题 2:美学评分过高/过低
解决方案:
- ERNIE-Image-Aes 对"摄影风格"打分偏高,对"插画/动漫"打分偏低
- 建议根据风格类别调整评分阈值:
- 摄影写实:≥ 7.0
- 插画/动漫:≥ 5.5
- 抽象艺术:≥ 5.0
问题 3:视频质量不佳
解决方案:
- 输入图像的分辨率影响视频输出质量——确保 ≥ 1024×1024
- Wan 2.7 对"简单场景"效果更好,复杂多元素场景可能产生伪影
- 使用 LTX 2.3 做快速预览,确认方向后用 Wan 2.7 做最终渲染
总结
ERNIE-Image 多模态 Agent 工作流代表了 AI 内容生成的未来方向:从单一模型到完整管线,从手动操作到自动化生产。
核心优势:
- 全开源:所有组件均可本地部署,无 API 限制
- 成本效益:本地部署成本接近零(已有 GPU)
- 中文原生:从 prompt 增强到文字渲染,全链路中文支持
- 灵活组合:每个阶段可独立替换或升级
随着 ERNIE-Image 编辑模型的正式发布和更多社区节点的推出,这条管线还将进一步完善。对于需要批量生产专业级视觉内容的团队和个人来说,现在就是开始构建的最佳时机。
本文数据来源:ERNIE-Image 官方文档、ComfyUI 官方模板、Pixaroma 教程视频、社区实测反馈。