ERNIE-Image 的 PE 到底是什么?揭秘 3B Prompt Enhancer 的原理与开关技巧

Apr 30, 2026

ERNIE-Image 的 PE 到底是什么?揭秘 3B Prompt Enhancer 的原理与开关技巧

如果你用过 ERNIE-Image,一定注意到工作流里有一个叫 "Prompt Enhancer"(简称 PE)的模块。

ComfyUI 默认开启,Diffusers API 默认开启。你输入一句简单描述,它自动帮你扩写成一段包含光照、构图、风格的专业 prompt,然后生成一张质量明显更好的图片。

但与此同时,社区里也有不少抱怨:

"我明明写的是 'Hello World',图片上却出现了中文。"
"PE 把我精心写的 prompt 改得面目全非。"
"到底什么时候该开,什么时候该关?"

PE 到底是什么?它为什么能提升图片质量?什么情况下反而坑你?这篇文章一次性讲清楚。


一、PE 在 ERNIE-Image 推理管道中的位置

ERNIE-Image 的完整推理管道包含四个核心组件:

用户输入 prompt
    ↓
[PE 模块]  3B 语言模型,自动扩展 prompt(可选)
    ↓
[Text Encoder]  Ministral-3B,将 prompt 编码为文本特征
    ↓
[8B DiT 扩散模型]  根据文本特征生成图片
    ↓
[VAE 解码]  输出最终图像

PE 是第一步预处理模块。它在图片生成之前运行,把用户的原始 prompt 改写为更详细的结构化描述,再交给 Text Encoder。

PE 不是扩散模型的一部分,而是一个独立的语言模型。你可以把它理解为 ERNIE-Image 的"前置 prompt 翻译官"——把用户的口语化表达翻译成扩散模型能更好理解的专业描述。

ComfyUI 文件结构:

ComfyUI/models/
├── diffusion_models/ernie-image.safetensors      # 8B DiT 主模型
├── text_encoders/
│   ├── ministral-3-3b.safetensors                # Text Encoder
│   └── ernie-image-prompt-enhancer.safetensors   # PE 模块
└── vae/flux2-vae.safetensors                     # VAE 解码器

PE 文件 ernie-image-prompt-enhancer.safetensors 就是一个完整的 3B 参数语言模型。


二、PE 的基座模型——为什么选 Ministral-3B?

PE 的基座模型是 Ministral-3B-Instruct(Mistral AI 出品),百度在其基础上做了指令微调,专门用于文生图 prompt 扩展任务。

Ministral-3B 是 Mistral 3 系列的最小尺寸模型,2025 年底发布,采用 MoE(混合专家)架构。

选择它作为 PE 基座有四个原因:

1. 推理速度是硬需求

PE 是前置步骤,用户不希望等太久。3B 模型在消费级 GPU 上推理速度极快——单次 prompt 扩展通常在数秒内完成。如果用 7B 或更大模型,PE 本身就成了推理瓶颈,抵消了 ERNIE-Image Turbo 8 步推理的速度优势。

2. MoE 架构天然高效

Ministral 3 系列采用混合专家结构,每次推理只激活部分参数,实际计算量远小于标称的 3B。对于 PE 这种"即插即用"的前置模块,效率决定用户体验。

3. 指令微调能力强

Ministral-3B-Instruct 本身就是一个指令微调模型,擅长"接受一段文本,按要求改写"。这恰好是 PE 的核心任务。

4. 开源许可兼容

Ministral 使用开源友好的许可,与 ERNIE-Image 整体的 Apache 2.0 开源策略一致。


三、PE 到底做了什么?

PE 的核心能力是将简短描述扩展为包含 5 大要素的结构化 prompt:

要素 PE 会添加 示例
主体细节 材质、颜色、形态 "matte ceramic texture", "weathered oak surface"
环境/场景 背景、氛围 "morning kitchen setting", "soft diffused daylight"
光照描述 光源方向、光质 "soft window light from the left", "volumetric fog"
构图指令 镜头、景深、透视 "shallow depth of field", "centered composition"
风格定义 摄影类型、艺术风格 "commercial product photography", "cinematic lighting"

实际效果对比

原始输入(3 个词):

a ceramic coffee mug

PE 扩展后(类似输出):

Close-up product photograph of a matte ceramic coffee mug on a weathered oak table in a morning kitchen setting, soft window light from the left casting warm tones, shallow depth of field, commercial product photography style, 8K detail, centered composition

原始 prompt 只有 3 个词,PE 将其扩展为包含产品摄影、光照方向、景深、风格等完整描述。扩散模型接收到的是专业级别的 prompt,而不是一个关键词——生成质量自然更高。

ComfyUI 中的 PE 参数设置

在 ComfyUI 工作流中,PE 节点使用 CLIPLoader 加载(虽然实际是 LLM,ComfyUI 复用了 CLIPLoader 接口)。关键参数:

参数 推荐值 说明
max_length 1536–2048 输出 prompt 最大长度
temperature 0.6 采样温度,控制随机性
top_p 0.8 核采样阈值
thinking mode Disabled 关闭推理模式

四、PE 对基准测试的真实贡献

HuggingFace 官方模型卡提供了 GenEval 基准的有/无 PE 对比数据:

配置 GenEval 得分
ERNIE-Image (w/ PE) 0.8625
ERNIE-Image (w/o PE) ~0.73
ERNIE-Image-Turbo (w/ PE) 0.8510

PE 对 GenEval 基准贡献了约 13% 的分数提升。对短 prompt 场景尤为显著——输入越短,PE 的增益越大。

但这里有一个关键矛盾:文字渲染场景反而建议关闭 PE。

LongTextBench 基准显示 ERNIE-Image (w/ PE) 得分 0.9788,看起来很完美。但实际使用中,如果 prompt 里包含需要精确渲染的文字,PE 可能改写这些文字内容,导致图片上出现的不是你想要的文字。

这就是为什么 ERNIE-Image 在文字渲染上强(LongTextBench 得分高),但 PE 反而可能破坏文字精确性的原因——PE 改写的是 prompt 文本,而扩散模型忠实执行改写后的文本。


五、PE 最大的坑:它会把你的 prompt 翻译成中文

这是 Reddit 社区用户实测发现的一个关键行为(r/StableDiffusion, 2026-04):

"The default workflow from the Comfy templates has a 'Prompt Enhancer' section that among other things, translates your prompt to Chinese."

PE 在扩展过程中倾向于将 prompt 转为中文处理。这意味着:

  • 英文 prompt 可能被翻译成中文,扩散模型接收到的实际上是中文指令
  • 如果 prompt 里包含需要精确渲染的英文文字(如标题 "SUMMER BEATS 2026"),PE 可能将其改写为中文,图片上出现的就是中文字符

Scenario.com 的官方文档也明确建议:中文文字渲染场景,关闭 Prompt Enhancer。


六、开关速查表

场景 PE 建议 原因
一句话简单描述 ✅ 开启 PE 自动补充光照、构图、风格等细节
不懂 prompt 工程 ✅ 开启 内置 prompt 助手,降低使用门槛
Turbo 模式快速出图 ✅ 开启 PE + 8 步 = 最快工作流
需要精确渲染英文文字 ❌ 关闭 PE 可能翻译为中文
需要精确渲染中文文字 ❌ 关闭 PE 可能改写文字内容
已有详细结构化 prompt ❌ 关闭 避免冲突和冗余扩展
固定 seed 迭代优化 ❌ 关闭 隔离变量,判断改动效果
GGUF 量化工作流 ❌ 不可用 Unsloth 未提供 PE 的 GGUF 版本

七、PE 的替代方案——更强的 LLM

官方明确建议:使用更强的 LLM(如 GPT-4、Claude)作为 Prompt Enhancer 可进一步提升效果。

内置 PE 的优势是免费、离线、速度快。劣势是 3B 模型的理解深度有限,扩展结果偏向模板化。如果你追求极致质量,工作流可以调整为:

  1. 用 GPT-4/Claude 将短 prompt 扩展为专业级详细描述
  2. 在 ERNIE-Image 中关闭 PE
  3. 粘贴扩展后的 prompt 生成

这样 PE 的改写行为被完全绕过,扩散模型执行的是你(或更强 LLM)精心构建的指令。


八、总结

PE 是 ERNIE-Image 最容易被误解的模块之一。它本质上是一个 3B 语言模型,任务是把用户的简短描述扩展为结构化 prompt。

  • 短 prompt → PE 帮你补充细节,质量提升明显
  • 精确文字 → PE 会改写文字内容,必须关闭
  • 已有详细 prompt → PE 画蛇添足,建议关闭
  • 追求极致 → 用 GPT-4/Claude 替代内置 PE

理解 PE 的工作原理和边界,比盲目开关更重要。

ERNIE-Image Team