ERNIE-Image 的 PE 到底是什么?揭秘 3B Prompt Enhancer 的原理与开关技巧
如果你用过 ERNIE-Image,一定注意到工作流里有一个叫 "Prompt Enhancer"(简称 PE)的模块。
ComfyUI 默认开启,Diffusers API 默认开启。你输入一句简单描述,它自动帮你扩写成一段包含光照、构图、风格的专业 prompt,然后生成一张质量明显更好的图片。
但与此同时,社区里也有不少抱怨:
"我明明写的是 'Hello World',图片上却出现了中文。"
"PE 把我精心写的 prompt 改得面目全非。"
"到底什么时候该开,什么时候该关?"
PE 到底是什么?它为什么能提升图片质量?什么情况下反而坑你?这篇文章一次性讲清楚。
一、PE 在 ERNIE-Image 推理管道中的位置
ERNIE-Image 的完整推理管道包含四个核心组件:
用户输入 prompt
↓
[PE 模块] 3B 语言模型,自动扩展 prompt(可选)
↓
[Text Encoder] Ministral-3B,将 prompt 编码为文本特征
↓
[8B DiT 扩散模型] 根据文本特征生成图片
↓
[VAE 解码] 输出最终图像
PE 是第一步预处理模块。它在图片生成之前运行,把用户的原始 prompt 改写为更详细的结构化描述,再交给 Text Encoder。
PE 不是扩散模型的一部分,而是一个独立的语言模型。你可以把它理解为 ERNIE-Image 的"前置 prompt 翻译官"——把用户的口语化表达翻译成扩散模型能更好理解的专业描述。
ComfyUI 文件结构:
ComfyUI/models/
├── diffusion_models/ernie-image.safetensors # 8B DiT 主模型
├── text_encoders/
│ ├── ministral-3-3b.safetensors # Text Encoder
│ └── ernie-image-prompt-enhancer.safetensors # PE 模块
└── vae/flux2-vae.safetensors # VAE 解码器
PE 文件 ernie-image-prompt-enhancer.safetensors 就是一个完整的 3B 参数语言模型。
二、PE 的基座模型——为什么选 Ministral-3B?
PE 的基座模型是 Ministral-3B-Instruct(Mistral AI 出品),百度在其基础上做了指令微调,专门用于文生图 prompt 扩展任务。
Ministral-3B 是 Mistral 3 系列的最小尺寸模型,2025 年底发布,采用 MoE(混合专家)架构。
选择它作为 PE 基座有四个原因:
1. 推理速度是硬需求
PE 是前置步骤,用户不希望等太久。3B 模型在消费级 GPU 上推理速度极快——单次 prompt 扩展通常在数秒内完成。如果用 7B 或更大模型,PE 本身就成了推理瓶颈,抵消了 ERNIE-Image Turbo 8 步推理的速度优势。
2. MoE 架构天然高效
Ministral 3 系列采用混合专家结构,每次推理只激活部分参数,实际计算量远小于标称的 3B。对于 PE 这种"即插即用"的前置模块,效率决定用户体验。
3. 指令微调能力强
Ministral-3B-Instruct 本身就是一个指令微调模型,擅长"接受一段文本,按要求改写"。这恰好是 PE 的核心任务。
4. 开源许可兼容
Ministral 使用开源友好的许可,与 ERNIE-Image 整体的 Apache 2.0 开源策略一致。
三、PE 到底做了什么?
PE 的核心能力是将简短描述扩展为包含 5 大要素的结构化 prompt:
| 要素 | PE 会添加 | 示例 |
|---|---|---|
| 主体细节 | 材质、颜色、形态 | "matte ceramic texture", "weathered oak surface" |
| 环境/场景 | 背景、氛围 | "morning kitchen setting", "soft diffused daylight" |
| 光照描述 | 光源方向、光质 | "soft window light from the left", "volumetric fog" |
| 构图指令 | 镜头、景深、透视 | "shallow depth of field", "centered composition" |
| 风格定义 | 摄影类型、艺术风格 | "commercial product photography", "cinematic lighting" |
实际效果对比
原始输入(3 个词):
a ceramic coffee mug
PE 扩展后(类似输出):
Close-up product photograph of a matte ceramic coffee mug on a weathered oak table in a morning kitchen setting, soft window light from the left casting warm tones, shallow depth of field, commercial product photography style, 8K detail, centered composition
原始 prompt 只有 3 个词,PE 将其扩展为包含产品摄影、光照方向、景深、风格等完整描述。扩散模型接收到的是专业级别的 prompt,而不是一个关键词——生成质量自然更高。
ComfyUI 中的 PE 参数设置
在 ComfyUI 工作流中,PE 节点使用 CLIPLoader 加载(虽然实际是 LLM,ComfyUI 复用了 CLIPLoader 接口)。关键参数:
| 参数 | 推荐值 | 说明 |
|---|---|---|
max_length |
1536–2048 | 输出 prompt 最大长度 |
temperature |
0.6 | 采样温度,控制随机性 |
top_p |
0.8 | 核采样阈值 |
thinking mode |
Disabled | 关闭推理模式 |
四、PE 对基准测试的真实贡献
HuggingFace 官方模型卡提供了 GenEval 基准的有/无 PE 对比数据:
| 配置 | GenEval 得分 |
|---|---|
| ERNIE-Image (w/ PE) | 0.8625 |
| ERNIE-Image (w/o PE) | ~0.73 |
| ERNIE-Image-Turbo (w/ PE) | 0.8510 |
PE 对 GenEval 基准贡献了约 13% 的分数提升。对短 prompt 场景尤为显著——输入越短,PE 的增益越大。
但这里有一个关键矛盾:文字渲染场景反而建议关闭 PE。
LongTextBench 基准显示 ERNIE-Image (w/ PE) 得分 0.9788,看起来很完美。但实际使用中,如果 prompt 里包含需要精确渲染的文字,PE 可能改写这些文字内容,导致图片上出现的不是你想要的文字。
这就是为什么 ERNIE-Image 在文字渲染上强(LongTextBench 得分高),但 PE 反而可能破坏文字精确性的原因——PE 改写的是 prompt 文本,而扩散模型忠实执行改写后的文本。
五、PE 最大的坑:它会把你的 prompt 翻译成中文
这是 Reddit 社区用户实测发现的一个关键行为(r/StableDiffusion, 2026-04):
"The default workflow from the Comfy templates has a 'Prompt Enhancer' section that among other things, translates your prompt to Chinese."
PE 在扩展过程中倾向于将 prompt 转为中文处理。这意味着:
- 英文 prompt 可能被翻译成中文,扩散模型接收到的实际上是中文指令
- 如果 prompt 里包含需要精确渲染的英文文字(如标题 "SUMMER BEATS 2026"),PE 可能将其改写为中文,图片上出现的就是中文字符
Scenario.com 的官方文档也明确建议:中文文字渲染场景,关闭 Prompt Enhancer。
六、开关速查表
| 场景 | PE 建议 | 原因 |
|---|---|---|
| 一句话简单描述 | ✅ 开启 | PE 自动补充光照、构图、风格等细节 |
| 不懂 prompt 工程 | ✅ 开启 | 内置 prompt 助手,降低使用门槛 |
| Turbo 模式快速出图 | ✅ 开启 | PE + 8 步 = 最快工作流 |
| 需要精确渲染英文文字 | ❌ 关闭 | PE 可能翻译为中文 |
| 需要精确渲染中文文字 | ❌ 关闭 | PE 可能改写文字内容 |
| 已有详细结构化 prompt | ❌ 关闭 | 避免冲突和冗余扩展 |
| 固定 seed 迭代优化 | ❌ 关闭 | 隔离变量,判断改动效果 |
| GGUF 量化工作流 | ❌ 不可用 | Unsloth 未提供 PE 的 GGUF 版本 |
七、PE 的替代方案——更强的 LLM
官方明确建议:使用更强的 LLM(如 GPT-4、Claude)作为 Prompt Enhancer 可进一步提升效果。
内置 PE 的优势是免费、离线、速度快。劣势是 3B 模型的理解深度有限,扩展结果偏向模板化。如果你追求极致质量,工作流可以调整为:
- 用 GPT-4/Claude 将短 prompt 扩展为专业级详细描述
- 在 ERNIE-Image 中关闭 PE
- 粘贴扩展后的 prompt 生成
这样 PE 的改写行为被完全绕过,扩散模型执行的是你(或更强 LLM)精心构建的指令。
八、总结
PE 是 ERNIE-Image 最容易被误解的模块之一。它本质上是一个 3B 语言模型,任务是把用户的简短描述扩展为结构化 prompt。
- 短 prompt → PE 帮你补充细节,质量提升明显
- 精确文字 → PE 会改写文字内容,必须关闭
- 已有详细 prompt → PE 画蛇添足,建议关闭
- 追求极致 → 用 GPT-4/Claude 替代内置 PE
理解 PE 的工作原理和边界,比盲目开关更重要。