ERNIE-Image 隐藏技能:Prompt Enhancer 开还是关?一篇讲清楚
如果你用过 ERNIE-Image,你一定遇到过这种情况:
- 有时候图片质量特别好,有时候特别差
- 你明明改了 prompt,结果图片完全不变
- 你指定了 "Hello World",图片上出现了中文
问题可能不在你的 prompt 上,而在一个你可能根本没注意过的开关——Prompt Enhancer(PE)。
这篇文章不聊架构、不聊原理,只回答一个实际问题:什么时候开 PE,什么时候关 PE。
一分钟了解 PE
PE 是 ERNIE-Image 内置的 prompt 改写模块。你输入一句话,PE 帮你改写成一段更专业、更详细的描述,然后再生成图片。
开 PE = 你写简单的话,AI 帮你补全
关 PE = 你写什么,模型就做什么
就这么简单。
开 PE 的场景(直接开,别犹豫)
✅ 场景 1:你只写了一句话
输入:一只猫在桌子上
效果:PE 自动补全光照、构图、风格等细节
结果:质量比你不写这些细节要好
原则:prompt 越短,PE 的增益越大。
✅ 场景 2:你不知道怎么写 prompt
不知道什么叫"伦勃朗光"、什么叫"浅景深"?不用知道。PE 会自动帮你加上这些专业词汇。
效果对比:
| 状态 | 你的输入 | 模型实际收到的 |
|---|---|---|
| 关 PE | 日落海边 |
日落海边 |
| 开 PE | 日落海边 |
金色夕阳下的海岸线,海浪轻拍礁石,暖橙色天空,长曝光摄影风格 |
✅ 场景 3:快速出图、头脑风暴
PE + ERNIE-Image Turbo(8步推理)= 最快工作流。
典型用法:
- 输入一句话
- 开 PE,点生成
- 不满意?换个词,再试
- 10 分钟出 20 张图
适合:灵感探索、概念验证、快速验证创意。
✅ 场景 4:中文输入、中文输出
PE 对中文输入比较友好,扩展后的描述通常也是中文。如果你生成的是普通图片(不含精确文字),中文用户开 PE 没问题。
关 PE 的场景(必须关,没有商量)
❌ 场景 1:需要精确渲染文字
这是最重要的关闭场景。
你的需求:海报上写着 "SUMMER SALE"
PE 的行为:可能把 "SUMMER SALE" 改成别的词,或翻译成中文
结果:图片上出现了不是你想要的文字
关 PE 是唯一可靠的方案。
❌ 场景 2:你已经写了详细的 prompt
如果你的 prompt 像这样:
Close-up product photograph of a matte white ceramic coffee mug on a dark slate surface, dramatic side lighting from the left creating long shadows, moody dark atmosphere, high-end commercial photography, 4K detail
你已经写了光照、材质、构图、风格。PE 再扩展就是画蛇添足,可能添加与你冲突的描述。
❌ 场景 3:固定 seed 迭代优化
你在用固定 seed 调整 prompt,每次改一个词:
迭代 1: a cat → (PE 扩展为 A)
迭代 2: a black cat → (PE 扩展为 B)
迭代 3: a black cat on sofa → (PE 扩展为 C)
你改了一个词,但 PE 的整个扩展都变了。你无法判断是哪个改动导致了结果变化。
关 PE = 隔离变量 = 精准迭代。
❌ 场景 4:你追求独特风格
PE 的扩展有模板化倾向——产品图总是"柔光+浅景深",风景图总是"金色时刻+薄雾"。
如果你想要非典型风格(极简、暗黑、抽象),PE 的模板化扩展可能与你想要的方向冲突。
快速决策表
| 你的情况 | PE 开关 | 一句话理由 |
|---|---|---|
| prompt 很短(≤15字) | ✅ 开 | PE 帮你补全细节 |
| 不知道怎么写 prompt | ✅ 开 | 内置 prompt 助手 |
| 快速出图 | ✅ 开 | 最快工作流 |
| 中文输入普通图 | ✅ 开 | PE 对中文友好 |
| 需要精确文字 | ❌ 关 | PE 会改写文字内容 |
| 已有详细 prompt | ❌ 关 | 画蛇添足 |
| 固定 seed 迭代 | ❌ 关 | 隔离变量 |
| 追求独特风格 | ❌ 关 | 避免模板化 |
| GGUF 低显存模式 | ❌ 不可用 | 无 GGUF 版本 |
ComfyUI / API 开关方法
ComfyUI
在 PE 节点的设置中:
enabled= true → 开enabled= false → 关
Diffusers API
pipe(prompt="xxx", use_pe=True) # 开
pipe(prompt="xxx", use_pe=False) # 关
Scenario.com 网页版
在生成页面找 "Prompt Enhancer" 复选框,勾选/取消。
进阶技巧
技巧 1:先用 PE 找方向,再关 PE 做精修
- 输入短 prompt,开 PE,生成预览
- 看到 PE 的扩展方向
- 手动修改扩展内容(或在此基础上调整)
- 关 PE,用修改后的 prompt 生成最终版
本质:PE 是你的灵感助手,不是最终决策者。
技巧 2:用更强 LLM 替代内置 PE
如果你经常需要 PE 但又不满意效果:
- 用 GPT-4/Claude 写专业级 prompt
- 在 ERNIE-Image 中关 PE
- 粘贴 prompt 生成
质量明显提升,代价是多了 API 费用。
技巧 3:用负向描述对抗模板化
如果你想要非典型风格:
a product photo, dark moody lighting, NO soft light, NO commercial photography, dramatic contrast, edgy
加入排除性描述,告诉 PE 你不想要什么。
常见误区
误区 1:"开 PE 质量一定更好"
错。PE 对短 prompt 有效,对长 prompt 反而有害。
误区 2:"关 PE 就是降级"
错。关 PE 是"精准控制",不是降级。专业用户经常关 PE。
误区 3:"PE 只是添加内容"
错。PE 是改写器,它会改变你 prompt 的完整内容。
误区 4:"PE 翻译中文是因为 bug"
不是 bug,是训练数据分布导致的正常行为。
总结:一句话规则
- 短 prompt → 开 PE
- 长 prompt → 关 PE
- 要文字 → 关 PE
- 要迭代 → 关 PE
- 不确定 → 先用 PE 看方向,再手动调整
PE 不是玄学,是一个工具。理解它的行为,就能掌握它的开关逻辑。