ERNIE-Image vs Boogu-Image-0.1:8B 精悍 vs 10B 全能,2026 年 6 月开源文生图新对决

Jun 27, 2026

ERNIE-Image vs Boogu-Image-0.1:8B 精悍 vs 10B 全能,2026 年 6 月开源文生图新对决

摘要: 百度 ERNIE-Image(8B DiT)自 2026 年 4 月开源以来稳居开源文生图第一梯队。2026 年 6 月下旬,Boogu 团队发布了 Boogu-Image-0.1 —— 一个 10B 参数的统一图像生成与编辑模型家族。本文将从架构、性能、编辑能力、部署成本和实际使用体验五个维度进行深度横评,帮助开发者做出正确的技术选择。


2026 年开源文生图格局的新变量

开源图像生成领域正在经历一场快速迭代。从 FLUX.2 到 ERNIE-Image,再到 HunyuanImage 3.0,每一次新模型发布都在重新定义"开源可部署"的上限。

2026 年 6 月,一个新的竞争者进入了视野 —— Boogu-Image-0.1。

Boogu 团队在 HuggingFace 上一次性发布了三个变体:Base(高质量文生图)、Turbo(4 步极速生成)和 Edit(图像编辑)。其中 Edit 变体尤其引人注目 —— 在当前的开源生态中,真正可用的图像编辑模型寥寥无几,ERNIE-Image 的官方编辑模型至今仍在"即将发布"的状态。

本文将 ERNIE-Image(8B)与 Boogu-Image-0.1(10B)放在一起,做一次全面的对比。


一、架构与参数对比

ERNIE-Image:8B DiT + 3B PE

ERNIE-Image 采用单流 Diffusion Transformer 架构,核心扩散模型 8B 参数,搭配一个 3B 参数的 Prompt Enhancer(PE)。PE 的作用是将用户的简短提示词改写为更丰富的结构化描述,再由扩散模型生成图像。

官方提供两个变体:

  • ERNIE-Image(SFT 版): ~50 步推理,强调指令忠实度和通用能力
  • ERNIE-Image-Turbo: 通过 DMD 和 RL 优化,仅需 ~8 步即可达到较高美学质量

关键设计:ERNIE-Image 使用 FLUX.2 VAE 作为变分自编码器,这意味着它与 FLUX 系列共享潜空间,LoRA 兼容性相对较好。

Boogu-Image-0.1:10B 统一架构

Boogu-Image-0.1 采用统一的架构设计,Base/Turbo/Edit 三个变体共享相同的 10B 参数基底,通过不同的训练策略分化能力:

  • Base: 联合训练,25~50 步,专注于文生图质量
  • Turbo: 解耦 DMD 蒸馏,仅需 4 步推理
  • Edit: 联合训练,25~50 步,支持图像到图像的编辑任务(TI2I)

关键设计:Boogu 的 Edit 变体原生支持图像编辑 —— 包括物体增删、属性修改、背景替换和风格迁移。这是当前 ERNIE-Image 生态中尚未覆盖的能力。

参数规模差异

维度 ERNIE-Image Boogu-Image-0.1
扩散模型参数 8B DiT 10B
辅助模型 3B PE(可选) 无
总参数 ~11B(含 PE) 10B
推理步数 8~50 4~50
最低步数 8(Turbo) 4(Turbo)
图像编辑 ❌ 无官方 Edit ✅ Edit 变体
许可证 Apache-2.0 Apache-2.0

二、性能基准对比

GENEval 指令跟随

ERNIE-Image 在 GENEval 基准上表现突出:

模型 单对象 双对象 计数 颜色 位置 属性绑定 综合
ERNIE-Image (w/o PE) 1.0000 0.9596 0.7781 0.9282 0.8550 0.7925 0.8856
ERNIE-Image (w/ PE) 0.9906 0.9596 0.8187 0.8830 0.8625 0.7225 0.8728
ERNIE-Image-Turbo 1.0000 0.9621 0.7906 0.9202 0.7975 0.7300 0.8667

Boogu-Image-0.1 目前尚未在 GENEval 上发布官方数据,但官方在 Qwen-Image-Bench 上取得了 53.58 分,并称"超越了 2-8 倍大小的模型"。

文字渲染

ERNIE-Image 的核心差异化能力之一是精准的文字渲染。在 LongTextBench 上:

  • ERNIE-Image (w/ PE): 0.9733 平均分(英文 0.9804,中文 0.9661)

Boogu-Image-0.1 同样宣称支持中英双语文字渲染,并在其 Edit 变体中提供了细粒度的图像文字编辑能力(添加/删除/替换字符、调整字体/粗细/颜色/布局)。但从官方文档来看,Boogu 尚未发布 LongTextBench 上的对比数据。

小结: 在文字渲染方面,ERNIE-Image 拥有经过充分验证的基准数据,Boogu 的官方数据尚不完整。但在图像编辑场景中的文字修改能力上,Boogu Edit 变体走在了前面。


三、编辑能力:Boogu 的核心优势

这是本次对比中最关键的差异点。

Boogu-Image-0.1-Edit

Boogu 的 Edit 变体原生支持 Text-Instruction-to-Image (TI2I) 编辑任务:

  • 物体增删: 在图像中添加或删除指定对象
  • 属性修改: 改变物体的颜色、材质、风格
  • 背景替换: 保持主体不变,更换背景场景
  • 风格迁移: 将图像转换为不同艺术风格

官方特别强调 Edit 模型在纹理保留方面的优势 —— 在处理混凝土、涂鸦、皮肤等复杂纹理时,Boogu-Edit 比竞品(如 Qwen-Image-Edit)保留了更多细节。

硬件要求: Edit 变体需要 2550 步推理,CFG 建议 2.05.0。12GB VRAM 下需要 CPU Offload,24GB VRAM 下可直接运行。

ERNIE-Image 的编辑现状

ERNIE-Image 目前没有官方发布的编辑模型。社区通过以下方案实现编辑功能:

  • ComfyUI 中的通用 Inpainting 工作流(使用掩码)
  • FLUX Kontext 混合管线(EI-102 已详细讨论)
  • Bernini-R + FLUX Kontext 混合方案

这些方案效果参差不齐,且需要额外的模型权重和复杂的管线配置。

结论: 如果你的核心需求是图像编辑,Boogu-Image-0.1-Edit 目前是开源生态中最直接的选择。ERNIE-Image 编辑模型"即将发布"的消息社区已等待数月。


四、部署成本与硬件需求

显存需求对比

模型 BF16 显存 FP8 显存 12GB 可运行 24GB 可运行
ERNIE-Image (8B) ~16GB ~8-9GB ✅ (FP8+Offload) ✅ 轻松
ERNIE-Image-Turbo ~16GB ~8-9GB ✅ (FP8+Offload) ✅ 轻松
Boogu Base (10B) ~20GB ~10-12GB ⚠️ (FP8+CPU Offload) ✅
Boogu Turbo (10B) ~20GB ~10-12GB ⚠️ (FP8+CPU Offload) ✅
Boogu Edit (10B) ~20GB ~10-12GB ⚠️ (FP8+CPU Offload) ✅

关键点: Boogu 的 10B 参数比 ERNIE-Image 的 8B 多约 25%,在 BF16 下需要多约 4GB 显存。对于 24GB 显卡(RTX 3090/4090),两者都能运行。但对于 12-16GB 显卡,Boogu 需要更激进的优化策略。

推理速度

模型 步数 单张 1024² 耗时 (RTX 4090 估算)
ERNIE-Image-Turbo 8 ~15-20 秒
Boogu Turbo 4 ~8-12 秒
ERNIE-Image (SFT) 50 ~60-80 秒
Boogu Base 25~50 ~30-80 秒

Boogu Turbo 的 4 步设计使其在极速场景下有明显优势,但需要注意:更少的步数通常意味着细节表现力有所下降。

API 部署选项

平台 ERNIE-Image Boogu-Image-0.1
FAL.AI ✅ 支持 ❌ 暂未上线
Atlas Cloud ✅ 支持 ❌ 暂未上线
WaveSpeed AI ✅ 支持 ❌ 暂未上线
Civitai Orchestration ✅ 支持 ❌ 暂未上线
本地部署 ✅ Diffusers ✅ Diffusers
ComfyUI ✅ 官方节点 ✅ Comfy-Org 节点

关键差异: ERNIE-Image 已经接入多个云 API 平台,开发者可以零本地 GPU 部署。Boogu 目前仅支持本地部署(官方明确表示不提供付费 API)。


五、社区生态对比

ERNIE-Image 社区

截至 2026 年 6 月:

  • HuggingFace: 2.67K+ 关注,多个变体模型
  • Civitai: 数十个社区 LoRA 和工作流
  • Reddit: r/StableDiffusion 和 r/ComfyUI 高频讨论
  • YouTube: 多个 ComfyUI 教程、对比评测视频
  • 量化版本: 社区维护的 NVFP4/FP8/INT8 版本

Boogu-Image-0.1 社区

截至 2026 年 6 月:

  • HuggingFace: 新发布,关注数增长中
  • Reddit: r/LocalLLaMA 和 r/StableDiffusion 开始讨论
  • YouTube: Benji's AI Playground 教程(5593 views)
  • ComfyUI: Comfy-Org 已提供官方模型文件
  • 量化版本: 官方提供 fp8 变体

结论: ERNIE-Image 的社区生态目前明显领先。Boogu 作为新模型,社区正在快速建立中。


六、实际使用场景推荐

选择 ERNIE-Image 的场景

  1. 精准文字渲染需求: 海报、漫画、信息图表、多语言排版
  2. 商用部署: 需要 API 集成(FAL/Atlas/WaveSpeed/Civitai)
  3. 社区资源依赖: 需要成熟的 LoRA 生态和工作流模板
  4. 指令跟随要求高: 复杂的多约束提示词
  5. 显存有限: 8B 模型对 12-16GB 显卡更友好

选择 Boogu-Image-0.1 的场景

  1. 图像编辑需求: 需要原生 Edit 变体进行物体增删、风格迁移
  2. 极速生成: Turbo 变体 4 步推理,适合快速迭代
  3. 统一模型偏好: Base/Turbo/Edit 共享架构,无需切换模型
  4. 纹理保留: Edit 模型在复杂纹理处理上表现突出
  5. 完全本地部署: 不需要云 API,追求数据隐私

两者都不够好的场景

  • 超高清输出(4K+): 两者都需要额外的放大工作流
  • 角色一致性: 两者都需要额外的 LoRA 或 IP-Adapter
  • 视频生成: 两者都专注于图像,需要搭配视频模型(如 Wan 2.6)

七、总结

维度 ERNIE-Image (8B) Boogu-Image-0.1 (10B) 胜出
文字渲染 ✅ 0.9733 LongTextBench ⚠️ 未发布完整数据 ERNIE-Image
图像编辑 ❌ 无官方 Edit ✅ Edit 变体 Boogu
极速生成 8 步(Turbo) 4 步(Turbo) Boogu
社区生态 ✅ 成熟 🌱 增长中 ERNIE-Image
API 部署 ✅ 多平台 ❌ 仅本地 ERNIE-Image
显存友好 8B 10B ERNIE-Image
许可证 Apache-2.0 Apache-2.0 平手
纹理保留 标准 ✅ Edit 变体突出 Boogu

最终建议: 如果你需要一个开箱即用的文生图模型且重视文字渲染和社区生态,ERNIE-Image 仍然是 2026 年中期的最佳选择。如果你需要图像编辑能力或追求极速生成,Boogu-Image-0.1 值得尝试。两者 Apache-2.0 的许可证意味着你可以自由组合 —— 用 ERNIE-Image 生成底图,用 Boogu-Edit 进行后期编辑,这在 ComfyUI 中完全可以实现。

更新提醒: ERNIE-Image 的官方编辑模型仍在开发中,一旦发布将直接改变这一对比格局。建议持续关注百度官方动态。


本文数据来自 HuggingFace 官方模型卡、GitHub 仓库和 arXiv 技术报告。Boogu-Image-0.1 官方明确表示不提供付费 API 或商业服务,任何以"Boogu-Image"名义提供的付费产品均为非官方。

ERNIE-Image Team