ERNIE-Image vs Boogu-Image-0.1:8B 精悍 vs 10B 全能,2026 年 6 月开源文生图新对决
摘要: 百度 ERNIE-Image(8B DiT)自 2026 年 4 月开源以来稳居开源文生图第一梯队。2026 年 6 月下旬,Boogu 团队发布了 Boogu-Image-0.1 —— 一个 10B 参数的统一图像生成与编辑模型家族。本文将从架构、性能、编辑能力、部署成本和实际使用体验五个维度进行深度横评,帮助开发者做出正确的技术选择。
2026 年开源文生图格局的新变量
开源图像生成领域正在经历一场快速迭代。从 FLUX.2 到 ERNIE-Image,再到 HunyuanImage 3.0,每一次新模型发布都在重新定义"开源可部署"的上限。
2026 年 6 月,一个新的竞争者进入了视野 —— Boogu-Image-0.1。
Boogu 团队在 HuggingFace 上一次性发布了三个变体:Base(高质量文生图)、Turbo(4 步极速生成)和 Edit(图像编辑)。其中 Edit 变体尤其引人注目 —— 在当前的开源生态中,真正可用的图像编辑模型寥寥无几,ERNIE-Image 的官方编辑模型至今仍在"即将发布"的状态。
本文将 ERNIE-Image(8B)与 Boogu-Image-0.1(10B)放在一起,做一次全面的对比。
一、架构与参数对比
ERNIE-Image:8B DiT + 3B PE
ERNIE-Image 采用单流 Diffusion Transformer 架构,核心扩散模型 8B 参数,搭配一个 3B 参数的 Prompt Enhancer(PE)。PE 的作用是将用户的简短提示词改写为更丰富的结构化描述,再由扩散模型生成图像。
官方提供两个变体:
- ERNIE-Image(SFT 版): ~50 步推理,强调指令忠实度和通用能力
- ERNIE-Image-Turbo: 通过 DMD 和 RL 优化,仅需 ~8 步即可达到较高美学质量
关键设计:ERNIE-Image 使用 FLUX.2 VAE 作为变分自编码器,这意味着它与 FLUX 系列共享潜空间,LoRA 兼容性相对较好。
Boogu-Image-0.1:10B 统一架构
Boogu-Image-0.1 采用统一的架构设计,Base/Turbo/Edit 三个变体共享相同的 10B 参数基底,通过不同的训练策略分化能力:
- Base: 联合训练,25~50 步,专注于文生图质量
- Turbo: 解耦 DMD 蒸馏,仅需 4 步推理
- Edit: 联合训练,25~50 步,支持图像到图像的编辑任务(TI2I)
关键设计:Boogu 的 Edit 变体原生支持图像编辑 —— 包括物体增删、属性修改、背景替换和风格迁移。这是当前 ERNIE-Image 生态中尚未覆盖的能力。
参数规模差异
| 维度 | ERNIE-Image | Boogu-Image-0.1 |
|---|---|---|
| 扩散模型参数 | 8B DiT | 10B |
| 辅助模型 | 3B PE(可选) | 无 |
| 总参数 | ~11B(含 PE) | 10B |
| 推理步数 | 8~50 | 4~50 |
| 最低步数 | 8(Turbo) | 4(Turbo) |
| 图像编辑 | ❌ 无官方 Edit | ✅ Edit 变体 |
| 许可证 | Apache-2.0 | Apache-2.0 |
二、性能基准对比
GENEval 指令跟随
ERNIE-Image 在 GENEval 基准上表现突出:
| 模型 | 单对象 | 双对象 | 计数 | 颜色 | 位置 | 属性绑定 | 综合 |
|---|---|---|---|---|---|---|---|
| ERNIE-Image (w/o PE) | 1.0000 | 0.9596 | 0.7781 | 0.9282 | 0.8550 | 0.7925 | 0.8856 |
| ERNIE-Image (w/ PE) | 0.9906 | 0.9596 | 0.8187 | 0.8830 | 0.8625 | 0.7225 | 0.8728 |
| ERNIE-Image-Turbo | 1.0000 | 0.9621 | 0.7906 | 0.9202 | 0.7975 | 0.7300 | 0.8667 |
Boogu-Image-0.1 目前尚未在 GENEval 上发布官方数据,但官方在 Qwen-Image-Bench 上取得了 53.58 分,并称"超越了 2-8 倍大小的模型"。
文字渲染
ERNIE-Image 的核心差异化能力之一是精准的文字渲染。在 LongTextBench 上:
- ERNIE-Image (w/ PE): 0.9733 平均分(英文 0.9804,中文 0.9661)
Boogu-Image-0.1 同样宣称支持中英双语文字渲染,并在其 Edit 变体中提供了细粒度的图像文字编辑能力(添加/删除/替换字符、调整字体/粗细/颜色/布局)。但从官方文档来看,Boogu 尚未发布 LongTextBench 上的对比数据。
小结: 在文字渲染方面,ERNIE-Image 拥有经过充分验证的基准数据,Boogu 的官方数据尚不完整。但在图像编辑场景中的文字修改能力上,Boogu Edit 变体走在了前面。
三、编辑能力:Boogu 的核心优势
这是本次对比中最关键的差异点。
Boogu-Image-0.1-Edit
Boogu 的 Edit 变体原生支持 Text-Instruction-to-Image (TI2I) 编辑任务:
- 物体增删: 在图像中添加或删除指定对象
- 属性修改: 改变物体的颜色、材质、风格
- 背景替换: 保持主体不变,更换背景场景
- 风格迁移: 将图像转换为不同艺术风格
官方特别强调 Edit 模型在纹理保留方面的优势 —— 在处理混凝土、涂鸦、皮肤等复杂纹理时,Boogu-Edit 比竞品(如 Qwen-Image-Edit)保留了更多细节。
硬件要求: Edit 变体需要 2550 步推理,CFG 建议 2.05.0。12GB VRAM 下需要 CPU Offload,24GB VRAM 下可直接运行。
ERNIE-Image 的编辑现状
ERNIE-Image 目前没有官方发布的编辑模型。社区通过以下方案实现编辑功能:
- ComfyUI 中的通用 Inpainting 工作流(使用掩码)
- FLUX Kontext 混合管线(EI-102 已详细讨论)
- Bernini-R + FLUX Kontext 混合方案
这些方案效果参差不齐,且需要额外的模型权重和复杂的管线配置。
结论: 如果你的核心需求是图像编辑,Boogu-Image-0.1-Edit 目前是开源生态中最直接的选择。ERNIE-Image 编辑模型"即将发布"的消息社区已等待数月。
四、部署成本与硬件需求
显存需求对比
| 模型 | BF16 显存 | FP8 显存 | 12GB 可运行 | 24GB 可运行 |
|---|---|---|---|---|
| ERNIE-Image (8B) | ~16GB | ~8-9GB | ✅ (FP8+Offload) | ✅ 轻松 |
| ERNIE-Image-Turbo | ~16GB | ~8-9GB | ✅ (FP8+Offload) | ✅ 轻松 |
| Boogu Base (10B) | ~20GB | ~10-12GB | ⚠️ (FP8+CPU Offload) | ✅ |
| Boogu Turbo (10B) | ~20GB | ~10-12GB | ⚠️ (FP8+CPU Offload) | ✅ |
| Boogu Edit (10B) | ~20GB | ~10-12GB | ⚠️ (FP8+CPU Offload) | ✅ |
关键点: Boogu 的 10B 参数比 ERNIE-Image 的 8B 多约 25%,在 BF16 下需要多约 4GB 显存。对于 24GB 显卡(RTX 3090/4090),两者都能运行。但对于 12-16GB 显卡,Boogu 需要更激进的优化策略。
推理速度
| 模型 | 步数 | 单张 1024² 耗时 (RTX 4090 估算) |
|---|---|---|
| ERNIE-Image-Turbo | 8 | ~15-20 秒 |
| Boogu Turbo | 4 | ~8-12 秒 |
| ERNIE-Image (SFT) | 50 | ~60-80 秒 |
| Boogu Base | 25~50 | ~30-80 秒 |
Boogu Turbo 的 4 步设计使其在极速场景下有明显优势,但需要注意:更少的步数通常意味着细节表现力有所下降。
API 部署选项
| 平台 | ERNIE-Image | Boogu-Image-0.1 |
|---|---|---|
| FAL.AI | ✅ 支持 | ❌ 暂未上线 |
| Atlas Cloud | ✅ 支持 | ❌ 暂未上线 |
| WaveSpeed AI | ✅ 支持 | ❌ 暂未上线 |
| Civitai Orchestration | ✅ 支持 | ❌ 暂未上线 |
| 本地部署 | ✅ Diffusers | ✅ Diffusers |
| ComfyUI | ✅ 官方节点 | ✅ Comfy-Org 节点 |
关键差异: ERNIE-Image 已经接入多个云 API 平台,开发者可以零本地 GPU 部署。Boogu 目前仅支持本地部署(官方明确表示不提供付费 API)。
五、社区生态对比
ERNIE-Image 社区
截至 2026 年 6 月:
- HuggingFace: 2.67K+ 关注,多个变体模型
- Civitai: 数十个社区 LoRA 和工作流
- Reddit: r/StableDiffusion 和 r/ComfyUI 高频讨论
- YouTube: 多个 ComfyUI 教程、对比评测视频
- 量化版本: 社区维护的 NVFP4/FP8/INT8 版本
Boogu-Image-0.1 社区
截至 2026 年 6 月:
- HuggingFace: 新发布,关注数增长中
- Reddit: r/LocalLLaMA 和 r/StableDiffusion 开始讨论
- YouTube: Benji's AI Playground 教程(5593 views)
- ComfyUI: Comfy-Org 已提供官方模型文件
- 量化版本: 官方提供 fp8 变体
结论: ERNIE-Image 的社区生态目前明显领先。Boogu 作为新模型,社区正在快速建立中。
六、实际使用场景推荐
选择 ERNIE-Image 的场景
- 精准文字渲染需求: 海报、漫画、信息图表、多语言排版
- 商用部署: 需要 API 集成(FAL/Atlas/WaveSpeed/Civitai)
- 社区资源依赖: 需要成熟的 LoRA 生态和工作流模板
- 指令跟随要求高: 复杂的多约束提示词
- 显存有限: 8B 模型对 12-16GB 显卡更友好
选择 Boogu-Image-0.1 的场景
- 图像编辑需求: 需要原生 Edit 变体进行物体增删、风格迁移
- 极速生成: Turbo 变体 4 步推理,适合快速迭代
- 统一模型偏好: Base/Turbo/Edit 共享架构,无需切换模型
- 纹理保留: Edit 模型在复杂纹理处理上表现突出
- 完全本地部署: 不需要云 API,追求数据隐私
两者都不够好的场景
- 超高清输出(4K+): 两者都需要额外的放大工作流
- 角色一致性: 两者都需要额外的 LoRA 或 IP-Adapter
- 视频生成: 两者都专注于图像,需要搭配视频模型(如 Wan 2.6)
七、总结
| 维度 | ERNIE-Image (8B) | Boogu-Image-0.1 (10B) | 胜出 |
|---|---|---|---|
| 文字渲染 | ✅ 0.9733 LongTextBench | ⚠️ 未发布完整数据 | ERNIE-Image |
| 图像编辑 | ❌ 无官方 Edit | ✅ Edit 变体 | Boogu |
| 极速生成 | 8 步(Turbo) | 4 步(Turbo) | Boogu |
| 社区生态 | ✅ 成熟 | 🌱 增长中 | ERNIE-Image |
| API 部署 | ✅ 多平台 | ❌ 仅本地 | ERNIE-Image |
| 显存友好 | 8B | 10B | ERNIE-Image |
| 许可证 | Apache-2.0 | Apache-2.0 | 平手 |
| 纹理保留 | 标准 | ✅ Edit 变体突出 | Boogu |
最终建议: 如果你需要一个开箱即用的文生图模型且重视文字渲染和社区生态,ERNIE-Image 仍然是 2026 年中期的最佳选择。如果你需要图像编辑能力或追求极速生成,Boogu-Image-0.1 值得尝试。两者 Apache-2.0 的许可证意味着你可以自由组合 —— 用 ERNIE-Image 生成底图,用 Boogu-Edit 进行后期编辑,这在 ComfyUI 中完全可以实现。
更新提醒: ERNIE-Image 的官方编辑模型仍在开发中,一旦发布将直接改变这一对比格局。建议持续关注百度官方动态。
本文数据来自 HuggingFace 官方模型卡、GitHub 仓库和 arXiv 技术报告。Boogu-Image-0.1 官方明确表示不提供付费 API 或商业服务,任何以"Boogu-Image"名义提供的付费产品均为非官方。