ERNIE-Image 编辑模型最新进展:Bernini-R + FLUX Kontext 混合管线实战
ERNIE-Image 官方编辑模型持续延迟,ByteDance 的 Bernini-R 带来统一视频编辑框架。结合 FLUX Kontext,构建完整的开源图像+视频编辑管线。
2026 年 4 月,ERNIE-Image 8B 文生图模型开源发布,社区一片沸腾。但一个始终悬而未决的问题是:官方编辑模型什么时候出?
从 Reddit 的 "same indefinite delay as Z-Image Edit?" 讨论,到 EI-096 中记录的社区替代方案寻找,编辑模型的缺席一直是 ERNIE-Image 生态中最大的痛点。
2026 年 6 月,局面发生了变化。ByteDance 发布了 Bernini-R——一个基于 Wan 2.2 架构的统一视频编辑框架,ComfyUI 原生支持,Apache 2.0 开源。与此同时,FLUX Kontext 在图像编辑领域继续占据主导地位。
本文将展示如何将 Bernini-R、FLUX Kontext 与 ERNIE-Image 串联,构建完整的开源图像+视频编辑管线。
Bernini-R:ByteDance 的统一编辑框架
架构亮点
Bernini-R 的核心创新在于统一架构——一个模型处理多种编辑任务:
- 文本到视频生成(Text-to-Video)
- 视频编辑(Video Editing)
- 参考引导视频编辑(Reference-Guided Video Editing, RV2V)
- 多参考图到视频生成(Multi-Reference-to-Video)
技术规格
| 特性 | 规格 |
|---|---|
| 基础架构 | Wan 2.2 DiT(双专家 Transformer) |
| 高噪声去噪 Transformer | 粗粒度编辑 |
| 低噪声去噪 Transformer | 精细化编辑 |
| 语义规划器 | Qwen2.5-VL-7B-Instruct |
| 位置编码 | SA3D RoPE(段感知 3D 旋转位置嵌入) |
| 精度版本 | FP16(24GB+ VRAM)/ FP8(16GB+ VRAM) |
| 开源协议 | Apache 2.0 |
| ComfyUI 支持 | 官方原生节点 |
双 Transformer 架构的意义
Bernini-R 采用高低噪声双 Transformer 的设计灵感来自扩散模型的分阶段去噪理论:
- 高噪声 Transformer:负责大尺度的结构变化和主体替换(如角色服装替换、场景转换)
- 低噪声 Transformer:负责精细的细节优化和纹理修复
这种设计让 Bernini-R 能在同一个推理流程中完成从粗到细的完整编辑,而不需要像传统方案那样运行多个独立的模型。
FLUX Kontext:图像编辑的基准
核心能力
FLUX Kontext(12B 参数)仍然是开源图像编辑领域的标杆:
- 精准的局部重绘:基于掩码的 Inpainting 质量远超大多数替代方案
- 文本引导编辑:结合自然语言指令和视觉掩码的编辑方式
- Outpainting 扩展:保持风格一致性的画面扩展
- ComfyUI 官方支持:2026 年 6 月 ComfyUI 更新修复了内存管理问题
硬件需求
| 精度 | VRAM | 适用场景 |
|---|---|---|
| BF16 | 24GB+ | 最佳质量 |
| FP8 | 16GB+ | 平衡方案 |
| GGUF Q4 | 12GB+ | 低配方案 |
混合管线实战:ERNIE-Image + FLUX Kontext + Bernini-R
完整工作流架构
[ERNIE-Image 文生图] → 高质量静态图像
↓
[FLUX Kontext 图像编辑] → 精修图像(局部重绘、扩图、对象替换)
↓
[Bernini-R 视频编辑] → 动态视频(角色动画、场景转换、视频插值)
↓
[输出:编辑后的视频]
场景 1:电商产品展示视频
1. ERNIE-Image 生成产品在不同场景的静态图
2. FLUX Kontext 去除背景、添加品牌元素
3. Bernini-R 将精修图转化为展示视频
场景 2:角色动画创作
1. ERNIE-Image 生成角色设计图
2. FLUX Kontext 进行角色细节调整(服装、表情)
3. Bernini-R 通过参考引导生成角色动画
场景 3:场景转换与风格迁移
1. ERNIE-Image 生成原始场景
2. FLUX Kontext 局部重绘(季节变化、时间转换)
3. Bernini-R 生成平滑过渡视频
ComfyUI 配置指南
Bernini-R 节点安装
# 下载 Bernini-R 模型权重
# HF: https://huggingface.co/ByteDance/Bernini-R
# ComfyUI 版本: https://huggingface.co/Comfy-Org/Bernini-R
放置文件:
models/unet/bernini-r-high-noise.safetensors
models/unet/bernini-r-low-noise.safetensors
models/vae/bernini-vae.safetensors
FLUX Kontext 节点配置
# ComfyUI 已原生支持 FLUX Kontext
# 无需额外安装自定义节点
模型文件:
models/unet/flux-kontext-dev.safetensors
models/vae/flux-vae.safetensors
内存管理
在同一个 ComfyUI 工作流中串联多个模型时,内存管理至关重要:
{
"memory_management": {
"unload_models_after_use": true,
"clear_cache_between_nodes": true,
"max_vram": "24GB"
}
}
关键技巧:在 FLUX Kontext 和 Bernini-R 节点之间添加 Clear Cache 节点,释放前一个模型占用的显存。
性能对比:各编辑方案实测
| 方案 | 图像编辑 | 视频编辑 | VRAM 需求 | 易用性 | 开源 |
|---|---|---|---|---|---|
| FLUX Kontext | ⭐⭐⭐⭐⭐ | ❌ | 24GB+ | 高 | ✅ |
| Bernini-R | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | 16GB+ | 高 | ✅ |
| FLUX Kontext + Bernini-R | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | 24GB+ | 中 | ✅ |
| Midjourney Edit | ⭐⭐⭐⭐⭐ | ❌ | API | 高 | ❌ |
| Runway Gen-3 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | API | 高 | ❌ |
FLUX Kontext + Bernini-R 组合在编辑能力和开源可控性之间取得了最佳平衡。
与 EI-096 的进展对比
在 EI-096(2026-06-16 发布)中,我们记录了编辑模型延迟引发的社区焦虑,当时的替代方案选择有限:
- FLUX Kontext 是唯一成熟的开源图像编辑方案
- FLUX.2-Klein 9B 作为轻量级补充
- 社区对 ERNIE 官方编辑模型的期待逐渐转向失望
现在(2026-06-25),Bernini-R 的出现填补了视频编辑的空白:
- Bernini-R 发布:ByteDance 6 月开源,ComfyUI 原生支持
- 社区验证:YouTube 教程 8500+ 观看,Reddit 讨论热烈
- GGUF 量化版:社区发布的 GGUF 版本进一步降低门槛
- Lightx2v LoRAs:社区 LoRA 加速方案成熟
常见问题
Q:为什么需要两个模型(FLUX Kontext + Bernini-R)?
A:FLUX Kontext 在纯图像编辑(inpainting、outpainting)上质量更高,Bernini-R 在视频编辑上更强。两者互补而非替代。
Q:Bernini-R 可以做图像编辑吗?
A:可以,但质量不如专门的 FLUX Kontext。如果只需要图像编辑,单独使用 FLUX Kontext 即可。
Q:ERNIE-Image 编辑模型还会发布吗?
A:百度尚未给出明确时间表。社区已转向 Bernini-R + FLUX Kontext 混合方案作为实用替代。
Q:FP8 版本质量损失大吗?
A:根据社区实测,Bernini-R FP8 版本在视觉质量上与 FP16 差距很小(约 5% 细节损失),但显存需求降低约 50%。
总结
ERNIE-Image 生态的编辑能力拼图正在补全。FLUX Kontext 负责图像精修,Bernini-R 负责视频编辑,ERNIE-Image 作为高质量的静态图像起点——三者组合构成了完整的开源创作管线。
虽然 ERNIE-Image 官方编辑模型仍在等待中,但社区已经找到了可行的替代方案。对于内容创作者来说,现在的开源工具链已经足够强大:8B 文生图 → 12B 图像编辑 → 14B 视频编辑,全流程开源、可自部署、可微调。