ERNIE-Image 编辑模型最新进展:Bernini-R + FLUX Kontext 混合管线实战

Jun 25, 2026

ERNIE-Image 编辑模型最新进展:Bernini-R + FLUX Kontext 混合管线实战

ERNIE-Image 官方编辑模型持续延迟,ByteDance 的 Bernini-R 带来统一视频编辑框架。结合 FLUX Kontext,构建完整的开源图像+视频编辑管线。

2026 年 4 月,ERNIE-Image 8B 文生图模型开源发布,社区一片沸腾。但一个始终悬而未决的问题是:官方编辑模型什么时候出?

从 Reddit 的 "same indefinite delay as Z-Image Edit?" 讨论,到 EI-096 中记录的社区替代方案寻找,编辑模型的缺席一直是 ERNIE-Image 生态中最大的痛点。

2026 年 6 月,局面发生了变化。ByteDance 发布了 Bernini-R——一个基于 Wan 2.2 架构的统一视频编辑框架,ComfyUI 原生支持,Apache 2.0 开源。与此同时,FLUX Kontext 在图像编辑领域继续占据主导地位。

本文将展示如何将 Bernini-R、FLUX Kontext 与 ERNIE-Image 串联,构建完整的开源图像+视频编辑管线。

Bernini-R:ByteDance 的统一编辑框架

架构亮点

Bernini-R 的核心创新在于统一架构——一个模型处理多种编辑任务:

  • 文本到视频生成(Text-to-Video)
  • 视频编辑(Video Editing)
  • 参考引导视频编辑(Reference-Guided Video Editing, RV2V)
  • 多参考图到视频生成(Multi-Reference-to-Video)

技术规格

特性 规格
基础架构 Wan 2.2 DiT(双专家 Transformer)
高噪声去噪 Transformer 粗粒度编辑
低噪声去噪 Transformer 精细化编辑
语义规划器 Qwen2.5-VL-7B-Instruct
位置编码 SA3D RoPE(段感知 3D 旋转位置嵌入)
精度版本 FP16(24GB+ VRAM)/ FP8(16GB+ VRAM)
开源协议 Apache 2.0
ComfyUI 支持 官方原生节点

双 Transformer 架构的意义

Bernini-R 采用高低噪声双 Transformer 的设计灵感来自扩散模型的分阶段去噪理论:

  • 高噪声 Transformer:负责大尺度的结构变化和主体替换(如角色服装替换、场景转换)
  • 低噪声 Transformer:负责精细的细节优化和纹理修复

这种设计让 Bernini-R 能在同一个推理流程中完成从粗到细的完整编辑,而不需要像传统方案那样运行多个独立的模型。

FLUX Kontext:图像编辑的基准

核心能力

FLUX Kontext(12B 参数)仍然是开源图像编辑领域的标杆:

  • 精准的局部重绘:基于掩码的 Inpainting 质量远超大多数替代方案
  • 文本引导编辑:结合自然语言指令和视觉掩码的编辑方式
  • Outpainting 扩展:保持风格一致性的画面扩展
  • ComfyUI 官方支持:2026 年 6 月 ComfyUI 更新修复了内存管理问题

硬件需求

精度 VRAM 适用场景
BF16 24GB+ 最佳质量
FP8 16GB+ 平衡方案
GGUF Q4 12GB+ 低配方案

混合管线实战:ERNIE-Image + FLUX Kontext + Bernini-R

完整工作流架构

[ERNIE-Image 文生图] → 高质量静态图像
     ↓
[FLUX Kontext 图像编辑] → 精修图像(局部重绘、扩图、对象替换)
     ↓
[Bernini-R 视频编辑] → 动态视频(角色动画、场景转换、视频插值)
     ↓
[输出:编辑后的视频]

场景 1:电商产品展示视频

1. ERNIE-Image 生成产品在不同场景的静态图
2. FLUX Kontext 去除背景、添加品牌元素
3. Bernini-R 将精修图转化为展示视频

场景 2:角色动画创作

1. ERNIE-Image 生成角色设计图
2. FLUX Kontext 进行角色细节调整(服装、表情)
3. Bernini-R 通过参考引导生成角色动画

场景 3:场景转换与风格迁移

1. ERNIE-Image 生成原始场景
2. FLUX Kontext 局部重绘(季节变化、时间转换)
3. Bernini-R 生成平滑过渡视频

ComfyUI 配置指南

Bernini-R 节点安装

# 下载 Bernini-R 模型权重
# HF: https://huggingface.co/ByteDance/Bernini-R
# ComfyUI 版本: https://huggingface.co/Comfy-Org/Bernini-R

放置文件:

models/unet/bernini-r-high-noise.safetensors

models/unet/bernini-r-low-noise.safetensors

models/vae/bernini-vae.safetensors

FLUX Kontext 节点配置

# ComfyUI 已原生支持 FLUX Kontext
# 无需额外安装自定义节点

模型文件:

models/unet/flux-kontext-dev.safetensors

models/vae/flux-vae.safetensors

内存管理

在同一个 ComfyUI 工作流中串联多个模型时,内存管理至关重要:

{
  "memory_management": {
    "unload_models_after_use": true,
    "clear_cache_between_nodes": true,
    "max_vram": "24GB"
  }
}

关键技巧:在 FLUX Kontext 和 Bernini-R 节点之间添加 Clear Cache 节点,释放前一个模型占用的显存。

性能对比:各编辑方案实测

方案 图像编辑 视频编辑 VRAM 需求 易用性 开源
FLUX Kontext ⭐⭐⭐⭐⭐ ❌ 24GB+ 高 ✅
Bernini-R ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ 16GB+ 高 ✅
FLUX Kontext + Bernini-R ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ 24GB+ 中 ✅
Midjourney Edit ⭐⭐⭐⭐⭐ ❌ API 高 ❌
Runway Gen-3 ⭐⭐⭐⭐ ⭐⭐⭐⭐ API 高 ❌

FLUX Kontext + Bernini-R 组合在编辑能力和开源可控性之间取得了最佳平衡。

与 EI-096 的进展对比

在 EI-096(2026-06-16 发布)中,我们记录了编辑模型延迟引发的社区焦虑,当时的替代方案选择有限:

  • FLUX Kontext 是唯一成熟的开源图像编辑方案
  • FLUX.2-Klein 9B 作为轻量级补充
  • 社区对 ERNIE 官方编辑模型的期待逐渐转向失望

现在(2026-06-25),Bernini-R 的出现填补了视频编辑的空白:

  • Bernini-R 发布:ByteDance 6 月开源,ComfyUI 原生支持
  • 社区验证:YouTube 教程 8500+ 观看,Reddit 讨论热烈
  • GGUF 量化版:社区发布的 GGUF 版本进一步降低门槛
  • Lightx2v LoRAs:社区 LoRA 加速方案成熟

常见问题

Q:为什么需要两个模型(FLUX Kontext + Bernini-R)?
A:FLUX Kontext 在纯图像编辑(inpainting、outpainting)上质量更高,Bernini-R 在视频编辑上更强。两者互补而非替代。

Q:Bernini-R 可以做图像编辑吗?
A:可以,但质量不如专门的 FLUX Kontext。如果只需要图像编辑,单独使用 FLUX Kontext 即可。

Q:ERNIE-Image 编辑模型还会发布吗?
A:百度尚未给出明确时间表。社区已转向 Bernini-R + FLUX Kontext 混合方案作为实用替代。

Q:FP8 版本质量损失大吗?
A:根据社区实测,Bernini-R FP8 版本在视觉质量上与 FP16 差距很小(约 5% 细节损失),但显存需求降低约 50%。

总结

ERNIE-Image 生态的编辑能力拼图正在补全。FLUX Kontext 负责图像精修,Bernini-R 负责视频编辑,ERNIE-Image 作为高质量的静态图像起点——三者组合构成了完整的开源创作管线。

虽然 ERNIE-Image 官方编辑模型仍在等待中,但社区已经找到了可行的替代方案。对于内容创作者来说,现在的开源工具链已经足够强大:8B 文生图 → 12B 图像编辑 → 14B 视频编辑,全流程开源、可自部署、可微调。

ERNIE-Image Team