ERNIE-Image 训练数据管线深度解析:Qwen3 VLM 标注、瑞士轮美学评估与 MT-DMD 蒸馏

Jun 9, 2026

ERNIE-Image 训练数据管线深度解析:Qwen3 VLM 标注、瑞士轮美学评估与 MT-DMD 蒸馏

摘要:ERNIE-Image 技术报告揭示了其完整的训练数据管线:从大规模原始语料到 Qwen3 VLM 自动化标注,从瑞士轮美学评估到 Flow Matching DPO,再到多教师蒸馏(MT-DMD)。本文深度拆解每一环节的技术细节,解释这些设计如何让 8B 参数模型在开源文生图领域达到 SOTA 水平。


1. 引言:数据管线是文生图模型的分水岭

2026 年 4 月,百度发布 ERNIE-Image 技术报告(arXiv: 2605.25347),首次公开了完整的训练数据管线和训练策略。与许多仅公开最终模型的团队不同,ERNIE-Image 团队详细披露了从原始数据采集到最终对齐训练的每一个环节。

核心发现:ERNIE-Image 的成功并非来自单一技术突破,而是一套精心设计的管线——Qwen3 VLM 自动化标注 + 瑞士轮美学评分 + 课程训练 + DPO 对齐 + MT-DMD 蒸馏——共同作用的结果。


2. 预训练管线:Bottom-Up 策略

2.1 原始数据收集与分类

ERNIE-Image 的预训练数据始于一个大规模原始语料库,经过以下处理步骤:

  1. 细粒度视觉分类:将原始数据分为 10,000 个视觉类别
  2. VLM Captioning:使用 Qwen3 VLM 提取结构性描述和图中文字
  3. 美学评分:通过 ERNIE-Image-Aes 模型对每张图打分

2.2 Qwen3 VLM:自动化标注引擎

关键技术选择:ERNIE-Image 使用 Qwen3 VLM 作为 caption 模型,而非传统 CLIP 或 BLIP。

为什么选择 Qwen3 VLM?

特性 CLIP/BLIP Qwen3 VLM
文字识别 ❌ 弱 ✅ 强(OCR 能力)
结构化描述 基础 详细(位置/关系/属性)
长文本生成 ❌ 有限 ✅ 支持复杂描述
多语言 英语为主 中英双语

标注流程:

原始图片 → Qwen3 VLM → 结构化 caption
                              ↓
                    "一个穿着蓝色西装的亚洲男性,站在现代办公室中,
                     背景有落地窗和城市天际线,自然光从左前方照射,
                     面部表情微笑,45度侧脸角度"

关键点:ERNIE-Image 在文字渲染上的 SOTA 表现(LongTextBench 0.964),很大程度上归功于 Qwen3 VLM 对图中文字的精准标注。


3. 美学评分系统:瑞士轮标注法

3.1 传统方法的局限性

传统美学评估使用两种方法:

方法 问题
Likert 评分(1-5 分) 标注者标准不一,分数漂移
ELO 配对比较 比较开销大,标注成本高

3.2 瑞士轮标注法(Swiss-Tournament)

ERNIE-Image 引入瑞士轮锦标赛制,灵感来自国际象棋锦标赛:

第 1 轮:图片 A vs B, C vs D, E vs F...
第 2 轮:胜者 vs 胜者,败者 vs 败者
第 3 轮:继续按"胜场数"分组比较
...
最终:每张图片获得一个基于相对排名的美学分数

优势:

  • ✅ 避免 Likert 的分数漂移
  • ✅ 比 ELO 减少 50%+ 比较次数
  • ✅ 标注者通过美学校准测试,确保质量

3.3 ERNIE-Image-Aes 模型性能

ERNIE-Image 训练了自己的美学评估模型 ERNIE-Image-Aes,在 ERIA-1K 基准上大幅领先:

模型 SRCC PLCC
LAION AES 0.2944 0.3138
ArtiMuse 0.4277 0.4704
UniPercept 0.4533 0.4748
ERNIE-Image-Aes 0.7445 0.7598

偏差修正:ERNIE-Image-Aes 修正了现有模型的已知偏差——LAION-Aes 过度评分 AI/动漫/休闲照片,ArtiMuse/UniPercept 过度评分黑白/休闲照片。

3.4 ERIA-1K 基准

类别 占比
摄影 49.28%
插画/动漫 23.16%
平面设计/海报 11.14%
混合网页 10.44%
胶片摄影 5.42%
产品/收藏品 0.56%

4. 分层采样与课程训练

4.1 分层采样策略

层级 采样依据 目的
类间 语料库大小 + 综合美学质量 确保各类别充分覆盖
类内 单张图美学分数 优先选择高质量数据

4.2 三阶段课程训练

ERNIE-Image 采用分辨率递增的课程训练:

阶段 1: 256×256 → 学习基础特征和构图
         ↓
阶段 2: 512×512 → 细化纹理和细节
         ↓
阶段 3: 1024×1024 → 最终高分辨率输出

关键设计:每个阶段使用多样纵横比(不只是正方形),提高布局灵活性。


5. 后训练管线:Top-Down 策略

5.1 监督微调(SFT)

目标:聚焦高需求领域(海报、游戏截图、人像、动漫等)

创新:K2.5 VLM 重写 Caption

SFT 阶段使用 K2.5 VLM 将原始 caption 重写为多种用户风格的 prompt:

风格类型 示例
关键词 "女性, 蓝色, 微笑, 工作室灯光"
自然语言 "一个微笑的女性肖像,工作室灯光"
指令式 "生成一张女性肖像,使用工作室灯光"
组合式 "4K, 女性肖像, 蓝色调, 工作室灯光, 浅景深"

目的:模拟真实世界多样化的 prompt 输入模式,提高模型对不同 prompt 风格的鲁棒性。

5.2 DPO 对齐:Flow Matching + Anchor Losses

Flow Matching DPO:ERNIE-Image 将 Direct Preference Optimization (DPO) 与 Flow Matching 结合,用于美学对齐。

关键创新:Anchor Losses

传统 DPO 面临 reward hacking 问题——模型学会"作弊"获得高分,而非真正提高美学质量。ERNIE-Image 引入 Anchor Losses:

总损失 = DPO 偏好损失 + λ × Anchor 锚点损失

Anchor Losses 约束模型在偏好优化的同时,保持与高质量参考数据的距离,防止过度偏离。

5.3 多教师蒸馏(MT-DMD)

背景:传统 DMD/DMDR 使用单教师蒸馏,可能导致能力漂移(某些能力变强,其他变弱)。

MT-DMD 设计:

教师模型 专长 路由策略
文字渲染专家 精确文字生成 文字相关 prompt
数字艺术专家 艺术风格 风格相关 prompt
空间布局专家 多对象布局 复杂构图 prompt

动态路由:根据噪声水平和优化目标,在不同教师之间动态分配权重。

高噪声阶段 → 更多使用布局教师(学习宏观结构)
低噪声阶段 → 更多使用文字教师(学习精细细节)

6. 完整管线总结

原始数据
  ↓
[10,000 视觉分类]
  ↓
[Qwen3 VLM Caption] → 结构化描述 + 文字标注
  ↓
[ERNIE-Image-Aes 评分] → 瑞士轮标注
  ↓
[分层采样] → 类间 + 类内加权
  ↓
[课程训练] → 256→512→1024
  ↓
预训练完成 (ERNIE-Image Base)
  ↓
[SFT] → K2.5 VLM 重写 caption
  ↓
[DPO + Anchor Losses] → 美学对齐
  ↓
[MT-DMD] → 多教师蒸馏
  ↓
ERNIE-Image-Turbo (8 steps)

7. 管线设计的实际影响

7.1 与闭源模型的差距缩小

模型 总HP 空间 知识 美学
Nano Banana 2.0 (闭源) 5.39 95.54 99.40 91.37
ERNIE-Image (开源 8B) 5.07 89.88 95.24 83.04
Seedream 5.0 (闭源) 5.03 90.48 97.02 80.65

关键结论:ERNIE-Image 以 8B 参数实现了与闭源旗舰模型接近的性能,差距仅 ~0.32 HP。

7.2 文字渲染 SOTA

基准 ERNIE-Image (w/o PE) ERNIE-Image (w/ PE)
LongTextBench (EN) 0.968 0.980
LongTextBench (ZH) 0.959 0.966

中文和英文文字渲染均达到 96%+ 准确率,远超其他开源模型。


8. 对社区的启示

8.1 数据质量 > 数据数量

ERNIE-Image 的成功证明:精心筛选和标注的数据比海量原始数据更重要。

8.2 VLM 标注是未来

使用 Qwen3 VLM 进行自动化标注,既保证了质量又控制了成本。这对社区用户同样适用——可以用开源 VLM 为自己的数据集生成高质量 caption。

8.3 美学评估需要去偏差

ERNIE-Image-Aes 的偏差修正提醒我们:通用的美学模型可能存在系统性偏差,领域特定的微调很重要。

8.4 多教师蒸馏优于单教师

MT-DMD 的设计思路——不同专家处理不同能力——可能成为未来蒸馏训练的标准范式。


9. 总结

ERNIE-Image 的训练管线是一套系统工程:从数据采集到标注、从美学评估到对齐训练、从课程学习到多教师蒸馏,每个环节都经过精心设计。

核心公式:

高质量数据 × VLM标注 × 美学筛选 × 课程训练 × DPO对齐 × 多教师蒸馏 = 8B SOTA

对于想要复现或改进这一管线的研究者,技术报告提供了足够的细节作为起点。对于普通用户,理解这一管线有助于更好地使用 ERNIE-Image——理解模型擅长什么,就能写出更好的 prompt。

延伸阅读:ERNIE-Image 技术报告、ERNIE-Image-Aes 美学评估、DPO 对齐训练


本文基于 ERNIE-Image 技术报告(arXiv: 2605.25347v1)撰写,所有数据来自官方公开资料。

ERNIE-Image Team