2026 年中回顾:AI 图像生成生态格局巨变,ERNIE-Image 如何站稳脚跟?

Jul 5, 2026

2026 年中回顾:AI 图像生成生态格局巨变,ERNIE-Image 如何站稳脚跟?

摘要:2026 年上半年,AI 图像生成领域经历了剧烈洗牌。DALL-E 3 跌出排行榜前五,GPT Image 2 以 Elo 1340 登顶,开源模型阵营中 Cosmos3-Super 和 HiDream 强势崛起。在这篇文章中,我们全面回顾 ERNIE-Image 在 2026 年上半年的表现,分析其在 GenEval、LongTextBench 等权威基准中的位置,并展望未来半年的发展趋势。


从 2026 年 4 月 ERNIE-Image 正式开源以来,短短三个月内,AI 图像生成的格局发生了翻天覆地的变化。

如果你在过去半年里关注过 AI 图像生成的排行榜,你会发现一个明显趋势:开源模型正在快速逼近甚至超越闭源旗舰。ERNIE-Image 作为 8B 参数级别的代表,在这场竞争中扮演了关键角色。

一、2026 年 6 月排行榜大洗牌

2026 年 6 月,Artificial Analysis Image Arena 发布了一项引人注目的更新:DALL-E 3 跌出前五。这个曾经稳居排行榜前三的 OpenAI 模型,在大量匿名用户对弈投票中被新一代模型超越。

与此同时,排行榜前列出现了以下变化:

排名 模型 Elo 分数 类型
1 GPT Image 2 (high) 1340 闭源
2 MAI-Image-2.5 1274 闭源
3 Gemini 3.1 Flash Image — 闭源
4 Cosmos3-Super-Text2Image 1227 开源
5 HiDream-O1-Image-Dev-2604 1187 开源

值得注意的几点:

  • 开源模型首次进入前五(Cosmos3-Super 和 HiDream)
  • GPT Image 2 以 Elo 1340 遥遥领先,成为当前 AI 图像生成的天花板
  • DALL-E 3 的下滑标志着旧一代模型的退场

ERNIE-Image 虽然没有出现在 Artificial Analysis Arena 的 Top 5 中,但它在特定基准上的表现同样亮眼——甚至超越了榜单上的一些闭源模型。

二、ERNIE-Image 的核心数据:小而精悍

ERNIE-Image 最核心的竞争力在于以 8B 参数实现超越更大模型的特定能力。以下是它在关键基准上的表现:

GenEval:GenEval 满分

GenEval 是衡量 AI 图像生成模型指令遵循能力的权威基准。ERNIE-Image 在这个基准上取得了令人印象深刻的成绩:

模型 单对象 双对象 计数 颜色 位置 属性绑定 总体
ERNIE-Image (无 PE) 1.0000 0.9596 0.7781 0.9282 0.8550 0.7925 0.8856
ERNIE-Image (有 PE) 0.9906 0.9596 0.8187 0.8830 0.8625 0.7225 0.8728
ERNIE-Image-Turbo (无 PE) 1.0000 0.9621 0.7906 0.9202 0.7975 0.7300 0.8667
FLUX.2-klein-9B 0.9313 0.9571 0.8281 0.9149 0.7175 0.7400 0.8481

关键发现:ERNIE-Image 在"单对象"和"属性绑定"两个维度上取得满分或接近满分,GenEval 总体得分 0.8856 是所有开源模型中最高的。

长文本渲染:LongTextBench 第二

模型 LongTextBench 得分
Seedream 4.5 0.9980
ERNIE-Image (有 PE) 0.9733
ERNIE-Image-Turbo (有 PE) 0.9655
ERNIE-Image (无 PE) 0.9636

在长文本渲染方面,ERNIE-Image 英文得分 0.9804,中文得分 0.9661,分别位列第二和前列。这意味着学术论文、信息图、海报设计等需要精确文字渲染的场景,ERNIE-Image 是目前开源模型中的最佳选择之一。

三、8B 参数:AI 图像生成的"甜点"区间

2026 年上半年的一个重要趋势是:8B 参数正在成为 AI 图像生成的"甜点"区间。

模型 参数 推理步数 VRAM 需求 特点
ERNIE-Image 8B 8 (Turbo) / 50 (Base) 12-24GB 文字渲染最强
HiDream-O1-Image 8B — — 无 VAE 原生生成
FLUX.2 Pro 12B — 更大 编辑能力强
Qwen-Image 20B — 更大 多模态
HunyuanImage 3.0 80B MoE — 极大 最大参数

ERNIE-Image 和 HiDream 同为 8B,代表了一种平衡策略:参数足够表达复杂的视觉概念,同时能在消费级 GPU 上运行。ERNIE-Image Turbo 版只需 8 步推理,在 24GB 显存的 GPU 上即可流畅运行;FP8 量化后甚至可以在 12GB 显存的显卡上部署。

四、生态建设:从 GitHub 到云端 API

ERNIE-Image 在 2026 年上半年的另一个亮点是生态系统的高速扩张:

官方生态

  • ERNIE-Image Hub 上线:提供免费浏览器生成器、架构文档与基准数据
  • ComfyUI 官方模板:Base 和 Turbo 版本均有官方工作流
  • Diffusers 集成:通过 Hugging Face Diffusers 可直接调用

第三方平台

  • Civitai Orchestration API:支持 ERNIE-Image Base 和 Turbo,使用 Buzz 计费
  • fal.ai:提供 ERNIE-Image LoRA 云端训练 API
  • SiliconFlow(硅基流动):0.11 元/张的极速文生图服务
  • WaveSpeed AI:支持批量生成与商业部署

社区生态

  • Civitai LoRA 库:社区创作的 ERNIE-Image 风格 LoRA 不断增长
  • Reddit r/ERNIE_Image:活跃的讨论社区
  • DrawThings 移动端:iOS/iPad 离线运行 ERNIE-Image

五、编辑模型:社区最期待的"下一站"

截至 2026 年 7 月,ERNIE-Image 的编辑模型(Inpainting/Outpainting)仍未正式发布。Reddit r/StableDiffusion 上一个标题为"Great news: the ERNIE editing model is expected to be released"的帖子获得了 279 个点赞。

目前社区的替代方案包括:

  1. img2img 工作流:利用 ERNIE-Image 的图生图能力进行局部修改
  2. FLUX Kontext:目前最强的开源指令式编辑模型
  3. ComfyUI Inpainting 节点:配合掩码使用 ERNIE-Image Base 进行重绘

编辑模型的延迟让一些用户感到失望,但从另一个角度看,这也给了社区时间去探索和验证各种替代方案。当 ERNIE-Image 编辑模型最终发布时,社区已经有了一套成熟的比较基准。

六、展望:2026 下半年值得关注的趋势

1. 开源 vs 闭源的边界继续模糊

ERNIE-Image 在 GenEval 上的表现已经超越了许多闭源模型。随着 HiDream、Cosmos3-Super 等开源模型的崛起,开源阵营正在从"追赶"转向"竞争"。

2. 编辑模型成为核心竞争力

FLUX Kontext 的成功证明,编辑能力是 2026 年 AI 图像生成的下一个战场。ERNIE-Image 编辑模型的发布将成为下半年最重要的事件之一。

3. 多模型融合工作流

越来越多的用户不再依赖单一模型,而是采用组合策略:

  • ERNIE-Image 生成基础图像(利用文字渲染优势)
  • FLUX Kontext 进行编辑(利用指令式编辑能力)
  • SUPIR 或专用放大模型进行高清输出

4. 端侧部署继续普及

DrawThings 的更新、MLX 对 Apple Silicon 的支持、GGUF 量化方案的成熟,让 ERNIE-Image 在手机、平板、Mac 上运行成为现实。离线、免费、隐私保护是端侧部署的三大驱动力。

总结

2026 年上半年,AI 图像生成领域经历了一次深刻的"洗牌"。DALL-E 3 的退场标志着旧时代的结束,GPT Image 2 的登顶展示了闭源模型的天花板,而 ERNIE-Image、HiDream 等开源模型的崛起则证明了一个关键事实:在文字渲染、指令遵循等核心能力上,开源模型已经可以正面竞争闭源旗舰。

ERNIE-Image 以 8B 参数在 GenEval 上取得 0.8856 的优异成绩,在 LongTextBench 上排名第二,证明了"小而精悍"是一条可行的技术路线。下半年,随着编辑模型的发布、生态的进一步完善,ERNIE-Image 有望在 AI 图像生成领域占据更重要的位置。


参考来源:Artificial Analysis Image Arena、ERNIE-Image GitHub 仓库、ERNIE-Image 技术报告(arXiv:2605.25347)、Reddit r/StableDiffusion

ERNIE-Image Team