Google Imagen 4 退役倒计时:ERNIE-Image 能否成为开源替代的首选?

Jul 30, 2026

Google Imagen 4 退役倒计时:ERNIE-Image 能否成为开源替代的首选?

2026 年 8 月 17 日,Google 将正式关闭 Imagen 4 全部三个端点。对于依赖 Google 图像生成 API 的开发者和企业来说,不到三周的倒计时已经启动。对于需要中文文字渲染、本地部署和零 API 成本的用户,开源社区给出了一个有力的答案。

Imagen 4:从 Google 旗舰到退役

2026 年 4 月,Google 还在大力推广 Imagen 4 的文本渲染能力和高保真图像生成。仅仅三个月后,Imagen 4 全线进入退役倒计时。

根据 Google 官方 deprecations 页面,以下三个 Imagen 4 模型端点将于 2026 年 8 月 17 日 正式关闭:

模型 ID 状态 关闭日期 推荐替代
imagen-4.0-generate-001 Deprecated 2026-08-17 gemini-3.1-flash-image
imagen-4.0-ultra-generate-001 Deprecated 2026-08-17 gemini-3.1-flash-image
imagen-4.0-fast-generate-001 Deprecated 2026-08-17 gemini-3.1-flash-image

这不是 Google 第一次退役图像生成模型。此前 Imagen 3 已于 2025 年 11 月关闭。每一次模型迭代都伴随着 API 端点变更、代码重写和迁移成本。

Google 推荐的用户迁移路径是转向 Gemini 3.1 Flash Image(社区俗称 Nano Banana)。但 Nano Banana 同样是闭源 API 模型——你无法下载它、无法在本地运行、无法进行微调或 LoRA 训练。

对于许多开发者来说,这意味着:又一次 API 迁移,又一次供应商锁定。

为什么要寻找开源替代?

闭源 API 模型有三个根本性风险:

  1. 供应商锁定风险:Google 可以随时改变定价、关闭端点、修改使用条款。Imagen 4 用户在 2025 年 6 月刚迁移到新 API,2026 年 8 月又要再次迁移。
  2. 隐私与合规:API 调用意味着你的提示词和生成图像会经过 Google 服务器。对于涉及客户数据、商业机密的场景,这可能是不可接受的。
  3. 成本不可控:API 按调用次数计费,高吞吐量场景下成本迅速累积。自部署模型只需一次硬件投入,后续边际成本接近零。

ERNIE-Image:8B 参数、Apache 2.0、开源即用

2026 年 4 月 15 日,百度正式开源了 ERNIE-Image——一个基于单流 Diffusion Transformer(DiT)架构的 8B 参数文生图模型,采用 Apache 2.0 协议。

核心规格:

特性 ERNIE-Image Imagen 4 Nano Banana
开源 ✅ Apache 2.0 ❌ 闭源 ❌ 闭源
本地部署 ✅ 支持 ❌ 不支持 ❌ 不支持
参数规模 8B 未知(闭源) 未知(闭源)
中文渲染 ✅ 强项 ❌ 仅英文 ✅ 支持
价格 零(自部署) API 计费 API 计费
微调/LoRA ✅ 支持 ❌ 不支持 ❌ 不支持
隐私保障 ✅ 完全本地 ❌ 数据上云 ❌ 数据上云

基准测试对比

GenEval 复杂指令跟随

在 GenEval 基准上,ERNIE-Image(不使用 PE)以 0.8856 的总分位居开源模型之首:

模型 单目标 双目标 计数 颜色 位置 属性绑定 总体
ERNIE-Image (w/o PE) 1.0000 0.9596 0.7781 0.9282 0.8550 0.7925 0.8856
Qwen-Image 0.9900 0.9200 0.8900 0.8800 0.7600 0.7700 0.8683
FLUX.2-klein-9B 0.9313 0.9571 0.8281 0.9149 0.7175 0.7400 0.8481

LongTextBench 文字渲染

文字渲染是 ERNIE-Image 的最强优势。在 LongTextBench 上:

模型 英文 中文 平均
Seedream 4.5(闭源) 0.9890 0.9873 0.9882
ERNIE-Image(使用 PE) 0.9804 0.9661 0.9733
GLM-Image 0.9524 0.9788 0.9656
Qwen-Image-2512 0.9560 0.9650 0.9605

注意:ERNIE-Image 是开源模型中最强的文字渲染模型,中英文兼顾。相比之下,Imagen 4 仅支持英文提示词,且文字渲染能力在第三方评测中始终落后于 ERNIE-Image。

从 Imagen 4 迁移到 ERNIE-Image:三步走

第一步:环境准备

ERNIE-Image 对硬件要求极低——一张 24GB 显存的 GPU(RTX 3090/4090)即可流畅运行。

Diffusers 安装(最快上手):

pip install git+https://github.com/huggingface/diffusers
import torch
from diffusers import ErnieImagePipeline

pipe = ErnieImagePipeline.from_pretrained(
"baidu/ERNIE-Image",
torch_dtype=torch.bfloat16,
).to("cuda")

image = pipe(
prompt="A photo of a Japanese-style ramen shop interior, warm lighting, wooden counter, steam rising from the soup",
height=1024,
width=1024,
num_inference_steps=50,
guidance_scale=4.0,
use_pe=True
).images[0]
image.save("output.png")

第二步:将 Imagen API 调用迁移到本地

迁移前(Imagen API):

from google import genai
client = genai.Client()
response = client.models.generate_images(
    model='imagen-4.0-generate-001',
    prompt='A futuristic cityscape at sunset',
    config={'number_of_images': 1, 'aspect_ratio': '16:9'}
)

迁移后(ERNIE-Image 本地):

import torch
from diffusers import ErnieImagePipeline

pipe = ErnieImagePipeline.from_pretrained(
"baidu/ERNIE-Image", torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
prompt="A futuristic cityscape at sunset, cyberpunk style, neon lights reflecting on wet streets, flying vehicles in the sky",
height=848, # 16:9 → 848x1512 or 1024x1024
width=1512,
num_inference_steps=50,
guidance_scale=4.0,
use_pe=True
).images[0]

关键差异:

  • Imagen 4 使用 API key + 远程调用,ERNIE-Image 使用本地模型
  • ERNIE-Image 支持更长的提示词(远超 480 tokens 限制)
  • ERNIE-Image 支持中文提示词(Imagen 4 不支持)
  • ERNIE-Image 可以自定义推理步数和 guidance scale

第三步:部署到生产环境

对于生产环境,推荐使用 SGLang 部署以获得最佳性能:

# 安装 SGLang
git clone https://github.com/sgl-project/sglang.git
pip install -e "python[diffusion]"

启动 ERNIE-Image 服务

sglang serve --model-path baidu/ERNIE-Image
--num-gpus 1
--performance-mode auto
--port 30010

启动后即可通过 OpenAI 兼容 API 调用:

curl -X POST http://localhost:30010/v1/images/generations \
  -H "Content-Type: application/json" \
  -d '{
    "prompt": "An oil painting of a mountain lake, impressionist style",
    "height": 1024,
    "width": 1024,
    "num_inference_steps": 50,
    "guidance_scale": 4.0,
    "use_pe": true
  }' \
  --output output.png

这意味着你可以用几乎零代码迁移将 Imagen API 调用替换为自托管端点——Go、JavaScript、Python 等所有语言的客户端只需将 base_url 改为本地地址即可。

Turbo 模式:8 步推理的极速选择

如果 Imagen 4 Fast 的响应速度是你关心的重点,ERNIE-Image-Turbo 仅需 8 步推理,在 RTX 4090 上可在 2-3 秒内生成一张 1024×1024 图像:

pipe = ErnieImagePipeline.from_pretrained(
    "baidu/ERNIE-Image-Turbo", torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
prompt="A minimalist logo design with geometric shapes",
height=1024,
width=1024,
num_inference_steps=8,
guidance_scale=1.0,
use_pe=True
).images[0]

Turbo 模型通过 DMD(分布匹配蒸馏)和 RL(强化学习)优化,在保持画质的同时实现 6 倍以上的速度提升。

迁移成本对比

方案 初始成本 月度运营成本 每张图像成本 隐私
Imagen 4 API $0 ~$150(10万张/月) ~$0.0015/张
Nano Banana API $0 ~$390(10万张/月) ~$0.039/张
ERNIE-Image 自部署(RTX 4090) ~$2,000(一次性) ~$50(电费) ~$0.0005/张
ERNIE-Image 云 GPU(RunPod) $0 ~$100(A100 40GB) ~$0.001/张

注:以上为近似估算,实际成本因用量和云服务商而异。

谁应该立即迁移?

强烈建议立即迁移的用户:

  • 中文内容创作者:如果你需要生成含中文文字的图像(海报、社交媒体配图、电商图片),ERNIE-Image 的中文文字渲染能力远超 Imagen 4(后者甚至不支持中文提示词)
  • 隐私敏感型应用:医疗、金融、法律等行业的图像生成需求,数据不能离开本地
  • 高吞吐量场景:每月生成 10 万张以上的用户,自部署的成本优势极为明显
  • 需要定制化控制:需要 LoRA 微调、ControlNet 控制、自定义 VAE 的进阶用户

可以观望的用户:

  • 完全使用英文且不需要本地部署的用户,可以迁移到 Nano Banana
  • 图像编辑为主的用户,ERNIE-Image 编辑模型尚未发布(编辑需求可借助 FLUX Kontext 或 Bernini-R 等社区方案)

编辑模型:社区的期待

截至 2026 年 7 月 30 日,ERNIE-Image 的编辑模型(Inpainting/Outpainting)尚未正式发布。但社区已有多种有效替代方案:

  • 简单编辑:img2img + mask 方案功能完备
  • 高质量编辑:FLUX Kontext 提供专业级编辑能力
  • 文字+编辑:Bernini-R 混合管线保留文字渲染优势

根据百度官方路线图,编辑模型 Beta 预计在 2026 年 7-8 月 通过 ComfyUI 节点发布。对于需要编辑能力的用户,建议在迁移到 ERNIE-Image 进行基础生成的同时,配合社区方案完成编辑工作流。

总结:开源替代的时代已经到来

Imagen 4 的退役不是孤立事件——它是闭源 API 模型固有风险的最新例证。每一次模型迭代、每一个端点关闭,都在提醒开发者:API 便利性的背面是供应商锁定。

ERNIE-Image 作为 Apache 2.0 协议下最强开源文生图模型,在文字渲染、指令跟随、结构化生成等方面达到了开源 SOTA,在中文文字渲染方面更是唯一能与闭源旗舰抗衡的模型。

从 Imagen 4 迁移到 ERNIE-Image,不仅是技术选择,更是从"租用能力"到"拥有能力"的转变。


参考来源:Google Gemini API Deprecations、ERNIE-Image Technical Report (arXiv:2605.25347)、HuggingFace baidu/ERNIE-Image、SGLang 官方文档、Google Imagen 迁移指南

ERNIE-Image Team