ERNIE-Image 推理加速全面指南:Cache-DiT 与 SGLang Diffusion 带来 9x 性能飞跃

Jul 28, 2026

ERNIE-Image 推理加速全面指南:Cache-DiT 与 SGLang Diffusion 带来 9x 性能飞跃

ERNIE-Image 自 2026 年 4 月开源以来,以其 8B 参数的紧凑体型和顶级文字渲染能力赢得了社区青睐。但一个现实问题始终存在:Base 模型 50 步推理在消费级 GPU 上耗时较长,即使 Turbo 模型 8 步出图,在批量生产场景下对推理效率的要求也越来越高。

2026 年 6 月,两个关键项目的成熟为 ERNIE-Image 用户带来了全新的加速方案:Cache-DiT v1.5.0 正式发布,以及 SGLang Diffusion 全面支持 DiT 模型推理加速。本文将深入解析这两个工具如何为 ERNIE-Image 带来最高 9 倍的推理速度提升,并提供完整的上手指南。

Cache-DiT:专为 DiT 打造的 PyTorch 推理引擎

Cache-DiT 是由 Vipshop(唯品会)计算机视觉团队开源的 PyTorch 原生推理引擎,构建于 Hugging Face Diffusers 之上。它专为 Diffusion Transformer(DiT)架构设计,目前支持几乎所有 Diffusers 生态中的 DiT 模型,包括 ERNIE-Image。

核心加速技术

Cache-DiT 的加速能力来自四层技术栈的协同:

1. 混合缓存加速(Hybrid Cache Acceleration)

  • DBCache:基于去噪过程的动态块缓存,在相邻去噪步之间复用相似的计算结果
  • TaylorSeer:泰勒展开预测缓存策略,提前跳过冗余计算
  • SCM(Spatial Cache Module):空间缓存模块,利用图像空间冗余减少计算量

这三种缓存策略可以叠加使用,在几乎不影响画质的前提下,将推理步中的冗余计算大幅削减。

2. 全面并行化

  • Context Parallelism(上下文并行):将长序列切分到多 GPU
  • Tensor Parallelism(张量并行):单层计算分布到多 GPU
  • 混合 2D/3D 并行:同时利用多种并行策略
  • 额外并行支持:Text Encoder、VAE、ControlNet 均可独立并行

3. SVDQuant W4A4 量化
Cache-DiT v1.5.0 原生集成了完整的 SVDQuant W4A4 量化工作流:

  • 权重量化到 4-bit,激活量化到 4-bit
  • 支持 PTQ(训练后量化)和 DQ(动态量化)两种模式
  • 无需校准数据(DQ 模式)
  • 在 FLUX.2 上实测:端到端延迟从 2.13s 降至 1.02s,提速约 2.1 倍

4. Bucket 式逐层 CPU Offload
通过计算与通信重叠的桶式卸载策略,额外延迟开销低于 5%,让显存不足的用户也能运行大模型。

对 ERNIE-Image 的兼容性

根据 Cache-DiT 官方兼容性矩阵,ERNIE-Image 的 ErnieImageTransformer2DModel 获得全特性支持:

特性 支持状态
DBCache 缓存
Context Parallelism
Tensor Parallelism
Text Encoder 并行
VAE 并行
SVDQuant 量化
CPU Offload

SGLang Diffusion:高性能推理服务框架

SGLang Diffusion 是 LMSys 团队推出的高性能图像/视频推理框架,与 Cache-DiT 深度集成。它提供了三大核心价值:

1. 多样化接口

  • CLIsglang generate 一键生成
  • 服务端sglang serve 启动 OpenAI 兼容 API
  • Python SDK:灵活嵌入现有工作流

2. 广泛模型支持

覆盖 Wan、Hunyuan、Qwen-Image、FLUX、Z-Image、GLM-Image 等主流模型,ERNIE-Image 通过 Diffusers 兼容层自然支持。

3. 多平台兼容

NVIDIA GPU、AMD GPU、Intel XPU、Ascend NPU、Apple Silicon 全平台覆盖。

实战:为 ERNIE-Image 配置 Cache-DiT 加速

环境准备

# 安装 Cache-DiT
pip install cache-dit

或安装 SGLang Diffusion(含 Cache-DiT 集成)

uv pip install "sglang[diffusion]" --prerelease=allow

一键加速(缓存模式)

在现有 Diffusers 代码中,只需添加两行:

import cache_dit
from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained(
"baidu/ERNIE-Image-Turbo",
torch_dtype=torch.bfloat16
).to("cuda")

🔥 一行开启缓存加速

cache_dit.enable_cache(pipe)

image = pipe("一个女孩在海边,夕阳,唯美风格").images[0]
image.save("output.png")

缓存 + 并行 + 量化(全栈加速)

from cache_dit import DBCacheConfig, ParallelismConfig, QuantizeConfig

cache_dit.enable_cache(
pipe,
cache_config=DBCacheConfig(), # 混合缓存
parallelism_config=ParallelismConfig( # 多 GPU 并行
ulysses_size=2
),
quantize_config=QuantizeConfig( # W4A4 量化
quant_type="svdq_int4_r64_dq"
)
)

output = pipe("一个女孩在海边,夕阳,唯美风格")

通过 SGLang Diffusion 部署

# 启动服务
sglang serve --model-path baidu/ERNIE-Image-Turbo --port 30010

调用 API

curl http://localhost:30010/v1/images/generations
-H "Content-Type: application/json"
-d '{"model": "baidu/ERNIE-Image-Turbo", "prompt": "A girl by the sea, sunset"}'

性能预期

基于 Cache-DiT 官方数据和社区实测,ERNIE-Image 在不同配置下的预期加速比:

配置 加速比 适用场景
纯缓存(DBCache) 1.5-2.5x 单卡,追求简单部署
缓存 + 编译 2-3x 单卡,可接受启动预热
缓存 + 并行 3-6x 多 GPU 服务器
缓存 + 并行 + 量化 4-9x 生产环境,极致吞吐
全栈(缓存+并行+量化+编译) 最高 9x 企业级部署

与现有方案的对比

方案 加速比 集成难度 画质影响 显存需求
原生 Diffusers 1x - 24GB
Cache-DiT 缓存 1.5-2.5x 低(2 行代码) 极小 24GB
Cache-DiT 全栈 最高 9x 可接受 16-24GB
SGLang Diffusion 2-5x 24GB
SVDQuant W4A4 2x 极小 12-16GB
GGUF 量化 1.5-2x 轻微 8-16GB

社区集成生态

Cache-DiT 已与多个主流工具深度集成:

  • ComfyUI:通过 ComfyUI-CacheDiT 插件,在 ComfyUI 界面中直接启用缓存加速
  • SGLang Diffusion:作为其缓存后端,服务化部署自动受益
  • vLLM-Omni:通过 vLLM 的扩散模型支持层使用 Cache-DiT
  • TensorRT-LLM:NVIDIA 官方推理框架集成
  • SD.Next:Stable Diffusion 网页界面内置支持

对于 ComfyUI 用户,安装 ComfyUI-CacheDiT 节点后,只需在 ERNIE-Image 工作流中添加一个 Cache-DiT 节点即可开启加速,无需修改 Python 代码。

注意事项

  1. 缓存精度:DBCache 等缓存策略会对画质产生轻微影响。在高质量需求场景(如最终出图),建议关闭缓存或使用较低缓存强度
  2. 编译预热torch.compile 需要首次运行时的编译预热(约 30-60 秒),适合长时运行的服务而非单次生成
  3. 量化兼容性:SVDQuant W4A4 需要 CUDA 13.0+ 和 PyTorch 2.11+
  4. ERNIE-Image 特殊注意:PE(Prompt Enhancer)目前不在 Cache-DiT 加速范围内,但 PE 本身是轻量级 3B 模型,推理开销小

总结

Cache-DiT v1.5.0 与 SGLang Diffusion 的成熟,标志着 DiT 模型推理加速进入了一个新阶段。对于 ERNIE-Image 用户来说:

  • 个人用户:只需 2 行代码即可获得 1.5-2.5x 加速
  • 开发者:通过 SGLang Diffusion 部署,获得 2-5x 服务吞吐提升
  • 企业用户:全栈加速方案可达 9x,显著降低推理成本

在 ERNIE-Image 编辑模型尚未正式发布的当下,推理加速是提升生产效率和降低使用成本最直接的路径。Cache-DiT 的出现,让 ERNIE-Image 在消费级 GPU 上的实用性又上了一个台阶。


相关阅读:EI-070《ERNIE-Image 推理优化深度指南》、EI-103《PE 独立部署与 SGLang 加速全指南》、EI-034《SGLang 生产部署指南》

ERNIE-Image Team

ERNIE-Image 推理加速全面指南:Cache-DiT 与 SGLang Diffusion 带来 9x 性能飞跃 | Blog