ERNIE-Image 社区量化模型全面评测:FP8 / INT8 / NVFP4 在 RTX 5090 / 3090 / 3060 上的性能实测

Jul 24, 2026

ERNIE-Image 社区量化模型全面评测:FP8 / INT8 / NVFP4 在 RTX 5090 / 3090 / 3060 上的性能实测

ERNIE-Image 8B 的 BF16 模型体积约 16GB,部署门槛不低。社区开发者 Bedovyy 在 HuggingFace 上发布了 ERNIE-Image 和 ERNIE-Image-Turbo 的量化版本,覆盖 NVFP4、FP8、INT8 三种格式,并在 RTX 5090、RTX 3090、RTX 3060 三张代表不同世代的 GPU 上做了完整的基准测试。

本文基于这份实测数据,帮你找到最优的量化部署方案。

三种量化格式的区别

在进入数据之前,先搞清楚这几种量化格式的特点:

  • BF16(基线):16 位浮点,无量化,模型体积 16GB+,质量无损
  • FP8 (e4m3):8 位浮点,体积减半至约 8GB,质量损失极小
  • INT8 (rowwise):8 位整数量化,体积约 8GB,速度提升显著,质量在可接受范围
  • NVFP4:NVIDIA Blackwell 架构专属的 4 位浮点格式,体积约 4.78GB,仅 RTX 50 系列支持硬件加速

ERNIE-Image-Turbo 基准测试

Turbo 模型只需 8 步推理,本身就是追求速度的。量化能再快多少?

GPU 量化 it/s 耗时 相对 BF16
RTX 5090 BF16 2.09 4.87s 100%
FP8 3.69 3.32s 147%
INT8 4.31 3.05s 160%
NVFP4 5.09 2.72s 179%
RTX 3090 BF16 0.88 12.42s 100%
FP8 0.84 12.73s 98% (倒退)
INT8 1.66 7.04s 176%
NVFP4 0.83 12.71s 98% (倒退)
RTX 3060 BF16 0.26 43.02s 100%
FP8 0.39 28.66s 150%
INT8 0.82 14.43s 298%
NVFP4 0.39 28.72s 150%

ERNIE-Image Base 基准测试

Base 模型需要 50 步推理,量化带来的收益更加显著:

GPU 量化 it/s 耗时 相对 BF16
RTX 5090 BF16 1.08 20.08s 100%
FP8 1.97 11.67s 172%
INT8 2.14 10.89s 184%
NVFP4 2.56 9.35s 215%
RTX 3090 BF16 0.40 53.33s 100%
INT8 0.79 28.08s 190%
FP8 0.39 54.71s 97% (倒退)
NVFP4 0.38 55.20s 97% (倒退)
RTX 3060 BF16 0.11 201.41s 100%
FP8 0.17 130.48s 154%
INT8 0.35 62.42s 323%
NVFP4 0.17 130.87s 154%

四条关键结论

1. NVFP4 是 RTX 50 系列的专属福利

NVFP4 在 RTX 5090 上表现惊艳——Turbo 模型提速 79%,Base 模型提速 115%。但这是 Blackwell 架构的硬件特性。在 RTX 3090(Ampere)和 RTX 3060(Ampere)上,NVFP4 不仅没有加速,反而略慢于 BF16。

结论很清晰:NVFP4 只推荐 RTX 50 系列用户使用。如果你还在用 30 系列,不要碰 NVFP4。

2. INT8 是最普适的选择

int8rowwise 量化在所有测试 GPU 上都有显著加速,没有任何倒退案例:

  • RTX 5090:加速 60-84%
  • RTX 3090:加速 76-90%
  • RTX 3060:加速 198-223%(接近 3x!)

对 30 系列用户来说,INT8 是唯一值得考虑的量化格式。

3. FP8 是次优选择——但 30 系列有坑

FP8 在 RTX 5090 和 RTX 3060 上有 50-70% 的加速,表现稳定。但在 RTX 3090 上出现了性能倒退(Base 模型慢了 3%),说明 Ampere 架构对大核心的 FP8 支持不够理想。

4. Base 模型 50 步改 INT8 后的收益远超 Turbo

一个有趣发现:RTX 3060 上 Base 模型从 BF16 改 INT8,单张图从 201 秒降到 62 秒——省了 139 秒。而 Turbo 模型从 0.26 it/s 升到 0.82 it/s,同样 3x 加速但绝对值节省较少。

这意味着:如果你对画质有较高要求(需要 Base 的 50 步推理),但又受限于中低端显卡,INT8 量化是最值得做的优化。

按 GPU 的推荐配置

RTX 5090 用户

模型: ERNIE-Image-Turbo
量化: NVFP4 (最佳) 或 INT8 (次选)
速度: 2.72 秒/张 (8步)

NVFP4 让 5090 的 Turbo 生成接近实时。即使跑 Base 50 步,也只需要 9.35 秒。

RTX 3090 / 3080 用户

模型: ERNIE-Image-Turbo
量化: INT8 (唯一推荐)
速度: 7.04 秒/张 (8步)

放弃 NVFP4 和 FP8。INT8 在 3090 上效果显著,Turbo 从 12.4 秒降到 7 秒。

RTX 3060 / 4060 用户

模型: ERNIE-Image-Turbo 或 Base
量化: INT8 (强烈推荐)
速度: 14.43 秒/张 (Turbo 8步) / 62.42 秒/张 (Base 50步)

INT8 让 3060 的 Turbo 生成从 43 秒降到 14 秒,从"无法忍受"变成"可以接受"。如果想用 Base 模型,62 秒也在合理范围。

如何使用社区量化模型

第一步,下载量化模型文件:

# 从 HuggingFace 下载
git lfs install
git clone https://huggingface.co/Bedovyy/ERNIE-Image-Quantized

或直接下载特定量化格式

NVFP4: ernie-image-turbo-nvfp4.safetensors (~4.78GB)

FP8: ernie-image-turbo-fp8.safetensors (~8.22GB)

INT8: ernie-image-turbo-int8.safetensors (~8.22GB)

第二步,放入 ComfyUI 模型目录:

ComfyUI/models/diffusion_models/ernie-image-turbo-int8.safetensors

第三步,加载量化配置 JSON:

{
  "block_names": ["layers"],
  "rules": [
    { "policy": "keep", "match": ["adaLN", "self_attention.norm"] },
    { "policy": "float8_e4m3fn", "match": ["mlp", "self_attention.to"] }
  ]
}

如果想自己动手量化,可以使用 Bedovyy 开源的 comfy-dit-quantizer 工具:

git clone https://github.com/bedovyy/comfy-dit-quantizer
cd comfy-dit-quantizer
pip install -r requirements.txt
python quantize.py --model ernie-image-turbo.safetensors --config config.json

质量对比与建议

社区量化模型通常会保留 diagnal 层(adaLN 和 self_attention.norm)为高精度,只量化 MLP 和 attention 投影层。根据 Bedovyy 的样本对比,FP8 和 INT8 在视觉质量上与 BF16 几乎没有肉眼可察觉的差异。NVFP4 在部分细节上略有损失,但考虑到文件体积仅 4.78GB(BF16 的三分之一),对大多数应用场景来说是一个值得的取舍。

如果你对质量极其敏感(如商业印刷),建议至少使用 FP8。INT8 在复杂文本渲染场景中偶有轻微质量损失,但普通图像生成基本无感。

总结

ERNIE-Image 的社区量化生态已经成熟。Bedovyy 提供的四格式量化模型覆盖了从旗舰 RTX 5090 到入门 RTX 3060 的全 GPU 梯队,让不同预算的用户都能找到适合自己的部署方案。

核心建议:

  • RTX 50 系列 → NVFP4(速度最快)
  • RTX 30 系列 → INT8(唯一有效选择)
  • 低端卡 → INT8 + Turbo(3x 加速,从不可用到可用)
  • 质量优先 → FP8(在大多数 GPU 上无损加速 50%+)

ERNIE-Image Team