ERNIE-Image 社区量化模型全面评测:FP8 / INT8 / NVFP4 在 RTX 5090 / 3090 / 3060 上的性能实测
ERNIE-Image 8B 的 BF16 模型体积约 16GB,部署门槛不低。社区开发者 Bedovyy 在 HuggingFace 上发布了 ERNIE-Image 和 ERNIE-Image-Turbo 的量化版本,覆盖 NVFP4、FP8、INT8 三种格式,并在 RTX 5090、RTX 3090、RTX 3060 三张代表不同世代的 GPU 上做了完整的基准测试。
本文基于这份实测数据,帮你找到最优的量化部署方案。
三种量化格式的区别
在进入数据之前,先搞清楚这几种量化格式的特点:
- BF16(基线):16 位浮点,无量化,模型体积 16GB+,质量无损
- FP8 (e4m3):8 位浮点,体积减半至约 8GB,质量损失极小
- INT8 (rowwise):8 位整数量化,体积约 8GB,速度提升显著,质量在可接受范围
- NVFP4:NVIDIA Blackwell 架构专属的 4 位浮点格式,体积约 4.78GB,仅 RTX 50 系列支持硬件加速
ERNIE-Image-Turbo 基准测试
Turbo 模型只需 8 步推理,本身就是追求速度的。量化能再快多少?
| GPU | 量化 | it/s | 耗时 | 相对 BF16 |
|---|---|---|---|---|
| RTX 5090 | BF16 | 2.09 | 4.87s | 100% |
| FP8 | 3.69 | 3.32s | 147% | |
| INT8 | 4.31 | 3.05s | 160% | |
| NVFP4 | 5.09 | 2.72s | 179% | |
| RTX 3090 | BF16 | 0.88 | 12.42s | 100% |
| FP8 | 0.84 | 12.73s | 98% (倒退) | |
| INT8 | 1.66 | 7.04s | 176% | |
| NVFP4 | 0.83 | 12.71s | 98% (倒退) | |
| RTX 3060 | BF16 | 0.26 | 43.02s | 100% |
| FP8 | 0.39 | 28.66s | 150% | |
| INT8 | 0.82 | 14.43s | 298% | |
| NVFP4 | 0.39 | 28.72s | 150% |
ERNIE-Image Base 基准测试
Base 模型需要 50 步推理,量化带来的收益更加显著:
| GPU | 量化 | it/s | 耗时 | 相对 BF16 |
|---|---|---|---|---|
| RTX 5090 | BF16 | 1.08 | 20.08s | 100% |
| FP8 | 1.97 | 11.67s | 172% | |
| INT8 | 2.14 | 10.89s | 184% | |
| NVFP4 | 2.56 | 9.35s | 215% | |
| RTX 3090 | BF16 | 0.40 | 53.33s | 100% |
| INT8 | 0.79 | 28.08s | 190% | |
| FP8 | 0.39 | 54.71s | 97% (倒退) | |
| NVFP4 | 0.38 | 55.20s | 97% (倒退) | |
| RTX 3060 | BF16 | 0.11 | 201.41s | 100% |
| FP8 | 0.17 | 130.48s | 154% | |
| INT8 | 0.35 | 62.42s | 323% | |
| NVFP4 | 0.17 | 130.87s | 154% |
四条关键结论
1. NVFP4 是 RTX 50 系列的专属福利
NVFP4 在 RTX 5090 上表现惊艳——Turbo 模型提速 79%,Base 模型提速 115%。但这是 Blackwell 架构的硬件特性。在 RTX 3090(Ampere)和 RTX 3060(Ampere)上,NVFP4 不仅没有加速,反而略慢于 BF16。
结论很清晰:NVFP4 只推荐 RTX 50 系列用户使用。如果你还在用 30 系列,不要碰 NVFP4。
2. INT8 是最普适的选择
int8rowwise 量化在所有测试 GPU 上都有显著加速,没有任何倒退案例:
- RTX 5090:加速 60-84%
- RTX 3090:加速 76-90%
- RTX 3060:加速 198-223%(接近 3x!)
对 30 系列用户来说,INT8 是唯一值得考虑的量化格式。
3. FP8 是次优选择——但 30 系列有坑
FP8 在 RTX 5090 和 RTX 3060 上有 50-70% 的加速,表现稳定。但在 RTX 3090 上出现了性能倒退(Base 模型慢了 3%),说明 Ampere 架构对大核心的 FP8 支持不够理想。
4. Base 模型 50 步改 INT8 后的收益远超 Turbo
一个有趣发现:RTX 3060 上 Base 模型从 BF16 改 INT8,单张图从 201 秒降到 62 秒——省了 139 秒。而 Turbo 模型从 0.26 it/s 升到 0.82 it/s,同样 3x 加速但绝对值节省较少。
这意味着:如果你对画质有较高要求(需要 Base 的 50 步推理),但又受限于中低端显卡,INT8 量化是最值得做的优化。
按 GPU 的推荐配置
RTX 5090 用户
模型: ERNIE-Image-Turbo
量化: NVFP4 (最佳) 或 INT8 (次选)
速度: 2.72 秒/张 (8步)
NVFP4 让 5090 的 Turbo 生成接近实时。即使跑 Base 50 步,也只需要 9.35 秒。
RTX 3090 / 3080 用户
模型: ERNIE-Image-Turbo
量化: INT8 (唯一推荐)
速度: 7.04 秒/张 (8步)
放弃 NVFP4 和 FP8。INT8 在 3090 上效果显著,Turbo 从 12.4 秒降到 7 秒。
RTX 3060 / 4060 用户
模型: ERNIE-Image-Turbo 或 Base
量化: INT8 (强烈推荐)
速度: 14.43 秒/张 (Turbo 8步) / 62.42 秒/张 (Base 50步)
INT8 让 3060 的 Turbo 生成从 43 秒降到 14 秒,从"无法忍受"变成"可以接受"。如果想用 Base 模型,62 秒也在合理范围。
如何使用社区量化模型
第一步,下载量化模型文件:
# 从 HuggingFace 下载
git lfs install
git clone https://huggingface.co/Bedovyy/ERNIE-Image-Quantized
或直接下载特定量化格式
NVFP4: ernie-image-turbo-nvfp4.safetensors (~4.78GB)
FP8: ernie-image-turbo-fp8.safetensors (~8.22GB)
INT8: ernie-image-turbo-int8.safetensors (~8.22GB)
第二步,放入 ComfyUI 模型目录:
ComfyUI/models/diffusion_models/ernie-image-turbo-int8.safetensors
第三步,加载量化配置 JSON:
{
"block_names": ["layers"],
"rules": [
{ "policy": "keep", "match": ["adaLN", "self_attention.norm"] },
{ "policy": "float8_e4m3fn", "match": ["mlp", "self_attention.to"] }
]
}
如果想自己动手量化,可以使用 Bedovyy 开源的 comfy-dit-quantizer 工具:
git clone https://github.com/bedovyy/comfy-dit-quantizer
cd comfy-dit-quantizer
pip install -r requirements.txt
python quantize.py --model ernie-image-turbo.safetensors --config config.json
质量对比与建议
社区量化模型通常会保留 diagnal 层(adaLN 和 self_attention.norm)为高精度,只量化 MLP 和 attention 投影层。根据 Bedovyy 的样本对比,FP8 和 INT8 在视觉质量上与 BF16 几乎没有肉眼可察觉的差异。NVFP4 在部分细节上略有损失,但考虑到文件体积仅 4.78GB(BF16 的三分之一),对大多数应用场景来说是一个值得的取舍。
如果你对质量极其敏感(如商业印刷),建议至少使用 FP8。INT8 在复杂文本渲染场景中偶有轻微质量损失,但普通图像生成基本无感。
总结
ERNIE-Image 的社区量化生态已经成熟。Bedovyy 提供的四格式量化模型覆盖了从旗舰 RTX 5090 到入门 RTX 3060 的全 GPU 梯队,让不同预算的用户都能找到适合自己的部署方案。
核心建议:
- RTX 50 系列 → NVFP4(速度最快)
- RTX 30 系列 → INT8(唯一有效选择)
- 低端卡 → INT8 + Turbo(3x 加速,从不可用到可用)
- 质量优先 → FP8(在大多数 GPU 上无损加速 50%+)