ERNIE-Image × Hunyuan3D 2.0:从文生图到 3D 纹理化模型的完整工作流

Jun 2, 2026

ERNIE-Image × Hunyuan3D 2.0:从文生图到 3D 纹理化模型的完整工作流

将 Baidu 的 ERNIE-Image 与 Tencent 的 Hunyuan3D 2.0 结合,构建一套从文本描述到高质量 3D 纹理模型的端到端开源管线。ERNIE-Image 负责生成高质量条件图,Hunyuan3D 负责几何生成与纹理合成——两个模型均在 Apache 2.0 下开源,可在 ComfyUI 中统一编排。

为什么需要 2D → 3D 的工作流?

2026 年的 AI 图像生成已经非常成熟,ERNIE-Image 在 8B 参数量下实现了 SOTA 级别的文字渲染和复杂指令遵循。但对于游戏开发、电商 3D 展示、VR/AR 内容创作等场景,静态 2D 图像已经不够用——你需要的是可旋转、可交互的 3D 资产。

传统的 3D 建模需要专业的 Maya/Blender 技能,学习曲线陡峭。Hunyuan3D 2.0 的出现改变了这一点:它可以通过一张条件图像自动生成带有高分辨率纹理的 3D 网格模型。而 ERNIE-Image 恰好是生成高质量条件图的最佳工具之一。

组合优势:

  • ERNIE-Image:精准文字渲染 + 结构化布局能力 → 生成包含清晰文字/Logo 的条件图
  • Hunyuan3D-DiT:2.6B 参数的 Flow Diffusion Transformer → 从条件图提取精确几何
  • Hunyuan3D-Paint:几何与扩散先验 → 生成高分辨率纹理贴图

Hunyuan3D 2.0 架构速览

Hunyuan3D 2.0 由两个核心组件组成:

Hunyuan3D-DiT(形状生成)

基于 Flow-based Diffusion Transformer 架构,拥有 2.6B 参数。它的核心任务是从条件图像(或多视图图像)中提取三维几何信息,生成无纹理的网格模型(Mesh)。

关键特性:

  • 支持单图输入(单视角重建)和多视图输入(多视角重建)
  • 生成的几何体与条件图像的轮廓、结构高度对齐
  • 输出格式:.obj 或 .glb

Hunyuan3D-Paint(纹理合成)

纹理合成模型利用几何先验和扩散模型能力,为生成的(或手工制作的)网格模型生成高分辨率、色彩丰富的纹理贴图。

关键特性:

  • 纹理分辨率可达 2048×2048
  • 支持 UV 展开自动处理
  • 输出的纹理贴图可直接用于游戏引擎(Unity/Unreal Engine)

完整工作流:5 步从文本到 3D

第一步:用 ERNIE-Image 生成条件图

这是整个管线中最关键的步骤。条件图的质量直接决定 3D 模型的几何精度。

最佳实践:

  • 使用 ERNIE-Image(50 步 SFT 版本) 而非 Turbo — 最终产出需要最高质量
  • 指导尺度 guidance_scale=4.0
  • 分辨率 1024×1024
  • 开启 PE(Prompt Enhancer)以获得更丰富的细节

Prompt 示例:

A detailed 3D-rendered product of a ceramic coffee mug, white background, 
front view, clean lighting, no shadows, product photography style, 
high resolution

为什么 ERNIE-Image 特别适合?
ERNIE-Image 的文字渲染能力意味着你可以在条件图中直接嵌入品牌 Logo 或产品名称文字,这些文字会在 3D 纹理中清晰呈现——这是其他开源模型难以做到的。

第二步:背景清理(可选但推荐)

Hunyuan3D 对纯色背景的条件图表现更好。可以使用 ComfyUI 的 RemBG 节点或 BiRefNet 进行背景移除。

# BiRefNet 快速背景移除
from birefnet import BiRefNet
model = BiRefNet.from_pretrained("bi-refnet")
transparent_image = model.remove_background(ernie_output)

第三步:Hunyuan3D-DiT 几何生成

将清理后的条件图输入 Hunyuan3D-DiT:

from hunyuan3d import Hunyuan3DDiT

初始化模型

shape_model = Hunyuan3DDiT.from_pretrained("Tencent/Hunyuan3D-2.0-DiT")

从条件图生成几何

mesh = shape_model.generate(
condition_image=cleaned_condition,
num_steps=50,
guidance_scale=7.5
)

导出 OBJ/GLB

mesh.export("output/model.obj")
mesh.export_glb("output/model.glb")

第四步:Hunyuan3D-Paint 纹理合成

from hunyuan3d import Hunyuan3DPaint

初始化纹理模型

paint_model = Hunyuan3DPaint.from_pretrained("Tencent/Hunyuan3D-2.0-Paint")

生成纹理贴图

textured_mesh = paint_model.generate(
mesh=mesh,
reference_image=cleaned_condition,
texture_resolution=(2048, 2048)
)

导出带纹理的模型

textured_mesh.export_glb("output/textured_model.glb")

第五步:在 ComfyUI 中统一编排

ComfyUI 提供了可视化的节点式工作流,可以将整个管线串联:

[ERNIE-Image Node] → [RemBG Node] → [Hunyuan3D-DiT Node] → [Hunyuan3D-Paint Node] → [GLB Export Node]

ComfyUI 节点安装:

# 更新 ComfyUI 到最新版本(原生支持 Hunyuan3D)
cd ComfyUI
git pull

或使用 ComfyUI-Hunyuan3DWrapper 插件

cd ComfyUI/custom_nodes
git clone https://github.com/kijai/ComfyUI-Hunyuan3DWrapper.git
cd ComfyUI-Hunyuan3DWrapper
pip install -r requirements.txt

硬件需求与性能

显存需求

步骤 模型 BF16 显存 FP8 显存 GGUF 显存
条件图生成 ERNIE-Image ~16 GB ~10 GB ~8 GB
几何生成 Hunyuan3D-DiT ~20 GB ~12 GB 暂不支持
纹理合成 Hunyuan3D-Paint ~14 GB ~8 GB 暂不支持

推荐配置:

  • 最低:RTX 3090 (24GB) — 使用 FP8 量化,分步执行
  • 推荐:RTX 4090 (24GB) — FP8 下完整管线可运行
  • 理想:A100 80GB — 同时加载所有模型,无需切换

生成时间估算

在 RTX 4090 上:

步骤 时间(BF16) 时间(FP8)
ERNIE-Image Turbo (8 步) ~5 秒 ~3 秒
ERNIE-Image SFT (50 步) ~25 秒 ~15 秒
Hunyuan3D-DiT 几何生成 ~30 秒 ~18 秒
Hunyuan3D-Paint 纹理 ~40 秒 ~25 秒
总计 ~100 秒 ~61 秒

使用 ERNIE-Image Turbo + FP8 量化 可以将总时间压缩到 1 分钟以内。

实际应用案例

电商产品展示

  1. 用 ERNIE-Image 生成产品正面图(含品牌文字)
  2. Hunyuan3D 生成 360° 可旋转的 3D 模型
  3. 导出 GLB 嵌入 Shopify/淘宝 3D 展示页面

优势:无需实物拍摄,一天可生成上百个产品的 3D 展示模型。

游戏资产快速原型

  1. 设计阶段用 ERNIE-Image 生成角色/道具概念图
  2. Hunyuan3D 快速生成可导入引擎的 3D 模型
  3. 美术团队在此基础上精修

优势:将概念设计到 3D 原型的周期从数天缩短到数分钟。

教育/培训 3D 内容

  1. 用 ERNE-Image 生成教材插图(含文字标注)
  2. Hunyuan3D 生成 3D 教学模型
  3. 嵌入 VR/AR 教学应用

常见问题

Q: 生成的 3D 模型文字不清晰怎么办?

ERNIE-Image 的文字渲染能力在 2D 图像中很强,但 Hunyuan3D 的纹理合成可能会模糊文字细节。建议:

  • 在 ERNIE-Image 阶段使用更大字号的文字
  • 纹理分辨率设置为 2048×2048 而非默认的 1024×1024
  • 对于关键文字,考虑在建模软件中后期添加

Q: 单视图 vs 多视图哪个效果好?

  • 单视图:速度快,适合简单物体(产品、器皿)
  • 多视图:从 ERNIE-Image 生成 4-6 个角度的视图,几何精度显著提升,适合复杂物体(角色、机械)

Q: 能否在 16GB 显存的 GPU 上运行?

可以,但需要:

  1. 使用 ERNIE-Image Turbo NVFP4 量化(~4.8GB)
  2. 几何和纹理生成分步执行,释放显存
  3. 使用 CPU offloading(速度会明显下降)

总结

ERNIE-Image × Hunyuan3D 2.0 的组合代表了 2026 年开源 3D 内容生成的最佳实践:

  • 全开源:Apache 2.0 许可,商用无忧
  • 全自动化:从文本描述到 3D 资产,端到端
  • 高质量:ERNIE-Image 的文字渲染 + Hunyuan3D 的几何精度
  • 可部署:ComfyUI 可视化编排,SGLang 生产部署

随着两个模型的持续迭代,这个工作流的质量还会不断提升。对于需要批量 3D 内容的团队来说,这是一个值得投入的技术栈。

ERNIE-Image Team