ERNIE-Image 对决 HiDream-O1-Image:8B 像素原生 vs 8B 潜空间,两种开源路线的正面交锋
开源文生图走到 2026 年年中,出现了一个有趣的岔路口。一边是百度 ERNIE-Image 代表的"潜空间 DiT"路线:VAE 把图像压缩成小尺寸潜变量,扩散 Transformer 在压缩后的空间里工作,最后再解码回像素。另一边是 HiDream-O1-Image 代表的"像素原生"路线:直接对原始像素做扩散,连 VAE 和外部文本编码器都不要了。两条路线都是 8B 参数、都全开源、都能免费商用,但底层哲学截然不同。
这两款模型的先后发布只隔了三周(ERNIE-Image 4 月 14 日、HiDream-O1-Image 5 月 8 日),却在架构、协议、能力边界上给出了完全不同的答案。这篇文章把两者放在同一张桌上,从架构、文字渲染、组合生成、编辑能力、部署门槛五个维度做一次完整横评。

架构之争
ERNIE-Image 用的是业界最成熟的配方:单流 Diffusion Transformer,8B DiT 参数,配一个 3B 的 Prompt Enhancer。图像先被 VAE 压缩,扩散过程在潜空间完成。这个方案的好处是计算量小——扩散只发生在 1/64 空间分辨率上,24GB 显存的消费级显卡就能跑。
HiDream-O1-Image 走了一条更激进的路。它的 Pixel-level Unified Transformer(UiT)把像素 patch、文本 token、任务条件全部塞进同一个序列里,不做任何压缩。没有 VAE,意味着没有编码-解码的往返损耗;没有外部文本编码器,意味着文本和图像在同一套注意力机制里对齐。代价是每个 token 的计算量更大,官方用稀疏化和预定义时间步调度来补偿,Dev 版 28 步、CFG 0.0 即可收敛。

协议与许可
两款模型都允许商用,但宽松程度不同。ERNIE-Image 是 Apache-2.0,HiDream-O1-Image 是 MIT——MIT 更短更宽松,没有任何附加条款,改代码、闭源、再分发都不受限。对要把模型嵌进商业产品的团队来说,MIT 是"零顾虑"的选择;Apache-2.0 则多了明确的专利授权条款。实际使用中差异不大,但协议细节值得企业法务扫一眼。
文字渲染
文字渲染是这两款模型共同的强项,也是它们拉开与老一代模型差距的地方。在 LongText-Bench 上,HiDream-O1-Image 拿到 0.979(英文)/ 0.978(中文),ERNIE-Image 开 PE 时是 0.9804(英文)/ 0.9661(中文),平均 0.9733。两边的英文长文本渲染几乎打平,中文则是 HiDream 略占上风。

值得注意的是 HiDream 的 CVTG-2K 得分 0.9128,这个基准专门测试 2-5 个文字区域同时出现的复杂版面——海报、信息图、多格漫画这类场景。像素原生架构在"多个文字块 + 精确位置"的组合下确实有结构优势。
组合生成
组合生成测试的是模型能不能把多个对象、颜色、数量、位置关系一次性画对。GenEval 总分上,HiDream-O1-Image 0.90 略胜 ERNIE-Image 的 0.8856(关 PE 时)。有意思的是,ERNIE-Image 关掉 Prompt Enhancer 反而更准(0.8856 vs 0.8728)——PE 会改写提示词,改写过程可能丢掉精确的绑定关系。

编辑能力
这是差距最大的一项。HiDream-O1-Image 把文生图、指令编辑、主体个性化做进了同一套权重,GEdit 得分 7.60,与 16.8B 的 FLUX.1 Kontext、27B 的 Qwen-Image-Edit 相当。改墙壁材质、换灯光时间、替换家具,都能保持原有构图不变。
ERNIE-Image 这边,官方编辑模型截至 8 月仍未发布,社区只能靠 Qwen-Image-Edit 或 FLUX Kontext 组合出编辑管线。如果你需要开箱即用的编辑能力,HiDream 目前是更完整的答案;如果你接受"生成用 ERNIE + 编辑用别的模型"的组合方案,影响也可控。
上手指南
部署门槛上两者非常接近:ERNIE-Image 需要约 24GB 显存,HiDream-O1-Image 完整版约 20GB,官方推荐 A100/H100。都支持 Diffusers,ComfyUI 社区也都有现成工作流。
速度上 ERNIE-Image 有优势——Turbo 版只要 8 步、CFG 1.0,是当前最快的 8B 级开源模型之一;HiDream 的 Dev 蒸馏版需要 28 步。批量出图场景选 ERNIE Turbo,追求单张精修和编辑能力选 HiDream。
生态成熟度则是 ERNIE-Image 明显更广:SGLang、Unsloth GGUF 量化、OneTrainer、fal.ai、Replicate、SiliconFlow 都有现成支持;HiDream 目前主要靠官方仓库和 HF Space,第三方服务还在跟进中。

怎么选
一句话总结:要速度、要生态、要中文长文本,选 ERNIE-Image;要原生编辑、要像素级细节、要 MIT 零约束,选 HiDream-O1-Image。
具体场景建议:电商海报和漫画分镜这类"内容准确性优先"的任务,两者都合格,ERNIE 的生态能让你更快落地;影视概念设计和角色一致性工作流,HiDream 的原生编辑 + 主体个性化是更省事的方案;纯批量出图拼速度,ERNIE-Image-Turbo 没有对手。
两款模型的存在本身比胜负更有意义——它们证明了 8B 这个量级已经能同时满足"开源、商用、高质量"三个条件,也证明了通往高质量的路不止一条。潜空间和像素原生,接下来一年会持续碰撞出更多答案。