ERNIE-Image 对决 Krea 2:8B 全开源 vs 12B 创作探索引擎,文字渲染与风格多样性的正面对决
2026 年 6 月 22 日深夜,Krea 在 Hugging Face 上架了两个 12B 参数的权重文件,附带的许可协议却让整个开源社区反复读了三遍——"50 个席位以下免费商用,50 个席位以上请找我们谈企业许可"。这不是 Apache 2.0,也不是非商用门控,而是一条夹在两者之间的第三条路。三个月前,百度刚用 Apache 2.0 把 ERNIE-Image 的 8B 权重彻底放开;如今 Krea 2 带着"为创意探索而生"的口号入场,开源文生图第一次出现了两种截然不同的"开放哲学"正面相撞。
两个模型都是单流 DiT 架构,都在 2026 年上半年开源,都宣称自己是"效率型"模型。但 ERNIE-Image 把宝押在文字渲染和指令遵循上——海报、漫画、多语言排版;Krea 2 把宝押在风格多样性和探索性上——让创作者在广阔的视觉分布里找到"意料之外"的那张图。对想要选择开源文生图模型的团队来说,这不再是一道"哪个更好"的题,而是一道"你想要什么"的题。

架构对比:同是单流 DiT,两种设计哲学
ERNIE-Image 的架构是一条"紧凑 + 增强"路线:8B 单流 DiT 主干,搭配 3B Prompt Enhancer(PE)把简短输入扩写成结构化描述,SFT 版 50 步推理、Turbo 版 8 步。它把参数省下来,靠外部增强器补齐指令理解。
Krea 2 则把 LLM 生态的成熟设计整体搬进了扩散模型。12B 单流 MMDiT,文本和图像 token 共享权重;注意力用 GQA + gated sigmoid attention(训练更稳定),MLP 换成 SwiGLU,归一化用 zero-centered RMSNorm + QKNorm,文本编码器直接从 T5-XXL 换成了 Qwen3-VL。最激进的改动是时间调制:把传统占参数 20-30% 的 per-block MLP 换成轻量 bias 项,省下的参数全部重投到注意力层和 MLP 层。

两条路线没有对错:ERNIE-Image 用 8B 打出了接近 20B 模型的成绩单,Krea 2 用 12B 换来了更广的风格覆盖。参数规模上两者同属"效率型"档位,都远小于 Qwen-Image(20B)和 FLUX.2 [dev](32B)。
数据哲学:Krea 2 的"反向操作"最值得玩味
Krea 2 技术报告里最反直觉的一句话是:他们拒绝用美学评分模型过滤数据。理由是这类过滤器自带隐性偏见——运动模糊可能是刻意的艺术表达,却被 IQA 模型当成低质量样本丢掉。更激进的是,他们把 AI 生成图片完全排除在训练数据之外,理由是"合成图片太好学了,哪怕只占一小部分,也会给输出分布引入偏见,相当于给模型质量设了上限"。
为此 Krea 团队自建了一套过滤管线:用大 VLM 生成伪标签,训练小于 1B 参数的 DINOv3/SigLIP-2 分类器做规模化筛查;caption 则走三阶段管线(OCR 提取文字 → caption 模型融合相机参数和实体知识 → 便宜 LLM 重排成长短多种格式)。他们还用 PageRank 扫了英语维基百科 top 90% 的条目,全文检索约 500 万个概念,稀有概念优先采样——目标是让模型"你叫得上名字的东西,它都画得出来"。

ERNIE-Image 走的是更务实的路线:高质量 SFT 数据 + 指令微调,配合 PE 增强,在 GenEval(0.8856,开源第一)和 LongTextBench(0.9733,开源第一)上交出了可量化的成绩单。两种数据哲学谁更优,短期看 benchmark,长期看社区的实际产出。
快速上手:两条部署路径
两个模型都进了主流部署栈。ERNIE-Image 在 ComfyUI 搜索节点即可加载,权重走 Hugging Face 自动下载,24GB 显存消费级显卡可跑;官方还提供 Diffusers Pipeline、SGLang 服务和 AI Studio 在线 Demo,生态覆盖 fal.ai、Replicate、SiliconFlow、CivitAI 等平台。
Krea 2 的 Raw 版官方明确标注"不建议直接推理"——它是给 LoRA 训练和微调用的基座;日常生成请用 Turbo 版。推理参数:Raw 52 步 CFG 3.5,Turbo 8 步原生 2K,消费级硬件约 2 秒出图。三种调用方式:
# 官方代码库(Raw)
uv run inference.py "a fox walking in the snow" --checkpoint oss_raw --steps 52 --cfg 3.5
Diffusers
pipe = Krea2Pipeline.from_pretrained("krea/Krea-2-Raw", torch_dtype=torch.bfloat16)
pipe("a fox in the snow", num_inference_steps=52, guidance_scale=3.5).images[0]
SGLang
sglang generate --model-path krea/Krea-2-Raw --prompt "a red fox sitting in fresh snow"
--num-inference-steps 52 --height 1024 --width 1024 --guidance-scale 3.5 --save-output

注意 Krea 2 在 Hugging Face 上是门控模型:下载前必须登录、同意 Community License 和可接受使用政策(AUP)。ERNIE-Image 则无需任何门槛,点开即下。
许可证对比:Apache 2.0 vs 50 席位门槛
这是两个模型最根本的分野,直接决定你能拿它做什么。
ERNIE-Image 是 Apache 2.0:权重、代码、训练细节全开放,商用、修改、再分发零限制,可以放心集成进商业产品。这也是它能在 CivitAI、AMD Day-0、OpenVINO、Krita 等生态快速铺开的原因——没有任何法律摩擦。
Krea 2 采用自研 Community License:50 个席位(seat)以下免费商用——个人、自由职业者、小型工作室无需付费、无需谈判、无按生成量计费;但一旦超过 50 席位,或需要 SSO 集成、自定义 SLA、数据处理协议(DPA),就必须联系 Krea 谈企业许可。此外许可要求部署方必须实施内容过滤措施(针对 CSAM、未经同意的私密影像、诽谤性内容),未落实即违约。
| 维度 | ERNIE-Image | Krea 2 |
|---|---|---|
| 参数 | 8B DiT + 3B PE | 12B MMDiT |
| 发布 | 2026-04-15 | 2026-06-22/23 |
| 权重许可 | Apache 2.0(全开放) | Community License(<50 席位免费商用) |
| HF 分发 | 无需登录 | 门控(登录 + 同意许可) |
| 文本编码器 | Ministral 3B(PE 用) | Qwen3-VL |
| 推理步数 | 50 步 / Turbo 8 步 | Raw 52 步 / Turbo 8 步 |
| 原生分辨率 | 1024 多比例 | Turbo 原生 2K |
| 数据策略 | SFT + PE 增强 | 排除 AI 图、拒绝美学过滤 |
| 中文支持 | 原生强项(LongTextBench ZH 0.9661) | 多语言,英文生态为主 |
文字渲染:ERNIE-Image 的护城河
文字渲染是 ERNIE-Image 相对 Krea 2 最明确的优势区。LongTextBench 上 EN 0.9804 / ZH 0.9661(平均 0.9733,w/ PE)拿下开源第一,其中中文长文本渲染是它相对绝大多数国际模型的独门武器——海报标题、包装文案、漫画对话气泡,中文都能渲染得整整齐齐。
Krea 2 的官方报告没有公布文字渲染专项 benchmark,其优势集中在风格多样性、摄影真实感和"探索性"上。官方示例里大量是建筑、广告、汽车、游戏资产等风格化输出,而非密集文字排版。如果你做的是中文海报、信息图、电商主图文案,ERNIE-Image 依然是更稳的选择;如果追求的是风格广度,Krea 2 的多样性是加分项。

控制方式:PE 扩写 vs 提示词扩展器 + 风格参考
ERNIE-Image 的控制体系是"自然语言 + PE":3B PE 把简短输入扩写成结构化描述,模型靠强指令遵循执行复杂要求。官方示例里,一句包含位置、关系、排版要求的自然语言就能生成规整海报。
Krea 2 的控制体系是双通道:提示词扩展器(文本通道,把简单 prompt 扩展成多种方向)+ 风格参考系统(图像通道,用参考图指定风格)。技术报告明确提出"探索三支柱":高表现力基座模型 + 参考系统 + 扩展系统——"只有当用户能在广阔分布里可靠到达目标区域,强大的基座模型才有意义"。
对创作者来说:ERNIE-Image 适合"我说你画"的确定性产出(电商图、海报、漫画分镜),Krea 2 适合"给我看看还有什么可能"的探索式创作(moodboard、概念设计、风格试验)。Krea 官方在 Hacker News 上透露,moodboarding 场景内部使用量已超过 Nano Banana,价格便宜 4 倍。
生态成熟度:ERNIE-Image 领先,Krea 2 追赶
ERNIE-Image 开源四个月,生态已经铺得很开:ComfyUI 官方节点、CivitAI 原生 LoRA 训练(1000 Buzz)、SGLang Diffusion + Cache-DiT 最高 9x 加速、AMD Day-0 支持、OpenVINO、Krita 插件、fal.ai/Replicate 无服务器 API、mflux Apple Silicon 推理。
Krea 2 开源仅一个多月,但基础设施跟进很快:官方代码库、Diffusers Krea2Pipeline、SGLang cookbook、官方 LoRA 集合(Raw 上训练 → Turbo 上应用,训练好的 LoRA 直接提升 Turbo 的生成一致性)。12B 的 LoRA 训练需要专业工作站或云算力,这一点比 ERNIE-Image(消费级可训)门槛更高。

怎么选:一道"你想要什么"的题
| 场景 | 推荐 | 理由 |
|---|---|---|
| 中文海报/包装/漫画 | ERNIE-Image | LongTextBench ZH 0.9661,中文文字渲染开源最强 |
| 需要商用且不想读许可 | ERNIE-Image | Apache 2.0 零限制 |
| 团队 >50 人商用部署 | ERNIE-Image | Krea 2 需企业许可谈判 |
| moodboard/概念探索 | Krea 2 | 风格多样性 + 参考系统 + 扩展器 |
| 摄影写实风格广度 | Krea 2 | 12B 参数 + 无美学过滤的数据多样性 |
| 低显存本地部署 | ERNIE-Image | 8B + GGUF 量化,消费级可跑 |
| LoRA 训练生态 | ERNIE-Image | CivitAI 原生训练 1000 Buzz 起 |
一句话总结:ERNIE-Image 是"全开放 + 确定性"的代表——Apache 2.0 零摩擦、中文文字渲染开源第一、生态成熟;Krea 2 是"半开放 + 探索性"的代表——50 席位免费商用、风格广度突出、参考系统独特,但许可有门槛、中文生态待观察。 对中文内容团队,ERNIE-Image 依然是首选;对追求风格探索的英文创作者,Krea 2 值得一试。两个都开源,最好的答案可能是——都留着,按场景切换。
发布信息