实验结果与性能分析#

本章系统梳理MiniT2I的模型规格、计算效率、评测基准结果、训练成本和消融实验结论,用数据展示极简架构的实际性能。


1. 模型规格与参数配置#

MiniT2I提供了不同规模的模型版本,B/16是主要基线模型,L/16是扩展大模型:

模型版本

去噪器参数量

总参数量(含文本编码器)

Patch大小

Transformer层数

备注

MiniT2I-B/32

-

-

32×32

-

用于消融实验的小规模模型

MiniT2I-B/16

258M

~600M

16×16

17层(MM-JiT)

主要基线模型

MiniT2I-L/16

-

912M

16×16

-

扩展大模型

SD3-Medium

-

~2B

-

-

工业界对比基线

参数效率亮点:MiniT2I-B/16的去噪器仅258M参数,加上T5文本编码器总参数约600M,仅为SD3-Medium(~2B)的约30%。


2. 计算量对比#

移除VAE带来的最直接收益是计算量大幅降低:

配置

单步前向GFLOPs

相对比例

说明

潜在空间模型(B/16,有VAE)

~1379

100%

含VAE编解码+潜在空间去噪

像素空间模型(B/16,无VAE)

~570

41.3%

直接像素空间去噪,成本降低58.7%

序列长度分析#

对于512×512分辨率图像,使用16×16 patch划分得到:

  • (512/16) × (512/16) = 32 × 32 = 1024个图像patch token

这一序列长度完全在Transformer的处理舒适区内(对比LLM通常处理数千到数万token),无需依赖VAE进行压缩。


3. 核心评测基准结果#

GenEval评测#

GenEval评测文生图模型的核心能力,包括对象一致性、属性绑定、空间关系等:

模型

GenEval总分

参数量

备注

MiniT2I-B/16

0.87

~600M(含文本编码器)

超越参数量3-4倍的同类像素空间模型

DPG-Bench评测#

DPG-Bench评测细粒度提示跟随能力和图像质量:

模型

DPG-Bench分数

参数量

备注

MiniT2I-B/16

84.2

~600M(含文本编码器)

超越参数量3-4倍的同类像素空间模型

PRISM-Bench多维度评测#

PRISM-Bench提供细粒度的多维度能力评测,MiniT2I-L/16(912M参数)与SD3-Medium(~2B参数)对比:

评测维度

MiniT2I-L/16(912M)

SD3-Medium(~2B)

差距分析

风格(Style)

79.9

接近水平

MiniT2I表现出色,与SD3相当

组合性(Composition)

78.4

接近水平

空间关系和组合能力优秀

想象力(Imagination)

57.9

相当甚至更优

在想象力场景上表现突出

文字渲染(Text Rendering)

30.6

50.9

差距明显(低20.3分),公开数据缺乏文字专项标注

命名实体(Named Entity)

60.3

66.3

存在差距(低6.0分),需要特定实体数据补强

关键结论

  • MiniT2I-L/16在风格、组合性、想象力三个核心维度上接近甚至超越2B参数的SD3-Medium

  • 文字渲染和命名实体两个维度上存在明显差距,团队坦承这是公开数据配方的固有局限(数据瓶颈问题,详见第5章)

  • 912M参数 vs ~2B参数,MiniT2I用不到一半的参数量在核心能力上达到可比水平


4. 训练成本数据#

MiniT2I的训练成本极低,这是其对学术研究最友好的特性之一:

模型版本

硬件配置

训练时间

总训练FLOPs对比

备注

MiniT2I-B/32(消融模型)

8×H100 GPU

~3天

与标准ImageNet 200 epoch实验相当

学术级算力即可完成

成本优势分析#

  1. 硬件门槛低:仅需8张H100即可在约3天内完成消融实验,完整模型训练成本也在学术实验室可承受范围内

  2. 数据成本低:全部使用公开数据集,无需私有数据爬取、清洗和标注流水线

  3. 流程简化:无VAE预训练阶段、无RL/DPO对齐阶段,训练流程端到端更简洁

  4. 可复现性强:全部数据和代码公开,任何研究者都可以复现结果


5. 消融实验核心结论#

消融实验(Ablation Study)是验证每个设计决策必要性的关键手段。

架构简化消融(AdaLN移除)#

配置

Transformer层数

FID分数

结论

有AdaLN(基线)

12层

18.7

AdaLN占用参数预算,限制了网络深度

无AdaLN(MM-JiT)

17层

13.7

移除AdaLN后用省出的预算增加5层,FID相对提升26.7%

解读:AdaLN本身不是"坏"的设计,但它占用了宝贵的参数和计算预算。将这部分预算用于增加网络深度(更本质的能力提升),带来的收益远大于AdaLN条件注入本身的收益。

VAE消融(像素空间 vs 潜在空间)#

配置

单步GFLOPs

FID分数

结论

潜在空间(有VAE)

~1379

19.0

VAE解决高分辨率问题,但引入计算开销和重建误差

像素空间(无VAE)

~570

18.7

512分辨率下像素空间更高效,FID持平,成本降低58.7%

解读:在512分辨率、16×16 patch设置下,像素空间不仅计算成本更低,FID还略有优势(18.7 vs 19.0),VAE的重建误差确实引入了微小的质量损失。


6. 与SD3-Medium综合对比#

下表从多个维度全面对比MiniT2I与SD3-Medium:

对比维度

MiniT2I-B/16

MiniT2I-L/16

SD3-Medium

去噪器参数量

258M

-

-

总参数量(含文本编码器)

~600M

912M

~2B

参数规模对比

1×(基准)

~1.5×

~3.3×

GenEval

0.87

-

-

DPG-Bench

84.2

-

-

PRISM-Bench风格

-

79.9

接近MiniT2I水平

PRISM-Bench组合

-

78.4

接近MiniT2I水平

PRISM-Bench想象力

-

57.9

相当或更优

PRISM-Bench文字渲染

-

30.6

50.9(+20.3)

PRISM-Bench命名实体

-

60.3

66.3(+6.0)

VAE编解码器

❌ 无

❌ 无

✅ 有

AdaLN条件注入

❌ 无(MM-JiT)

❌ 无(MM-JiT)

✅ 有(MM-DiT)

训练数据

✅ 全公开(CC12M+12万精选)

✅ 全公开

❌ 工业级私有数据

RL/DPO对齐

❌ 无

❌ 无

✅ 有

单步GFLOPs(B/16)

~570

-

~1379(潜在空间)

训练硬件

学术级(8×H100可完成消融)

-

工业级集群

训练成本

极低(B/32约3天@8×H100)

-

极高

架构复杂度

极简(标准Transformer)

极简

复杂(定制化MM-DiT)

可复现性

✅ 完全可复现

✅ 完全可复现

❌ 数据不公开难以复现


上一章 | 下一章:局限性与开放问题