实验结果与性能分析#
本章系统梳理MiniT2I的模型规格、计算效率、评测基准结果、训练成本和消融实验结论,用数据展示极简架构的实际性能。
1. 模型规格与参数配置#
MiniT2I提供了不同规模的模型版本,B/16是主要基线模型,L/16是扩展大模型:
模型版本 |
去噪器参数量 |
总参数量(含文本编码器) |
Patch大小 |
Transformer层数 |
备注 |
|---|---|---|---|---|---|
MiniT2I-B/32 |
- |
- |
32×32 |
- |
用于消融实验的小规模模型 |
MiniT2I-B/16 |
258M |
~600M |
16×16 |
17层(MM-JiT) |
主要基线模型 |
MiniT2I-L/16 |
- |
912M |
16×16 |
- |
扩展大模型 |
SD3-Medium |
- |
~2B |
- |
- |
工业界对比基线 |
参数效率亮点:MiniT2I-B/16的去噪器仅258M参数,加上T5文本编码器总参数约600M,仅为SD3-Medium(~2B)的约30%。
2. 计算量对比#
移除VAE带来的最直接收益是计算量大幅降低:
配置 |
单步前向GFLOPs |
相对比例 |
说明 |
|---|---|---|---|
潜在空间模型(B/16,有VAE) |
~1379 |
100% |
含VAE编解码+潜在空间去噪 |
像素空间模型(B/16,无VAE) |
~570 |
41.3% |
直接像素空间去噪,成本降低58.7% |
序列长度分析#
对于512×512分辨率图像,使用16×16 patch划分得到:
(512/16) × (512/16) = 32 × 32 = 1024个图像patch token
这一序列长度完全在Transformer的处理舒适区内(对比LLM通常处理数千到数万token),无需依赖VAE进行压缩。
3. 核心评测基准结果#
GenEval评测#
GenEval评测文生图模型的核心能力,包括对象一致性、属性绑定、空间关系等:
模型 |
GenEval总分 |
参数量 |
备注 |
|---|---|---|---|
MiniT2I-B/16 |
0.87 |
~600M(含文本编码器) |
超越参数量3-4倍的同类像素空间模型 |
DPG-Bench评测#
DPG-Bench评测细粒度提示跟随能力和图像质量:
模型 |
DPG-Bench分数 |
参数量 |
备注 |
|---|---|---|---|
MiniT2I-B/16 |
84.2 |
~600M(含文本编码器) |
超越参数量3-4倍的同类像素空间模型 |
PRISM-Bench多维度评测#
PRISM-Bench提供细粒度的多维度能力评测,MiniT2I-L/16(912M参数)与SD3-Medium(~2B参数)对比:
评测维度 |
MiniT2I-L/16(912M) |
SD3-Medium(~2B) |
差距分析 |
|---|---|---|---|
风格(Style) |
79.9 |
接近水平 |
MiniT2I表现出色,与SD3相当 |
组合性(Composition) |
78.4 |
接近水平 |
空间关系和组合能力优秀 |
想象力(Imagination) |
57.9 |
相当甚至更优 |
在想象力场景上表现突出 |
文字渲染(Text Rendering) |
30.6 |
50.9 |
差距明显(低20.3分),公开数据缺乏文字专项标注 |
命名实体(Named Entity) |
60.3 |
66.3 |
存在差距(低6.0分),需要特定实体数据补强 |
关键结论:
MiniT2I-L/16在风格、组合性、想象力三个核心维度上接近甚至超越2B参数的SD3-Medium
在文字渲染和命名实体两个维度上存在明显差距,团队坦承这是公开数据配方的固有局限(数据瓶颈问题,详见第5章)
912M参数 vs ~2B参数,MiniT2I用不到一半的参数量在核心能力上达到可比水平
4. 训练成本数据#
MiniT2I的训练成本极低,这是其对学术研究最友好的特性之一:
模型版本 |
硬件配置 |
训练时间 |
总训练FLOPs对比 |
备注 |
|---|---|---|---|---|
MiniT2I-B/32(消融模型) |
8×H100 GPU |
~3天 |
与标准ImageNet 200 epoch实验相当 |
学术级算力即可完成 |
成本优势分析#
硬件门槛低:仅需8张H100即可在约3天内完成消融实验,完整模型训练成本也在学术实验室可承受范围内
数据成本低:全部使用公开数据集,无需私有数据爬取、清洗和标注流水线
流程简化:无VAE预训练阶段、无RL/DPO对齐阶段,训练流程端到端更简洁
可复现性强:全部数据和代码公开,任何研究者都可以复现结果
5. 消融实验核心结论#
消融实验(Ablation Study)是验证每个设计决策必要性的关键手段。
架构简化消融(AdaLN移除)#
配置 |
Transformer层数 |
FID分数 |
结论 |
|---|---|---|---|
有AdaLN(基线) |
12层 |
18.7 |
AdaLN占用参数预算,限制了网络深度 |
无AdaLN(MM-JiT) |
17层 |
13.7 |
移除AdaLN后用省出的预算增加5层,FID相对提升26.7% |
解读:AdaLN本身不是"坏"的设计,但它占用了宝贵的参数和计算预算。将这部分预算用于增加网络深度(更本质的能力提升),带来的收益远大于AdaLN条件注入本身的收益。
VAE消融(像素空间 vs 潜在空间)#
配置 |
单步GFLOPs |
FID分数 |
结论 |
|---|---|---|---|
潜在空间(有VAE) |
~1379 |
19.0 |
VAE解决高分辨率问题,但引入计算开销和重建误差 |
像素空间(无VAE) |
~570 |
18.7 |
512分辨率下像素空间更高效,FID持平,成本降低58.7% |
解读:在512分辨率、16×16 patch设置下,像素空间不仅计算成本更低,FID还略有优势(18.7 vs 19.0),VAE的重建误差确实引入了微小的质量损失。
6. 与SD3-Medium综合对比#
下表从多个维度全面对比MiniT2I与SD3-Medium:
对比维度 |
MiniT2I-B/16 |
MiniT2I-L/16 |
SD3-Medium |
|---|---|---|---|
去噪器参数量 |
258M |
- |
- |
总参数量(含文本编码器) |
~600M |
912M |
~2B |
参数规模对比 |
1×(基准) |
~1.5× |
~3.3× |
GenEval |
0.87 |
- |
- |
DPG-Bench |
84.2 |
- |
- |
PRISM-Bench风格 |
- |
79.9 |
接近MiniT2I水平 |
PRISM-Bench组合 |
- |
78.4 |
接近MiniT2I水平 |
PRISM-Bench想象力 |
- |
57.9 |
相当或更优 |
PRISM-Bench文字渲染 |
- |
30.6 |
50.9(+20.3) |
PRISM-Bench命名实体 |
- |
60.3 |
66.3(+6.0) |
VAE编解码器 |
❌ 无 |
❌ 无 |
✅ 有 |
AdaLN条件注入 |
❌ 无(MM-JiT) |
❌ 无(MM-JiT) |
✅ 有(MM-DiT) |
训练数据 |
✅ 全公开(CC12M+12万精选) |
✅ 全公开 |
❌ 工业级私有数据 |
RL/DPO对齐 |
❌ 无 |
❌ 无 |
✅ 有 |
单步GFLOPs(B/16) |
~570 |
- |
~1379(潜在空间) |
训练硬件 |
学术级(8×H100可完成消融) |
- |
工业级集群 |
训练成本 |
极低(B/32约3天@8×H100) |
- |
极高 |
架构复杂度 |
极简(标准Transformer) |
极简 |
复杂(定制化MM-DiT) |
可复现性 |
✅ 完全可复现 |
✅ 完全可复现 |
❌ 数据不公开难以复现 |
← 上一章 | 下一章:局限性与开放问题 →