N Neurarch Architectures Models Checks Data Docs Open the app

Comparisons / ViT-B/16 vs DiT-XL/2

ViT-B/16 vs DiT-XL/2

A vision transformer against a diffusion transformer.

DiT-XL/2 has 662M more parameters than ViT-B/16: 192 layers added, 1 removed, 9 changed.

Baseline

ViT-B/16

Layers
11
Parameters
8.4M
Input
3 × 224 × 224
Output
196 × 1000
Forward-passes
yes
Est. train cost
$0.105
Compared

DiT-XL/2

Layers
201
Parameters
671M
Input
4 × 32 × 32
Output
256 × 32
Forward-passes
yes
Est. train cost
$4.41

The deltas

Every number is DiT-XL/2 relative to ViT-B/16.

Parameters
+662M (79× the size)
Layers
+190
Added
192
Removed
1
Changed
9
Unchanged
3

Which GPUs each one fits

Each side is measured at its own declared input (3 × 224 × 224 against 4 × 32 × 32). Both columns are right about their own model; the difference between them is not a fact about the designs.

GPUViT-B/16DiT-XL/2
T4 16GBfitsfits
A100 40GBfitsfits
H100 80GBfitsfits

Layer by layer

Aligned in topological order. 3 of 205 rows are the same layer with the same parameters.

Show all 205 rows
ViT-B/16DiT-XL/2
LayerParamsOutputLayerParamsOutput
1addednoisy_latent
Input
4 × 32 × 32
2changed
shape
image
Input
3 × 224 × 224timestep_+_class
Input
1 × 2
3changed
imgSize, patchSize, inChans, embedDim
patch_embed
Patch Embed
591K196 × 768patchify_2x2
Patch Embed
20K256 × 1152
4addedcond_embed
Embedding
1.2M1 × 2 × 1152
5changed
maxLen, embedDim
pos_embed
Positional Encoding
196 × 768pos_embed
Positional Encoding
256 × 1152
6removeddropout
Dropout
196 × 768
7addedadaLN_1
Linear
8.0M1 × 2 × 6912
8addedadaLN_2
Linear
8.0M1 × 2 × 6912
9addedadaLN_3
Linear
8.0M1 × 2 × 6912
10addedadaLN_4
Linear
8.0M1 × 2 × 6912
11addedadaLN_5
Linear
8.0M1 × 2 × 6912
12addedadaLN_6
Linear
8.0M1 × 2 × 6912
13addedadaLN_7
Linear
8.0M1 × 2 × 6912
14addedadaLN_8
Linear
8.0M1 × 2 × 6912
15addedadaLN_9
Linear
8.0M1 × 2 × 6912
16addedadaLN_10
Linear
8.0M1 × 2 × 6912
17addedadaLN_11
Linear
8.0M1 × 2 × 6912
18addedadaLN_12
Linear
8.0M1 × 2 × 6912
19addedadaLN_13
Linear
8.0M1 × 2 × 6912
20addedadaLN_14
Linear
8.0M1 × 2 × 6912
21addedadaLN_15
Linear
8.0M1 × 2 × 6912
22addedadaLN_16
Linear
8.0M1 × 2 × 6912
23addedadaLN_17
Linear
8.0M1 × 2 × 6912
24addedadaLN_18
Linear
8.0M1 × 2 × 6912
25addedadaLN_19
Linear
8.0M1 × 2 × 6912
26addedadaLN_20
Linear
8.0M1 × 2 × 6912
27addedadaLN_21
Linear
8.0M1 × 2 × 6912
28addedadaLN_22
Linear
8.0M1 × 2 × 6912
29addedadaLN_23
Linear
8.0M1 × 2 × 6912
30addedadaLN_24
Linear
8.0M1 × 2 × 6912
31addedadaLN_25
Linear
8.0M1 × 2 × 6912
32addedadaLN_26
Linear
8.0M1 × 2 × 6912
33addedadaLN_27
Linear
8.0M1 × 2 × 6912
34addedadaLN_28
Linear
8.0M1 × 2 × 6912
35addednorm1_1
Layer Norm
2.3K256 × 1152
36addedself_attn_1
Multi Head Attention
5.3M256 × 1152
37addedresidual1_1
Add
256 × 1152
38addednorm2_1
Layer Norm
2.3K256 × 1152
39addedmlp_1
Feed Forward
11M256 × 1152
40addedresidual2_1
Add
256 × 1152
41addednorm1_2
Layer Norm
2.3K256 × 1152
42addedself_attn_2
Multi Head Attention
5.3M256 × 1152
43addedresidual1_2
Add
256 × 1152
44addednorm2_2
Layer Norm
2.3K256 × 1152
45addedmlp_2
Feed Forward
11M256 × 1152
46addedresidual2_2
Add
256 × 1152
47addednorm1_3
Layer Norm
2.3K256 × 1152
48addedself_attn_3
Multi Head Attention
5.3M256 × 1152
49addedresidual1_3
Add
256 × 1152
50addednorm2_3
Layer Norm
2.3K256 × 1152
51addedmlp_3
Feed Forward
11M256 × 1152
52addedresidual2_3
Add
256 × 1152
53addednorm1_4
Layer Norm
2.3K256 × 1152
54addedself_attn_4
Multi Head Attention
5.3M256 × 1152
55addedresidual1_4
Add
256 × 1152
56addednorm2_4
Layer Norm
2.3K256 × 1152
57addedmlp_4
Feed Forward
11M256 × 1152
58addedresidual2_4
Add
256 × 1152
59addednorm1_5
Layer Norm
2.3K256 × 1152
60addedself_attn_5
Multi Head Attention
5.3M256 × 1152
61addedresidual1_5
Add
256 × 1152
62addednorm2_5
Layer Norm
2.3K256 × 1152
63addedmlp_5
Feed Forward
11M256 × 1152
64addedresidual2_5
Add
256 × 1152
65addednorm1_6
Layer Norm
2.3K256 × 1152
66addedself_attn_6
Multi Head Attention
5.3M256 × 1152
67addedresidual1_6
Add
256 × 1152
68addednorm2_6
Layer Norm
2.3K256 × 1152
69addedmlp_6
Feed Forward
11M256 × 1152
70addedresidual2_6
Add
256 × 1152
71addednorm1_7
Layer Norm
2.3K256 × 1152
72addedself_attn_7
Multi Head Attention
5.3M256 × 1152
73addedresidual1_7
Add
256 × 1152
74addednorm2_7
Layer Norm
2.3K256 × 1152
75addedmlp_7
Feed Forward
11M256 × 1152
76addedresidual2_7
Add
256 × 1152
77addednorm1_8
Layer Norm
2.3K256 × 1152
78addedself_attn_8
Multi Head Attention
5.3M256 × 1152
79addedresidual1_8
Add
256 × 1152
80addednorm2_8
Layer Norm
2.3K256 × 1152
81addedmlp_8
Feed Forward
11M256 × 1152
82addedresidual2_8
Add
256 × 1152
83addednorm1_9
Layer Norm
2.3K256 × 1152
84addedself_attn_9
Multi Head Attention
5.3M256 × 1152
85addedresidual1_9
Add
256 × 1152
86addednorm2_9
Layer Norm
2.3K256 × 1152
87addedmlp_9
Feed Forward
11M256 × 1152
88addedresidual2_9
Add
256 × 1152
89addednorm1_10
Layer Norm
2.3K256 × 1152
90addedself_attn_10
Multi Head Attention
5.3M256 × 1152
91addedresidual1_10
Add
256 × 1152
92addednorm2_10
Layer Norm
2.3K256 × 1152
93addedmlp_10
Feed Forward
11M256 × 1152
94addedresidual2_10
Add
256 × 1152
95addednorm1_11
Layer Norm
2.3K256 × 1152
96addedself_attn_11
Multi Head Attention
5.3M256 × 1152
97addedresidual1_11
Add
256 × 1152
98addednorm2_11
Layer Norm
2.3K256 × 1152
99addedmlp_11
Feed Forward
11M256 × 1152
100addedresidual2_11
Add
256 × 1152
101addednorm1_12
Layer Norm
2.3K256 × 1152
102addedself_attn_12
Multi Head Attention
5.3M256 × 1152
103addedresidual1_12
Add
256 × 1152
104addednorm2_12
Layer Norm
2.3K256 × 1152
105addedmlp_12
Feed Forward
11M256 × 1152
106addedresidual2_12
Add
256 × 1152
107addednorm1_13
Layer Norm
2.3K256 × 1152
108addedself_attn_13
Multi Head Attention
5.3M256 × 1152
109addedresidual1_13
Add
256 × 1152
110addednorm2_13
Layer Norm
2.3K256 × 1152
111addedmlp_13
Feed Forward
11M256 × 1152
112addedresidual2_13
Add
256 × 1152
113addednorm1_14
Layer Norm
2.3K256 × 1152
114addedself_attn_14
Multi Head Attention
5.3M256 × 1152
115addedresidual1_14
Add
256 × 1152
116addednorm2_14
Layer Norm
2.3K256 × 1152
117addedmlp_14
Feed Forward
11M256 × 1152
118addedresidual2_14
Add
256 × 1152
119addednorm1_15
Layer Norm
2.3K256 × 1152
120addedself_attn_15
Multi Head Attention
5.3M256 × 1152
121addedresidual1_15
Add
256 × 1152
122addednorm2_15
Layer Norm
2.3K256 × 1152
123addedmlp_15
Feed Forward
11M256 × 1152
124addedresidual2_15
Add
256 × 1152
125addednorm1_16
Layer Norm
2.3K256 × 1152
126addedself_attn_16
Multi Head Attention
5.3M256 × 1152
127addedresidual1_16
Add
256 × 1152
128addednorm2_16
Layer Norm
2.3K256 × 1152
129addedmlp_16
Feed Forward
11M256 × 1152
130addedresidual2_16
Add
256 × 1152
131addednorm1_17
Layer Norm
2.3K256 × 1152
132addedself_attn_17
Multi Head Attention
5.3M256 × 1152
133addedresidual1_17
Add
256 × 1152
134addednorm2_17
Layer Norm
2.3K256 × 1152
135addedmlp_17
Feed Forward
11M256 × 1152
136addedresidual2_17
Add
256 × 1152
137addednorm1_18
Layer Norm
2.3K256 × 1152
138addedself_attn_18
Multi Head Attention
5.3M256 × 1152
139addedresidual1_18
Add
256 × 1152
140addednorm2_18
Layer Norm
2.3K256 × 1152
141addedmlp_18
Feed Forward
11M256 × 1152
142addedresidual2_18
Add
256 × 1152
143addednorm1_19
Layer Norm
2.3K256 × 1152
144addedself_attn_19
Multi Head Attention
5.3M256 × 1152
145addedresidual1_19
Add
256 × 1152
146addednorm2_19
Layer Norm
2.3K256 × 1152
147addedmlp_19
Feed Forward
11M256 × 1152
148addedresidual2_19
Add
256 × 1152
149addednorm1_20
Layer Norm
2.3K256 × 1152
150addedself_attn_20
Multi Head Attention
5.3M256 × 1152
151addedresidual1_20
Add
256 × 1152
152addednorm2_20
Layer Norm
2.3K256 × 1152
153addedmlp_20
Feed Forward
11M256 × 1152
154addedresidual2_20
Add
256 × 1152
155addednorm1_21
Layer Norm
2.3K256 × 1152
156addedself_attn_21
Multi Head Attention
5.3M256 × 1152
157addedresidual1_21
Add
256 × 1152
158addednorm2_21
Layer Norm
2.3K256 × 1152
159addedmlp_21
Feed Forward
11M256 × 1152
160addedresidual2_21
Add
256 × 1152
161addednorm1_22
Layer Norm
2.3K256 × 1152
162addedself_attn_22
Multi Head Attention
5.3M256 × 1152
163addedresidual1_22
Add
256 × 1152
164addednorm2_22
Layer Norm
2.3K256 × 1152
165addedmlp_22
Feed Forward
11M256 × 1152
166addedresidual2_22
Add
256 × 1152
167addednorm1_23
Layer Norm
2.3K256 × 1152
168addedself_attn_23
Multi Head Attention
5.3M256 × 1152
169addedresidual1_23
Add
256 × 1152
170addednorm2_23
Layer Norm
2.3K256 × 1152
171addedmlp_23
Feed Forward
11M256 × 1152
172addedresidual2_23
Add
256 × 1152
173addednorm1_24
Layer Norm
2.3K256 × 1152
174addedself_attn_24
Multi Head Attention
5.3M256 × 1152
175addedresidual1_24
Add
256 × 1152
176addednorm2_24
Layer Norm
2.3K256 × 1152
177addedmlp_24
Feed Forward
11M256 × 1152
178addedresidual2_24
Add
256 × 1152
179addednorm1_25
Layer Norm
2.3K256 × 1152
180addedself_attn_25
Multi Head Attention
5.3M256 × 1152
181addedresidual1_25
Add
256 × 1152
182addednorm2_25
Layer Norm
2.3K256 × 1152
183addedmlp_25
Feed Forward
11M256 × 1152
184addedresidual2_25
Add
256 × 1152
185addednorm1_26
Layer Norm
2.3K256 × 1152
186addedself_attn_26
Multi Head Attention
5.3M256 × 1152
187addedresidual1_26
Add
256 × 1152
188addednorm2_26
Layer Norm
2.3K256 × 1152
189addedmlp_26
Feed Forward
11M256 × 1152
190addedresidual2_26
Add
256 × 1152
191addednorm1_27
Layer Norm
2.3K256 × 1152
192addedself_attn_27
Multi Head Attention
5.3M256 × 1152
193addedresidual1_27
Add
256 × 1152
194addednorm2_27
Layer Norm
2.3K256 × 1152
195addedmlp_27
Feed Forward
11M256 × 1152
196addedresidual2_27
Add
256 × 1152
197changed
normalizedShape
norm_1
Layer Norm
1.5K196 × 768norm1_28
Layer Norm
2.3K256 × 1152
198changed
embedDim, numHeads
attn
Multi Head Attention
2.4M196 × 768self_attn_28
Multi Head Attention
5.3M256 × 1152
199sameresidual_1
Add
196 × 768residual1_28
Add
256 × 1152
200changed
normalizedShape
norm_2
Layer Norm
1.5K196 × 768norm2_28
Layer Norm
2.3K256 × 1152
201changed
hiddenDim, ffDim, embedDim
mlp
Feed Forward
4.7M196 × 768mlp_28
Feed Forward
11M256 × 1152
202sameresidual_2
Add
196 × 768residual2_28
Add
256 × 1152
203changed
normalizedShape
norm_final
Layer Norm
1.5K196 × 768final_norm
Layer Norm
2.3K256 × 1152
204changed
outFeatures, inFeatures
head
Linear
196 × 1000unpatchify
Linear
37K256 × 32
205sameclass_logits
Output
196 × 1000predicted_noise
Output
256 × 32

What this is not

Take it further

Open either graph in the editor, change it, and check it again: ViT-B/16 · DiT-XL/2

Compare any two models of your own, including anything on Hugging Face: the comparison tool.

Machine-readable: this page as markdown · the pair index · POST https://www.neurarch.com/api/v1/plan for a graph of your own.

Related comparisons

ResNet Block vs ViT-B/16
Convolution against attention for images.
ViT-B/16 vs Swin-Tiny
A flat vision transformer against a hierarchical one.
BERT Base vs ViT-B/16
The same transformer applied to text and to images.
Diffusion UNet vs DiT-XL/2
Convolutional against transformer backbones for diffusion.