N Neurarch Architectures Models Checks Data Docs Open the app

Models / bloom

bloomz-560m

Reconstructed from its own config.json with no weights read. 766K downloads on Hugging Face.

Our count against the checkpoint

The left number comes from the graph. The right one is the number of scalars in the published weight files. Nothing on this page was tuned to make them agree.

Derived from structure
364M
363,571,200 parameters
In the published checkpoint
559M
559,214,592 scalars · safetensors.total, read 2023-05-27
Delta
-35.0%

What it costs to run

Cost is a roofline estimate on the priced GPU for 10 epochs at batch 32 over 50,000 samples (assumed; no dataset attached). GPU fit is fp32 weights plus gradients plus two Adam moments (16 bytes per parameter) with 1.3x headroom; activations are not included and grow with batch size.

Layers
146
Will it forward-pass
Yes
Priced on
A10G (24GB)
Est. one run
$3.48
CardMemory
T4 (16GB)weights + activationsfits
A100 (40GB)weights + activationsfits
H100 (80GB)weights + activationsfits

Structure

148 nodes. Output shapes are propagated from the input shape, batch dimension excluded.

LayerTypeOutput shape
1InputInput1 × 512
2EmbeddingEmbedding1 × 512 × 768
3Positional_EmbeddingLearned Pos Embed1 × 512 × 768
4LayerNorm_1_1LayerNorm1 × 512 × 768
5Attention_1Multi-Head Attention1 × 512 × 768
6Add_1_attnAdd1 × 512 × 768
7LayerNorm_1_2LayerNorm1 × 512 × 768
8FFN_1Feed Forward1 × 512 × 768
9Add_1_ffnAdd1 × 512 × 768
10LayerNorm_2_1LayerNorm1 × 512 × 768
11Attention_2Multi-Head Attention1 × 512 × 768
12Add_2_attnAdd1 × 512 × 768
13LayerNorm_2_2LayerNorm1 × 512 × 768
14FFN_2Feed Forward1 × 512 × 768
15Add_2_ffnAdd1 × 512 × 768
16LayerNorm_3_1LayerNorm1 × 512 × 768
17Attention_3Multi-Head Attention1 × 512 × 768
18Add_3_attnAdd1 × 512 × 768
19LayerNorm_3_2LayerNorm1 × 512 × 768
20FFN_3Feed Forward1 × 512 × 768
21Add_3_ffnAdd1 × 512 × 768
22LayerNorm_4_1LayerNorm1 × 512 × 768
23Attention_4Multi-Head Attention1 × 512 × 768
24Add_4_attnAdd1 × 512 × 768
25LayerNorm_4_2LayerNorm1 × 512 × 768
26FFN_4Feed Forward1 × 512 × 768
27Add_4_ffnAdd1 × 512 × 768
28LayerNorm_5_1LayerNorm1 × 512 × 768
29Attention_5Multi-Head Attention1 × 512 × 768
30Add_5_attnAdd1 × 512 × 768
31LayerNorm_5_2LayerNorm1 × 512 × 768
32FFN_5Feed Forward1 × 512 × 768
33Add_5_ffnAdd1 × 512 × 768
34LayerNorm_6_1LayerNorm1 × 512 × 768
35Attention_6Multi-Head Attention1 × 512 × 768
36Add_6_attnAdd1 × 512 × 768
37LayerNorm_6_2LayerNorm1 × 512 × 768
38FFN_6Feed Forward1 × 512 × 768
39Add_6_ffnAdd1 × 512 × 768
40LayerNorm_7_1LayerNorm1 × 512 × 768
41Attention_7Multi-Head Attention1 × 512 × 768
42Add_7_attnAdd1 × 512 × 768
43LayerNorm_7_2LayerNorm1 × 512 × 768
44FFN_7Feed Forward1 × 512 × 768
45Add_7_ffnAdd1 × 512 × 768
46LayerNorm_8_1LayerNorm1 × 512 × 768
47Attention_8Multi-Head Attention1 × 512 × 768
48Add_8_attnAdd1 × 512 × 768
49LayerNorm_8_2LayerNorm1 × 512 × 768
50FFN_8Feed Forward1 × 512 × 768
51Add_8_ffnAdd1 × 512 × 768
52LayerNorm_9_1LayerNorm1 × 512 × 768
53Attention_9Multi-Head Attention1 × 512 × 768
54Add_9_attnAdd1 × 512 × 768
55LayerNorm_9_2LayerNorm1 × 512 × 768
56FFN_9Feed Forward1 × 512 × 768
57Add_9_ffnAdd1 × 512 × 768
58LayerNorm_10_1LayerNorm1 × 512 × 768
59Attention_10Multi-Head Attention1 × 512 × 768
60Add_10_attnAdd1 × 512 × 768
61LayerNorm_10_2LayerNorm1 × 512 × 768
62FFN_10Feed Forward1 × 512 × 768
63Add_10_ffnAdd1 × 512 × 768
64LayerNorm_11_1LayerNorm1 × 512 × 768
65Attention_11Multi-Head Attention1 × 512 × 768
66Add_11_attnAdd1 × 512 × 768
67LayerNorm_11_2LayerNorm1 × 512 × 768
68FFN_11Feed Forward1 × 512 × 768
69Add_11_ffnAdd1 × 512 × 768
70LayerNorm_12_1LayerNorm1 × 512 × 768
71Attention_12Multi-Head Attention1 × 512 × 768
72Add_12_attnAdd1 × 512 × 768
73LayerNorm_12_2LayerNorm1 × 512 × 768
74FFN_12Feed Forward1 × 512 × 768
75Add_12_ffnAdd1 × 512 × 768
76LayerNorm_13_1LayerNorm1 × 512 × 768
77Attention_13Multi-Head Attention1 × 512 × 768
78Add_13_attnAdd1 × 512 × 768
79LayerNorm_13_2LayerNorm1 × 512 × 768
80FFN_13Feed Forward1 × 512 × 768
81Add_13_ffnAdd1 × 512 × 768
82LayerNorm_14_1LayerNorm1 × 512 × 768
83Attention_14Multi-Head Attention1 × 512 × 768
84Add_14_attnAdd1 × 512 × 768
85LayerNorm_14_2LayerNorm1 × 512 × 768
86FFN_14Feed Forward1 × 512 × 768
87Add_14_ffnAdd1 × 512 × 768
88LayerNorm_15_1LayerNorm1 × 512 × 768
89Attention_15Multi-Head Attention1 × 512 × 768
90Add_15_attnAdd1 × 512 × 768
91LayerNorm_15_2LayerNorm1 × 512 × 768
92FFN_15Feed Forward1 × 512 × 768
93Add_15_ffnAdd1 × 512 × 768
94LayerNorm_16_1LayerNorm1 × 512 × 768
95Attention_16Multi-Head Attention1 × 512 × 768
96Add_16_attnAdd1 × 512 × 768
97LayerNorm_16_2LayerNorm1 × 512 × 768
98FFN_16Feed Forward1 × 512 × 768
99Add_16_ffnAdd1 × 512 × 768
100LayerNorm_17_1LayerNorm1 × 512 × 768
101Attention_17Multi-Head Attention1 × 512 × 768
102Add_17_attnAdd1 × 512 × 768
103LayerNorm_17_2LayerNorm1 × 512 × 768
104FFN_17Feed Forward1 × 512 × 768
105Add_17_ffnAdd1 × 512 × 768
106LayerNorm_18_1LayerNorm1 × 512 × 768
107Attention_18Multi-Head Attention1 × 512 × 768
108Add_18_attnAdd1 × 512 × 768
109LayerNorm_18_2LayerNorm1 × 512 × 768
110FFN_18Feed Forward1 × 512 × 768
111Add_18_ffnAdd1 × 512 × 768
112LayerNorm_19_1LayerNorm1 × 512 × 768
113Attention_19Multi-Head Attention1 × 512 × 768
114Add_19_attnAdd1 × 512 × 768
115LayerNorm_19_2LayerNorm1 × 512 × 768
116FFN_19Feed Forward1 × 512 × 768
117Add_19_ffnAdd1 × 512 × 768
118LayerNorm_20_1LayerNorm1 × 512 × 768
119Attention_20Multi-Head Attention1 × 512 × 768
120Add_20_attnAdd1 × 512 × 768
121LayerNorm_20_2LayerNorm1 × 512 × 768
122FFN_20Feed Forward1 × 512 × 768
123Add_20_ffnAdd1 × 512 × 768
124LayerNorm_21_1LayerNorm1 × 512 × 768
125Attention_21Multi-Head Attention1 × 512 × 768
126Add_21_attnAdd1 × 512 × 768
127LayerNorm_21_2LayerNorm1 × 512 × 768
128FFN_21Feed Forward1 × 512 × 768
129Add_21_ffnAdd1 × 512 × 768
130LayerNorm_22_1LayerNorm1 × 512 × 768
131Attention_22Multi-Head Attention1 × 512 × 768
132Add_22_attnAdd1 × 512 × 768
133LayerNorm_22_2LayerNorm1 × 512 × 768
134FFN_22Feed Forward1 × 512 × 768
135Add_22_ffnAdd1 × 512 × 768
136LayerNorm_23_1LayerNorm1 × 512 × 768
137Attention_23Multi-Head Attention1 × 512 × 768
138Add_23_attnAdd1 × 512 × 768
139LayerNorm_23_2LayerNorm1 × 512 × 768
140FFN_23Feed Forward1 × 512 × 768
141Add_23_ffnAdd1 × 512 × 768
142LayerNorm_24_1LayerNorm1 × 512 × 768
143Attention_24Multi-Head Attention1 × 512 × 768
144Add_24_attnAdd1 × 512 × 768
145LayerNorm_24_2LayerNorm1 × 512 × 768
146FFN_24Feed Forward1 × 512 × 768
147Add_24_ffnAdd1 × 512 × 768
148OutputOutput1 × 512 × 768

What the verifier says

infoAt 24 stacked attention layers, residual-branch outputs add up; unscaled init lets activation variance grow with depth. GPT-2/LLaMA-family models scale the residual projections by depth (N(0, 0.02 / √(2L))). Fix: Scale residual output projections by depth: nn.init.normal_(w, std=0.02 / math.sqrt(2 * n_layers))
deep-attention-default-init

Do this to your own model

Same numbers, on a model in your repo, in one command. No account.

pip install neurarch-trace
neurarch-trace bigscience/bloomz-560m --plan --share