N Neurarch Architectures Models Checks Data Docs Open the app

Models / esm

esm2_t33_650M_UR50D

Reconstructed from its own config.json with no weights read. 1.4M downloads on Hugging Face.

Our count against the checkpoint

The left number comes from the graph. The right one is the number of scalars in the published weight files. Nothing on this page was tuned to make them agree.

Derived from structure
651M
650,626,560 parameters
In the published checkpoint
652M
652,358,616 scalars · safetensors.total, read 2026-09-06
Delta
-0.27%

What it costs to run

Cost is a roofline estimate on the priced GPU for 10 epochs at batch 32 over 50,000 samples (assumed; no dataset attached). GPU fit is fp32 weights plus gradients plus two Adam moments (16 bytes per parameter) with 1.3x headroom; activations are not included and grow with batch size.

Layers
134
Will it forward-pass
Yes
Priced on
A10G (24GB)
Est. one run
$26.62
CardMemory
T4 (16GB)weights + activationsfits
A100 (40GB)weights + activationsfits
H100 (80GB)weights + activationsfits

Structure

136 nodes. Output shapes are propagated from the input shape, batch dimension excluded.

LayerTypeOutput shape
1InputInput1 × 1026
2EmbeddingEmbedding1 × 1026 × 1280
3Positional_EmbeddingLearned Pos Embed1 × 1026 × 1280
4Attention_1Multi-Head Attention1 × 1026 × 1280
5Add_1Add1 × 1026 × 1280
6LayerNorm_1_1LayerNorm1 × 1026 × 1280
7FFN_1Feed Forward1 × 1026 × 1280
8Attention_2Multi-Head Attention1 × 1026 × 1280
9Add_2Add1 × 1026 × 1280
10LayerNorm_2_1LayerNorm1 × 1026 × 1280
11FFN_2Feed Forward1 × 1026 × 1280
12Attention_3Multi-Head Attention1 × 1026 × 1280
13Add_3Add1 × 1026 × 1280
14LayerNorm_3_1LayerNorm1 × 1026 × 1280
15FFN_3Feed Forward1 × 1026 × 1280
16Attention_4Multi-Head Attention1 × 1026 × 1280
17Add_4Add1 × 1026 × 1280
18LayerNorm_4_1LayerNorm1 × 1026 × 1280
19FFN_4Feed Forward1 × 1026 × 1280
20Attention_5Multi-Head Attention1 × 1026 × 1280
21Add_5Add1 × 1026 × 1280
22LayerNorm_5_1LayerNorm1 × 1026 × 1280
23FFN_5Feed Forward1 × 1026 × 1280
24Attention_6Multi-Head Attention1 × 1026 × 1280
25Add_6Add1 × 1026 × 1280
26LayerNorm_6_1LayerNorm1 × 1026 × 1280
27FFN_6Feed Forward1 × 1026 × 1280
28Attention_7Multi-Head Attention1 × 1026 × 1280
29Add_7Add1 × 1026 × 1280
30LayerNorm_7_1LayerNorm1 × 1026 × 1280
31FFN_7Feed Forward1 × 1026 × 1280
32Attention_8Multi-Head Attention1 × 1026 × 1280
33Add_8Add1 × 1026 × 1280
34LayerNorm_8_1LayerNorm1 × 1026 × 1280
35FFN_8Feed Forward1 × 1026 × 1280
36Attention_9Multi-Head Attention1 × 1026 × 1280
37Add_9Add1 × 1026 × 1280
38LayerNorm_9_1LayerNorm1 × 1026 × 1280
39FFN_9Feed Forward1 × 1026 × 1280
40Attention_10Multi-Head Attention1 × 1026 × 1280
41Add_10Add1 × 1026 × 1280
42LayerNorm_10_1LayerNorm1 × 1026 × 1280
43FFN_10Feed Forward1 × 1026 × 1280
44Attention_11Multi-Head Attention1 × 1026 × 1280
45Add_11Add1 × 1026 × 1280
46LayerNorm_11_1LayerNorm1 × 1026 × 1280
47FFN_11Feed Forward1 × 1026 × 1280
48Attention_12Multi-Head Attention1 × 1026 × 1280
49Add_12Add1 × 1026 × 1280
50LayerNorm_12_1LayerNorm1 × 1026 × 1280
51FFN_12Feed Forward1 × 1026 × 1280
52Attention_13Multi-Head Attention1 × 1026 × 1280
53Add_13Add1 × 1026 × 1280
54LayerNorm_13_1LayerNorm1 × 1026 × 1280
55FFN_13Feed Forward1 × 1026 × 1280
56Attention_14Multi-Head Attention1 × 1026 × 1280
57Add_14Add1 × 1026 × 1280
58LayerNorm_14_1LayerNorm1 × 1026 × 1280
59FFN_14Feed Forward1 × 1026 × 1280
60Attention_15Multi-Head Attention1 × 1026 × 1280
61Add_15Add1 × 1026 × 1280
62LayerNorm_15_1LayerNorm1 × 1026 × 1280
63FFN_15Feed Forward1 × 1026 × 1280
64Attention_16Multi-Head Attention1 × 1026 × 1280
65Add_16Add1 × 1026 × 1280
66LayerNorm_16_1LayerNorm1 × 1026 × 1280
67FFN_16Feed Forward1 × 1026 × 1280
68Attention_17Multi-Head Attention1 × 1026 × 1280
69Add_17Add1 × 1026 × 1280
70LayerNorm_17_1LayerNorm1 × 1026 × 1280
71FFN_17Feed Forward1 × 1026 × 1280
72Attention_18Multi-Head Attention1 × 1026 × 1280
73Add_18Add1 × 1026 × 1280
74LayerNorm_18_1LayerNorm1 × 1026 × 1280
75FFN_18Feed Forward1 × 1026 × 1280
76Attention_19Multi-Head Attention1 × 1026 × 1280
77Add_19Add1 × 1026 × 1280
78LayerNorm_19_1LayerNorm1 × 1026 × 1280
79FFN_19Feed Forward1 × 1026 × 1280
80Attention_20Multi-Head Attention1 × 1026 × 1280
81Add_20Add1 × 1026 × 1280
82LayerNorm_20_1LayerNorm1 × 1026 × 1280
83FFN_20Feed Forward1 × 1026 × 1280
84Attention_21Multi-Head Attention1 × 1026 × 1280
85Add_21Add1 × 1026 × 1280
86LayerNorm_21_1LayerNorm1 × 1026 × 1280
87FFN_21Feed Forward1 × 1026 × 1280
88Attention_22Multi-Head Attention1 × 1026 × 1280
89Add_22Add1 × 1026 × 1280
90LayerNorm_22_1LayerNorm1 × 1026 × 1280
91FFN_22Feed Forward1 × 1026 × 1280
92Attention_23Multi-Head Attention1 × 1026 × 1280
93Add_23Add1 × 1026 × 1280
94LayerNorm_23_1LayerNorm1 × 1026 × 1280
95FFN_23Feed Forward1 × 1026 × 1280
96Attention_24Multi-Head Attention1 × 1026 × 1280
97Add_24Add1 × 1026 × 1280
98LayerNorm_24_1LayerNorm1 × 1026 × 1280
99FFN_24Feed Forward1 × 1026 × 1280
100Attention_25Multi-Head Attention1 × 1026 × 1280
101Add_25Add1 × 1026 × 1280
102LayerNorm_25_1LayerNorm1 × 1026 × 1280
103FFN_25Feed Forward1 × 1026 × 1280
104Attention_26Multi-Head Attention1 × 1026 × 1280
105Add_26Add1 × 1026 × 1280
106LayerNorm_26_1LayerNorm1 × 1026 × 1280
107FFN_26Feed Forward1 × 1026 × 1280
108Attention_27Multi-Head Attention1 × 1026 × 1280
109Add_27Add1 × 1026 × 1280
110LayerNorm_27_1LayerNorm1 × 1026 × 1280
111FFN_27Feed Forward1 × 1026 × 1280
112Attention_28Multi-Head Attention1 × 1026 × 1280
113Add_28Add1 × 1026 × 1280
114LayerNorm_28_1LayerNorm1 × 1026 × 1280
115FFN_28Feed Forward1 × 1026 × 1280
116Attention_29Multi-Head Attention1 × 1026 × 1280
117Add_29Add1 × 1026 × 1280
118LayerNorm_29_1LayerNorm1 × 1026 × 1280
119FFN_29Feed Forward1 × 1026 × 1280
120Attention_30Multi-Head Attention1 × 1026 × 1280
121Add_30Add1 × 1026 × 1280
122LayerNorm_30_1LayerNorm1 × 1026 × 1280
123FFN_30Feed Forward1 × 1026 × 1280
124Attention_31Multi-Head Attention1 × 1026 × 1280
125Add_31Add1 × 1026 × 1280
126LayerNorm_31_1LayerNorm1 × 1026 × 1280
127FFN_31Feed Forward1 × 1026 × 1280
128Attention_32Multi-Head Attention1 × 1026 × 1280
129Add_32Add1 × 1026 × 1280
130LayerNorm_32_1LayerNorm1 × 1026 × 1280
131FFN_32Feed Forward1 × 1026 × 1280
132Attention_33Multi-Head Attention1 × 1026 × 1280
133Add_33Add1 × 1026 × 1280
134LayerNorm_33_1LayerNorm1 × 1026 × 1280
135FFN_33Feed Forward1 × 1026 × 1280
136OutputOutput1 × 1026 × 1280

What the verifier says

infoAt 33 stacked attention layers, residual-branch outputs add up; unscaled init lets activation variance grow with depth. GPT-2/LLaMA-family models scale the residual projections by depth (N(0, 0.02 / √(2L))). Fix: Scale residual output projections by depth: nn.init.normal_(w, std=0.02 / math.sqrt(2 * n_layers))
deep-attention-default-init

Do this to your own model

Same numbers, on a model in your repo, in one command. No account.

pip install neurarch-trace
neurarch-trace facebook/esm2_t33_650M_UR50D --plan --share