N Neurarch Architectures Models Checks Data Docs Open the app

Models / esmc

ESMC-6B

Reconstructed from its own config.json with no weights read. 2.1M downloads on Hugging Face.

Our count against the checkpoint

The left number comes from the graph. The right one is the number of scalars in the published weight files. Nothing on this page was tuned to make them agree.

Derived from structure
3.36B
3,358,597,120 parameters
In the published checkpoint
6.35B
6,352,005,184 scalars · safetensors.total, read 2026-09-06
Delta
-47.1%

What it costs to run

Cost is a roofline estimate on the priced GPU for 10 epochs at batch 32 over 50,000 samples (assumed; no dataset attached). GPU fit is fp32 weights plus gradients plus two Adam moments (16 bytes per parameter) with 1.3x headroom; activations are not included and grow with batch size.

Layers
322
Will it forward-pass
Yes
Priced on
A10G (24GB)
Est. one run
$66.36
CardMemory
T4 (16GB)weights + activationsdoes not fit
A100 (40GB)weights + activationsdoes not fit
H100 (80GB)weights + activationsfits

Structure

324 nodes. Output shapes are propagated from the input shape, batch dimension excluded.

LayerTypeOutput shape
1InputInput1 × 512
2EmbeddingEmbedding1 × 512 × 2560
3Positional_EmbeddingLearned Pos Embed1 × 512 × 2560
4Attention_1Multi-Head Attention1 × 512 × 2560
5Add_1Add1 × 512 × 2560
6LayerNorm_1_1LayerNorm1 × 512 × 2560
7FFN_1Feed Forward1 × 512 × 2560
8Attention_2Multi-Head Attention1 × 512 × 2560
9Add_2Add1 × 512 × 2560
10LayerNorm_2_1LayerNorm1 × 512 × 2560
11FFN_2Feed Forward1 × 512 × 2560
12Attention_3Multi-Head Attention1 × 512 × 2560
13Add_3Add1 × 512 × 2560
14LayerNorm_3_1LayerNorm1 × 512 × 2560
15FFN_3Feed Forward1 × 512 × 2560
16Attention_4Multi-Head Attention1 × 512 × 2560
17Add_4Add1 × 512 × 2560
18LayerNorm_4_1LayerNorm1 × 512 × 2560
19FFN_4Feed Forward1 × 512 × 2560
20Attention_5Multi-Head Attention1 × 512 × 2560
21Add_5Add1 × 512 × 2560
22LayerNorm_5_1LayerNorm1 × 512 × 2560
23FFN_5Feed Forward1 × 512 × 2560
24Attention_6Multi-Head Attention1 × 512 × 2560
25Add_6Add1 × 512 × 2560
26LayerNorm_6_1LayerNorm1 × 512 × 2560
27FFN_6Feed Forward1 × 512 × 2560
28Attention_7Multi-Head Attention1 × 512 × 2560
29Add_7Add1 × 512 × 2560
30LayerNorm_7_1LayerNorm1 × 512 × 2560
31FFN_7Feed Forward1 × 512 × 2560
32Attention_8Multi-Head Attention1 × 512 × 2560
33Add_8Add1 × 512 × 2560
34LayerNorm_8_1LayerNorm1 × 512 × 2560
35FFN_8Feed Forward1 × 512 × 2560
36Attention_9Multi-Head Attention1 × 512 × 2560
37Add_9Add1 × 512 × 2560
38LayerNorm_9_1LayerNorm1 × 512 × 2560
39FFN_9Feed Forward1 × 512 × 2560
40Attention_10Multi-Head Attention1 × 512 × 2560
41Add_10Add1 × 512 × 2560
42LayerNorm_10_1LayerNorm1 × 512 × 2560
43FFN_10Feed Forward1 × 512 × 2560
44Attention_11Multi-Head Attention1 × 512 × 2560
45Add_11Add1 × 512 × 2560
46LayerNorm_11_1LayerNorm1 × 512 × 2560
47FFN_11Feed Forward1 × 512 × 2560
48Attention_12Multi-Head Attention1 × 512 × 2560
49Add_12Add1 × 512 × 2560
50LayerNorm_12_1LayerNorm1 × 512 × 2560
51FFN_12Feed Forward1 × 512 × 2560
52Attention_13Multi-Head Attention1 × 512 × 2560
53Add_13Add1 × 512 × 2560
54LayerNorm_13_1LayerNorm1 × 512 × 2560
55FFN_13Feed Forward1 × 512 × 2560
56Attention_14Multi-Head Attention1 × 512 × 2560
57Add_14Add1 × 512 × 2560
58LayerNorm_14_1LayerNorm1 × 512 × 2560
59FFN_14Feed Forward1 × 512 × 2560
60Attention_15Multi-Head Attention1 × 512 × 2560
61Add_15Add1 × 512 × 2560
62LayerNorm_15_1LayerNorm1 × 512 × 2560
63FFN_15Feed Forward1 × 512 × 2560
64Attention_16Multi-Head Attention1 × 512 × 2560
65Add_16Add1 × 512 × 2560
66LayerNorm_16_1LayerNorm1 × 512 × 2560
67FFN_16Feed Forward1 × 512 × 2560
68Attention_17Multi-Head Attention1 × 512 × 2560
69Add_17Add1 × 512 × 2560
70LayerNorm_17_1LayerNorm1 × 512 × 2560
71FFN_17Feed Forward1 × 512 × 2560
72Attention_18Multi-Head Attention1 × 512 × 2560
73Add_18Add1 × 512 × 2560
74LayerNorm_18_1LayerNorm1 × 512 × 2560
75FFN_18Feed Forward1 × 512 × 2560
76Attention_19Multi-Head Attention1 × 512 × 2560
77Add_19Add1 × 512 × 2560
78LayerNorm_19_1LayerNorm1 × 512 × 2560
79FFN_19Feed Forward1 × 512 × 2560
80Attention_20Multi-Head Attention1 × 512 × 2560
81Add_20Add1 × 512 × 2560
82LayerNorm_20_1LayerNorm1 × 512 × 2560
83FFN_20Feed Forward1 × 512 × 2560
84Attention_21Multi-Head Attention1 × 512 × 2560
85Add_21Add1 × 512 × 2560
86LayerNorm_21_1LayerNorm1 × 512 × 2560
87FFN_21Feed Forward1 × 512 × 2560
88Attention_22Multi-Head Attention1 × 512 × 2560
89Add_22Add1 × 512 × 2560
90LayerNorm_22_1LayerNorm1 × 512 × 2560
91FFN_22Feed Forward1 × 512 × 2560
92Attention_23Multi-Head Attention1 × 512 × 2560
93Add_23Add1 × 512 × 2560
94LayerNorm_23_1LayerNorm1 × 512 × 2560
95FFN_23Feed Forward1 × 512 × 2560
96Attention_24Multi-Head Attention1 × 512 × 2560
97Add_24Add1 × 512 × 2560
98LayerNorm_24_1LayerNorm1 × 512 × 2560
99FFN_24Feed Forward1 × 512 × 2560
100Attention_25Multi-Head Attention1 × 512 × 2560
101Add_25Add1 × 512 × 2560
102LayerNorm_25_1LayerNorm1 × 512 × 2560
103FFN_25Feed Forward1 × 512 × 2560
104Attention_26Multi-Head Attention1 × 512 × 2560
105Add_26Add1 × 512 × 2560
106LayerNorm_26_1LayerNorm1 × 512 × 2560
107FFN_26Feed Forward1 × 512 × 2560
108Attention_27Multi-Head Attention1 × 512 × 2560
109Add_27Add1 × 512 × 2560
110LayerNorm_27_1LayerNorm1 × 512 × 2560
111FFN_27Feed Forward1 × 512 × 2560
112Attention_28Multi-Head Attention1 × 512 × 2560
113Add_28Add1 × 512 × 2560
114LayerNorm_28_1LayerNorm1 × 512 × 2560
115FFN_28Feed Forward1 × 512 × 2560
116Attention_29Multi-Head Attention1 × 512 × 2560
117Add_29Add1 × 512 × 2560
118LayerNorm_29_1LayerNorm1 × 512 × 2560
119FFN_29Feed Forward1 × 512 × 2560
120Attention_30Multi-Head Attention1 × 512 × 2560
121Add_30Add1 × 512 × 2560
122LayerNorm_30_1LayerNorm1 × 512 × 2560
123FFN_30Feed Forward1 × 512 × 2560
124Attention_31Multi-Head Attention1 × 512 × 2560
125Add_31Add1 × 512 × 2560
126LayerNorm_31_1LayerNorm1 × 512 × 2560
127FFN_31Feed Forward1 × 512 × 2560
128Attention_32Multi-Head Attention1 × 512 × 2560
129Add_32Add1 × 512 × 2560
130LayerNorm_32_1LayerNorm1 × 512 × 2560
131FFN_32Feed Forward1 × 512 × 2560
132Attention_33Multi-Head Attention1 × 512 × 2560
133Add_33Add1 × 512 × 2560
134LayerNorm_33_1LayerNorm1 × 512 × 2560
135FFN_33Feed Forward1 × 512 × 2560
136Attention_34Multi-Head Attention1 × 512 × 2560
137Add_34Add1 × 512 × 2560
138LayerNorm_34_1LayerNorm1 × 512 × 2560
139FFN_34Feed Forward1 × 512 × 2560
140Attention_35Multi-Head Attention1 × 512 × 2560
141Add_35Add1 × 512 × 2560
142LayerNorm_35_1LayerNorm1 × 512 × 2560
143FFN_35Feed Forward1 × 512 × 2560
144Attention_36Multi-Head Attention1 × 512 × 2560
145Add_36Add1 × 512 × 2560
146LayerNorm_36_1LayerNorm1 × 512 × 2560
147FFN_36Feed Forward1 × 512 × 2560
148Attention_37Multi-Head Attention1 × 512 × 2560
149Add_37Add1 × 512 × 2560
150LayerNorm_37_1LayerNorm1 × 512 × 2560
151FFN_37Feed Forward1 × 512 × 2560
152Attention_38Multi-Head Attention1 × 512 × 2560
153Add_38Add1 × 512 × 2560
154LayerNorm_38_1LayerNorm1 × 512 × 2560
155FFN_38Feed Forward1 × 512 × 2560
156Attention_39Multi-Head Attention1 × 512 × 2560
157Add_39Add1 × 512 × 2560
158LayerNorm_39_1LayerNorm1 × 512 × 2560
159FFN_39Feed Forward1 × 512 × 2560
160Attention_40Multi-Head Attention1 × 512 × 2560
161Add_40Add1 × 512 × 2560
162LayerNorm_40_1LayerNorm1 × 512 × 2560
163FFN_40Feed Forward1 × 512 × 2560
164Attention_41Multi-Head Attention1 × 512 × 2560
165Add_41Add1 × 512 × 2560
166LayerNorm_41_1LayerNorm1 × 512 × 2560
167FFN_41Feed Forward1 × 512 × 2560
168Attention_42Multi-Head Attention1 × 512 × 2560
169Add_42Add1 × 512 × 2560
170LayerNorm_42_1LayerNorm1 × 512 × 2560
171FFN_42Feed Forward1 × 512 × 2560
172Attention_43Multi-Head Attention1 × 512 × 2560
173Add_43Add1 × 512 × 2560
174LayerNorm_43_1LayerNorm1 × 512 × 2560
175FFN_43Feed Forward1 × 512 × 2560
176Attention_44Multi-Head Attention1 × 512 × 2560
177Add_44Add1 × 512 × 2560
178LayerNorm_44_1LayerNorm1 × 512 × 2560
179FFN_44Feed Forward1 × 512 × 2560
180Attention_45Multi-Head Attention1 × 512 × 2560
181Add_45Add1 × 512 × 2560
182LayerNorm_45_1LayerNorm1 × 512 × 2560
183FFN_45Feed Forward1 × 512 × 2560
184Attention_46Multi-Head Attention1 × 512 × 2560
185Add_46Add1 × 512 × 2560
186LayerNorm_46_1LayerNorm1 × 512 × 2560
187FFN_46Feed Forward1 × 512 × 2560
188Attention_47Multi-Head Attention1 × 512 × 2560
189Add_47Add1 × 512 × 2560
190LayerNorm_47_1LayerNorm1 × 512 × 2560
191FFN_47Feed Forward1 × 512 × 2560
192Attention_48Multi-Head Attention1 × 512 × 2560
193Add_48Add1 × 512 × 2560
194LayerNorm_48_1LayerNorm1 × 512 × 2560
195FFN_48Feed Forward1 × 512 × 2560
196Attention_49Multi-Head Attention1 × 512 × 2560
197Add_49Add1 × 512 × 2560
198LayerNorm_49_1LayerNorm1 × 512 × 2560
199FFN_49Feed Forward1 × 512 × 2560
200Attention_50Multi-Head Attention1 × 512 × 2560
201Add_50Add1 × 512 × 2560
202LayerNorm_50_1LayerNorm1 × 512 × 2560
203FFN_50Feed Forward1 × 512 × 2560
204Attention_51Multi-Head Attention1 × 512 × 2560
205Add_51Add1 × 512 × 2560
206LayerNorm_51_1LayerNorm1 × 512 × 2560
207FFN_51Feed Forward1 × 512 × 2560
208Attention_52Multi-Head Attention1 × 512 × 2560
209Add_52Add1 × 512 × 2560
210LayerNorm_52_1LayerNorm1 × 512 × 2560
211FFN_52Feed Forward1 × 512 × 2560
212Attention_53Multi-Head Attention1 × 512 × 2560
213Add_53Add1 × 512 × 2560
214LayerNorm_53_1LayerNorm1 × 512 × 2560
215FFN_53Feed Forward1 × 512 × 2560
216Attention_54Multi-Head Attention1 × 512 × 2560
217Add_54Add1 × 512 × 2560
218LayerNorm_54_1LayerNorm1 × 512 × 2560
219FFN_54Feed Forward1 × 512 × 2560
220Attention_55Multi-Head Attention1 × 512 × 2560
221Add_55Add1 × 512 × 2560
222LayerNorm_55_1LayerNorm1 × 512 × 2560
223FFN_55Feed Forward1 × 512 × 2560
224Attention_56Multi-Head Attention1 × 512 × 2560
225Add_56Add1 × 512 × 2560
226LayerNorm_56_1LayerNorm1 × 512 × 2560
227FFN_56Feed Forward1 × 512 × 2560
228Attention_57Multi-Head Attention1 × 512 × 2560
229Add_57Add1 × 512 × 2560
230LayerNorm_57_1LayerNorm1 × 512 × 2560
231FFN_57Feed Forward1 × 512 × 2560
232Attention_58Multi-Head Attention1 × 512 × 2560
233Add_58Add1 × 512 × 2560
234LayerNorm_58_1LayerNorm1 × 512 × 2560
235FFN_58Feed Forward1 × 512 × 2560
236Attention_59Multi-Head Attention1 × 512 × 2560
237Add_59Add1 × 512 × 2560
238LayerNorm_59_1LayerNorm1 × 512 × 2560
239FFN_59Feed Forward1 × 512 × 2560
240Attention_60Multi-Head Attention1 × 512 × 2560
241Add_60Add1 × 512 × 2560
242LayerNorm_60_1LayerNorm1 × 512 × 2560
243FFN_60Feed Forward1 × 512 × 2560
244Attention_61Multi-Head Attention1 × 512 × 2560
245Add_61Add1 × 512 × 2560
246LayerNorm_61_1LayerNorm1 × 512 × 2560
247FFN_61Feed Forward1 × 512 × 2560
248Attention_62Multi-Head Attention1 × 512 × 2560
249Add_62Add1 × 512 × 2560
250LayerNorm_62_1LayerNorm1 × 512 × 2560
251FFN_62Feed Forward1 × 512 × 2560
252Attention_63Multi-Head Attention1 × 512 × 2560
253Add_63Add1 × 512 × 2560
254LayerNorm_63_1LayerNorm1 × 512 × 2560
255FFN_63Feed Forward1 × 512 × 2560
256Attention_64Multi-Head Attention1 × 512 × 2560
257Add_64Add1 × 512 × 2560
258LayerNorm_64_1LayerNorm1 × 512 × 2560
259FFN_64Feed Forward1 × 512 × 2560
260Attention_65Multi-Head Attention1 × 512 × 2560
261Add_65Add1 × 512 × 2560
262LayerNorm_65_1LayerNorm1 × 512 × 2560
263FFN_65Feed Forward1 × 512 × 2560
264Attention_66Multi-Head Attention1 × 512 × 2560
265Add_66Add1 × 512 × 2560
266LayerNorm_66_1LayerNorm1 × 512 × 2560
267FFN_66Feed Forward1 × 512 × 2560
268Attention_67Multi-Head Attention1 × 512 × 2560
269Add_67Add1 × 512 × 2560
270LayerNorm_67_1LayerNorm1 × 512 × 2560
271FFN_67Feed Forward1 × 512 × 2560
272Attention_68Multi-Head Attention1 × 512 × 2560
273Add_68Add1 × 512 × 2560
274LayerNorm_68_1LayerNorm1 × 512 × 2560
275FFN_68Feed Forward1 × 512 × 2560
276Attention_69Multi-Head Attention1 × 512 × 2560
277Add_69Add1 × 512 × 2560
278LayerNorm_69_1LayerNorm1 × 512 × 2560
279FFN_69Feed Forward1 × 512 × 2560
280Attention_70Multi-Head Attention1 × 512 × 2560
281Add_70Add1 × 512 × 2560
282LayerNorm_70_1LayerNorm1 × 512 × 2560
283FFN_70Feed Forward1 × 512 × 2560
284Attention_71Multi-Head Attention1 × 512 × 2560
285Add_71Add1 × 512 × 2560
286LayerNorm_71_1LayerNorm1 × 512 × 2560
287FFN_71Feed Forward1 × 512 × 2560
288Attention_72Multi-Head Attention1 × 512 × 2560
289Add_72Add1 × 512 × 2560
290LayerNorm_72_1LayerNorm1 × 512 × 2560
291FFN_72Feed Forward1 × 512 × 2560
292Attention_73Multi-Head Attention1 × 512 × 2560
293Add_73Add1 × 512 × 2560
294LayerNorm_73_1LayerNorm1 × 512 × 2560
295FFN_73Feed Forward1 × 512 × 2560
296Attention_74Multi-Head Attention1 × 512 × 2560
297Add_74Add1 × 512 × 2560
298LayerNorm_74_1LayerNorm1 × 512 × 2560
299FFN_74Feed Forward1 × 512 × 2560
300Attention_75Multi-Head Attention1 × 512 × 2560
301Add_75Add1 × 512 × 2560
302LayerNorm_75_1LayerNorm1 × 512 × 2560
303FFN_75Feed Forward1 × 512 × 2560
304Attention_76Multi-Head Attention1 × 512 × 2560
305Add_76Add1 × 512 × 2560
306LayerNorm_76_1LayerNorm1 × 512 × 2560
307FFN_76Feed Forward1 × 512 × 2560
308Attention_77Multi-Head Attention1 × 512 × 2560
309Add_77Add1 × 512 × 2560
310LayerNorm_77_1LayerNorm1 × 512 × 2560
311FFN_77Feed Forward1 × 512 × 2560
312Attention_78Multi-Head Attention1 × 512 × 2560
313Add_78Add1 × 512 × 2560
314LayerNorm_78_1LayerNorm1 × 512 × 2560
315FFN_78Feed Forward1 × 512 × 2560
316Attention_79Multi-Head Attention1 × 512 × 2560
317Add_79Add1 × 512 × 2560
318LayerNorm_79_1LayerNorm1 × 512 × 2560
319FFN_79Feed Forward1 × 512 × 2560
320Attention_80Multi-Head Attention1 × 512 × 2560
321Add_80Add1 × 512 × 2560
322LayerNorm_80_1LayerNorm1 × 512 × 2560
323FFN_80Feed Forward1 × 512 × 2560
324OutputOutput1 × 512 × 2560

What the verifier says

info80 attention layers at embedDim 2560 cache full per-head K/V: about 800 KB per token at fp16, which dominates memory at long context. Grouped-query attention (e.g. 8:1) would cut this ~8×; multi-head latent attention (MLA) shrinks it ~10× or more. This is the move production LLMs make; it does not change the parameter count. Fix: Switch attention to groupedQueryAttention (set numKVHeads below numHeads, e.g. numHeads/4) or mla (a low-rank cached latent).
full-mha-serving-cost
infoAt 80 stacked attention layers, residual-branch outputs add up; unscaled init lets activation variance grow with depth. GPT-2/LLaMA-family models scale the residual projections by depth (N(0, 0.02 / √(2L))). Fix: Scale residual output projections by depth: nn.init.normal_(w, std=0.02 / math.sqrt(2 * n_layers))
deep-attention-default-init
warnAcross 80 attention layers this design caches 800 KB per token, so a single 8,192-token sequence needs ~6.7 GB of KV cache before weights or activations. That exceeds the 4 GB budget this rule assumes for serving headroom. Fix: Cut KV width: raise the GQA ratio (fewer numKVHeads), switch to MLA, reduce depth or embedDim, or accept a shorter serving context.
kv-cache-context-budget

Do this to your own model

Same numbers, on a model in your repo, in one command. No account.

pip install neurarch-trace
neurarch-trace biohub/ESMC-6B --plan --share