N Neurarch Architectures Models Checks Data Docs Open the app

Models / wav2vec2-bert

w2v-bert-2.0

Reconstructed from its own config.json with no weights read. 2.3M downloads on Hugging Face.

Our count against the checkpoint

The left number comes from the graph. The right one is the number of scalars in the published weight files. Nothing on this page was tuned to make them agree.

Derived from structure
739M
739,278,848 parameters
In the published checkpoint
580M
580,493,120 scalars · safetensors.total, read 2026-09-06
Delta
+27.4%

What it costs to run

Cost is a roofline estimate on the priced GPU for 10 epochs at batch 32 over 50,000 samples (assumed; no dataset attached). GPU fit is fp32 weights plus gradients plus two Adam moments (16 bytes per parameter) with 1.3x headroom; activations are not included and grow with batch size.

Layers
268
Will it forward-pass
Yes
Priced on
A10G (24GB)
Est. one run
$12.73
CardMemory
T4 (16GB)weights + activationsfits
A100 (40GB)weights + activationsfits
H100 (80GB)weights + activationsfits

Structure

270 nodes. Output shapes are propagated from the input shape, batch dimension excluded.

LayerTypeOutput shape
1InputInput1 × 512
2Encoder_EmbeddingEmbedding1 × 512 × 1024
3Encoder_Position_EmbeddingLearned Pos Embed1 × 512 × 1024
4Enc_Attn_1Multi-Head Attention1 × 512 × 1024
5Enc_Add_1Add1 × 512 × 1024
6Enc_Norm_1LayerNorm1 × 512 × 1024
7Enc_FFN_1Feed Forward1 × 512 × 1024
8Enc_Attn_2Multi-Head Attention1 × 512 × 1024
9Enc_Add_2Add1 × 512 × 1024
10Enc_Norm_2LayerNorm1 × 512 × 1024
11Enc_FFN_2Feed Forward1 × 512 × 1024
12Enc_Attn_3Multi-Head Attention1 × 512 × 1024
13Enc_Add_3Add1 × 512 × 1024
14Enc_Norm_3LayerNorm1 × 512 × 1024
15Enc_FFN_3Feed Forward1 × 512 × 1024
16Enc_Attn_4Multi-Head Attention1 × 512 × 1024
17Enc_Add_4Add1 × 512 × 1024
18Enc_Norm_4LayerNorm1 × 512 × 1024
19Enc_FFN_4Feed Forward1 × 512 × 1024
20Enc_Attn_5Multi-Head Attention1 × 512 × 1024
21Enc_Add_5Add1 × 512 × 1024
22Enc_Norm_5LayerNorm1 × 512 × 1024
23Enc_FFN_5Feed Forward1 × 512 × 1024
24Enc_Attn_6Multi-Head Attention1 × 512 × 1024
25Enc_Add_6Add1 × 512 × 1024
26Enc_Norm_6LayerNorm1 × 512 × 1024
27Enc_FFN_6Feed Forward1 × 512 × 1024
28Enc_Attn_7Multi-Head Attention1 × 512 × 1024
29Enc_Add_7Add1 × 512 × 1024
30Enc_Norm_7LayerNorm1 × 512 × 1024
31Enc_FFN_7Feed Forward1 × 512 × 1024
32Enc_Attn_8Multi-Head Attention1 × 512 × 1024
33Enc_Add_8Add1 × 512 × 1024
34Enc_Norm_8LayerNorm1 × 512 × 1024
35Enc_FFN_8Feed Forward1 × 512 × 1024
36Enc_Attn_9Multi-Head Attention1 × 512 × 1024
37Enc_Add_9Add1 × 512 × 1024
38Enc_Norm_9LayerNorm1 × 512 × 1024
39Enc_FFN_9Feed Forward1 × 512 × 1024
40Enc_Attn_10Multi-Head Attention1 × 512 × 1024
41Enc_Add_10Add1 × 512 × 1024
42Enc_Norm_10LayerNorm1 × 512 × 1024
43Enc_FFN_10Feed Forward1 × 512 × 1024
44Enc_Attn_11Multi-Head Attention1 × 512 × 1024
45Enc_Add_11Add1 × 512 × 1024
46Enc_Norm_11LayerNorm1 × 512 × 1024
47Enc_FFN_11Feed Forward1 × 512 × 1024
48Enc_Attn_12Multi-Head Attention1 × 512 × 1024
49Enc_Add_12Add1 × 512 × 1024
50Enc_Norm_12LayerNorm1 × 512 × 1024
51Enc_FFN_12Feed Forward1 × 512 × 1024
52Enc_Attn_13Multi-Head Attention1 × 512 × 1024
53Enc_Add_13Add1 × 512 × 1024
54Enc_Norm_13LayerNorm1 × 512 × 1024
55Enc_FFN_13Feed Forward1 × 512 × 1024
56Enc_Attn_14Multi-Head Attention1 × 512 × 1024
57Enc_Add_14Add1 × 512 × 1024
58Enc_Norm_14LayerNorm1 × 512 × 1024
59Enc_FFN_14Feed Forward1 × 512 × 1024
60Enc_Attn_15Multi-Head Attention1 × 512 × 1024
61Enc_Add_15Add1 × 512 × 1024
62Enc_Norm_15LayerNorm1 × 512 × 1024
63Enc_FFN_15Feed Forward1 × 512 × 1024
64Enc_Attn_16Multi-Head Attention1 × 512 × 1024
65Enc_Add_16Add1 × 512 × 1024
66Enc_Norm_16LayerNorm1 × 512 × 1024
67Enc_FFN_16Feed Forward1 × 512 × 1024
68Enc_Attn_17Multi-Head Attention1 × 512 × 1024
69Enc_Add_17Add1 × 512 × 1024
70Enc_Norm_17LayerNorm1 × 512 × 1024
71Enc_FFN_17Feed Forward1 × 512 × 1024
72Enc_Attn_18Multi-Head Attention1 × 512 × 1024
73Enc_Add_18Add1 × 512 × 1024
74Enc_Norm_18LayerNorm1 × 512 × 1024
75Enc_FFN_18Feed Forward1 × 512 × 1024
76Enc_Attn_19Multi-Head Attention1 × 512 × 1024
77Enc_Add_19Add1 × 512 × 1024
78Enc_Norm_19LayerNorm1 × 512 × 1024
79Enc_FFN_19Feed Forward1 × 512 × 1024
80Enc_Attn_20Multi-Head Attention1 × 512 × 1024
81Enc_Add_20Add1 × 512 × 1024
82Enc_Norm_20LayerNorm1 × 512 × 1024
83Enc_FFN_20Feed Forward1 × 512 × 1024
84Enc_Attn_21Multi-Head Attention1 × 512 × 1024
85Enc_Add_21Add1 × 512 × 1024
86Enc_Norm_21LayerNorm1 × 512 × 1024
87Enc_FFN_21Feed Forward1 × 512 × 1024
88Enc_Attn_22Multi-Head Attention1 × 512 × 1024
89Enc_Add_22Add1 × 512 × 1024
90Enc_Norm_22LayerNorm1 × 512 × 1024
91Enc_FFN_22Feed Forward1 × 512 × 1024
92Enc_Attn_23Multi-Head Attention1 × 512 × 1024
93Enc_Add_23Add1 × 512 × 1024
94Enc_Norm_23LayerNorm1 × 512 × 1024
95Enc_FFN_23Feed Forward1 × 512 × 1024
96Enc_Attn_24Multi-Head Attention1 × 512 × 1024
97Enc_Add_24Add1 × 512 × 1024
98Enc_Norm_24LayerNorm1 × 512 × 1024
99Enc_FFN_24Feed Forward1 × 512 × 1024
100Decoder_EmbeddingEmbedding1 × 512 × 1024
101Dec_SelfAttn_1Multi-Head Attention1 × 512 × 1024
102Dec_Add_1Add1 × 512 × 1024
103Dec_Norm1_1LayerNorm1 × 512 × 1024
104Dec_CrossAttn_1Cross-Attention1 × 512 × 1024
105Dec_Add2_1Add1 × 512 × 1024
106Dec_Norm2_1LayerNorm1 × 512 × 1024
107Dec_FFN_1Feed Forward1 × 512 × 1024
108Dec_SelfAttn_2Multi-Head Attention1 × 512 × 1024
109Dec_Add_2Add1 × 512 × 1024
110Dec_Norm1_2LayerNorm1 × 512 × 1024
111Dec_CrossAttn_2Cross-Attention1 × 512 × 1024
112Dec_Add2_2Add1 × 512 × 1024
113Dec_Norm2_2LayerNorm1 × 512 × 1024
114Dec_FFN_2Feed Forward1 × 512 × 1024
115Dec_SelfAttn_3Multi-Head Attention1 × 512 × 1024
116Dec_Add_3Add1 × 512 × 1024
117Dec_Norm1_3LayerNorm1 × 512 × 1024
118Dec_CrossAttn_3Cross-Attention1 × 512 × 1024
119Dec_Add2_3Add1 × 512 × 1024
120Dec_Norm2_3LayerNorm1 × 512 × 1024
121Dec_FFN_3Feed Forward1 × 512 × 1024
122Dec_SelfAttn_4Multi-Head Attention1 × 512 × 1024
123Dec_Add_4Add1 × 512 × 1024
124Dec_Norm1_4LayerNorm1 × 512 × 1024
125Dec_CrossAttn_4Cross-Attention1 × 512 × 1024
126Dec_Add2_4Add1 × 512 × 1024
127Dec_Norm2_4LayerNorm1 × 512 × 1024
128Dec_FFN_4Feed Forward1 × 512 × 1024
129Dec_SelfAttn_5Multi-Head Attention1 × 512 × 1024
130Dec_Add_5Add1 × 512 × 1024
131Dec_Norm1_5LayerNorm1 × 512 × 1024
132Dec_CrossAttn_5Cross-Attention1 × 512 × 1024
133Dec_Add2_5Add1 × 512 × 1024
134Dec_Norm2_5LayerNorm1 × 512 × 1024
135Dec_FFN_5Feed Forward1 × 512 × 1024
136Dec_SelfAttn_6Multi-Head Attention1 × 512 × 1024
137Dec_Add_6Add1 × 512 × 1024
138Dec_Norm1_6LayerNorm1 × 512 × 1024
139Dec_CrossAttn_6Cross-Attention1 × 512 × 1024
140Dec_Add2_6Add1 × 512 × 1024
141Dec_Norm2_6LayerNorm1 × 512 × 1024
142Dec_FFN_6Feed Forward1 × 512 × 1024
143Dec_SelfAttn_7Multi-Head Attention1 × 512 × 1024
144Dec_Add_7Add1 × 512 × 1024
145Dec_Norm1_7LayerNorm1 × 512 × 1024
146Dec_CrossAttn_7Cross-Attention1 × 512 × 1024
147Dec_Add2_7Add1 × 512 × 1024
148Dec_Norm2_7LayerNorm1 × 512 × 1024
149Dec_FFN_7Feed Forward1 × 512 × 1024
150Dec_SelfAttn_8Multi-Head Attention1 × 512 × 1024
151Dec_Add_8Add1 × 512 × 1024
152Dec_Norm1_8LayerNorm1 × 512 × 1024
153Dec_CrossAttn_8Cross-Attention1 × 512 × 1024
154Dec_Add2_8Add1 × 512 × 1024
155Dec_Norm2_8LayerNorm1 × 512 × 1024
156Dec_FFN_8Feed Forward1 × 512 × 1024
157Dec_SelfAttn_9Multi-Head Attention1 × 512 × 1024
158Dec_Add_9Add1 × 512 × 1024
159Dec_Norm1_9LayerNorm1 × 512 × 1024
160Dec_CrossAttn_9Cross-Attention1 × 512 × 1024
161Dec_Add2_9Add1 × 512 × 1024
162Dec_Norm2_9LayerNorm1 × 512 × 1024
163Dec_FFN_9Feed Forward1 × 512 × 1024
164Dec_SelfAttn_10Multi-Head Attention1 × 512 × 1024
165Dec_Add_10Add1 × 512 × 1024
166Dec_Norm1_10LayerNorm1 × 512 × 1024
167Dec_CrossAttn_10Cross-Attention1 × 512 × 1024
168Dec_Add2_10Add1 × 512 × 1024
169Dec_Norm2_10LayerNorm1 × 512 × 1024
170Dec_FFN_10Feed Forward1 × 512 × 1024
171Dec_SelfAttn_11Multi-Head Attention1 × 512 × 1024
172Dec_Add_11Add1 × 512 × 1024
173Dec_Norm1_11LayerNorm1 × 512 × 1024
174Dec_CrossAttn_11Cross-Attention1 × 512 × 1024
175Dec_Add2_11Add1 × 512 × 1024
176Dec_Norm2_11LayerNorm1 × 512 × 1024
177Dec_FFN_11Feed Forward1 × 512 × 1024
178Dec_SelfAttn_12Multi-Head Attention1 × 512 × 1024
179Dec_Add_12Add1 × 512 × 1024
180Dec_Norm1_12LayerNorm1 × 512 × 1024
181Dec_CrossAttn_12Cross-Attention1 × 512 × 1024
182Dec_Add2_12Add1 × 512 × 1024
183Dec_Norm2_12LayerNorm1 × 512 × 1024
184Dec_FFN_12Feed Forward1 × 512 × 1024
185Dec_SelfAttn_13Multi-Head Attention1 × 512 × 1024
186Dec_Add_13Add1 × 512 × 1024
187Dec_Norm1_13LayerNorm1 × 512 × 1024
188Dec_CrossAttn_13Cross-Attention1 × 512 × 1024
189Dec_Add2_13Add1 × 512 × 1024
190Dec_Norm2_13LayerNorm1 × 512 × 1024
191Dec_FFN_13Feed Forward1 × 512 × 1024
192Dec_SelfAttn_14Multi-Head Attention1 × 512 × 1024
193Dec_Add_14Add1 × 512 × 1024
194Dec_Norm1_14LayerNorm1 × 512 × 1024
195Dec_CrossAttn_14Cross-Attention1 × 512 × 1024
196Dec_Add2_14Add1 × 512 × 1024
197Dec_Norm2_14LayerNorm1 × 512 × 1024
198Dec_FFN_14Feed Forward1 × 512 × 1024
199Dec_SelfAttn_15Multi-Head Attention1 × 512 × 1024
200Dec_Add_15Add1 × 512 × 1024
201Dec_Norm1_15LayerNorm1 × 512 × 1024
202Dec_CrossAttn_15Cross-Attention1 × 512 × 1024
203Dec_Add2_15Add1 × 512 × 1024
204Dec_Norm2_15LayerNorm1 × 512 × 1024
205Dec_FFN_15Feed Forward1 × 512 × 1024
206Dec_SelfAttn_16Multi-Head Attention1 × 512 × 1024
207Dec_Add_16Add1 × 512 × 1024
208Dec_Norm1_16LayerNorm1 × 512 × 1024
209Dec_CrossAttn_16Cross-Attention1 × 512 × 1024
210Dec_Add2_16Add1 × 512 × 1024
211Dec_Norm2_16LayerNorm1 × 512 × 1024
212Dec_FFN_16Feed Forward1 × 512 × 1024
213Dec_SelfAttn_17Multi-Head Attention1 × 512 × 1024
214Dec_Add_17Add1 × 512 × 1024
215Dec_Norm1_17LayerNorm1 × 512 × 1024
216Dec_CrossAttn_17Cross-Attention1 × 512 × 1024
217Dec_Add2_17Add1 × 512 × 1024
218Dec_Norm2_17LayerNorm1 × 512 × 1024
219Dec_FFN_17Feed Forward1 × 512 × 1024
220Dec_SelfAttn_18Multi-Head Attention1 × 512 × 1024
221Dec_Add_18Add1 × 512 × 1024
222Dec_Norm1_18LayerNorm1 × 512 × 1024
223Dec_CrossAttn_18Cross-Attention1 × 512 × 1024
224Dec_Add2_18Add1 × 512 × 1024
225Dec_Norm2_18LayerNorm1 × 512 × 1024
226Dec_FFN_18Feed Forward1 × 512 × 1024
227Dec_SelfAttn_19Multi-Head Attention1 × 512 × 1024
228Dec_Add_19Add1 × 512 × 1024
229Dec_Norm1_19LayerNorm1 × 512 × 1024
230Dec_CrossAttn_19Cross-Attention1 × 512 × 1024
231Dec_Add2_19Add1 × 512 × 1024
232Dec_Norm2_19LayerNorm1 × 512 × 1024
233Dec_FFN_19Feed Forward1 × 512 × 1024
234Dec_SelfAttn_20Multi-Head Attention1 × 512 × 1024
235Dec_Add_20Add1 × 512 × 1024
236Dec_Norm1_20LayerNorm1 × 512 × 1024
237Dec_CrossAttn_20Cross-Attention1 × 512 × 1024
238Dec_Add2_20Add1 × 512 × 1024
239Dec_Norm2_20LayerNorm1 × 512 × 1024
240Dec_FFN_20Feed Forward1 × 512 × 1024
241Dec_SelfAttn_21Multi-Head Attention1 × 512 × 1024
242Dec_Add_21Add1 × 512 × 1024
243Dec_Norm1_21LayerNorm1 × 512 × 1024
244Dec_CrossAttn_21Cross-Attention1 × 512 × 1024
245Dec_Add2_21Add1 × 512 × 1024
246Dec_Norm2_21LayerNorm1 × 512 × 1024
247Dec_FFN_21Feed Forward1 × 512 × 1024
248Dec_SelfAttn_22Multi-Head Attention1 × 512 × 1024
249Dec_Add_22Add1 × 512 × 1024
250Dec_Norm1_22LayerNorm1 × 512 × 1024
251Dec_CrossAttn_22Cross-Attention1 × 512 × 1024
252Dec_Add2_22Add1 × 512 × 1024
253Dec_Norm2_22LayerNorm1 × 512 × 1024
254Dec_FFN_22Feed Forward1 × 512 × 1024
255Dec_SelfAttn_23Multi-Head Attention1 × 512 × 1024
256Dec_Add_23Add1 × 512 × 1024
257Dec_Norm1_23LayerNorm1 × 512 × 1024
258Dec_CrossAttn_23Cross-Attention1 × 512 × 1024
259Dec_Add2_23Add1 × 512 × 1024
260Dec_Norm2_23LayerNorm1 × 512 × 1024
261Dec_FFN_23Feed Forward1 × 512 × 1024
262Dec_SelfAttn_24Multi-Head Attention1 × 512 × 1024
263Dec_Add_24Add1 × 512 × 1024
264Dec_Norm1_24LayerNorm1 × 512 × 1024
265Dec_CrossAttn_24Cross-Attention1 × 512 × 1024
266Dec_Add2_24Add1 × 512 × 1024
267Dec_Norm2_24LayerNorm1 × 512 × 1024
268Dec_FFN_24Feed Forward1 × 512 × 1024
269LM_HeadLinear1 × 512 × 32128
270OutputOutput1 × 512 × 32128

What the verifier says

infoAt 48 stacked attention layers, residual-branch outputs add up; unscaled init lets activation variance grow with depth. GPT-2/LLaMA-family models scale the residual projections by depth (N(0, 0.02 / √(2L))). Fix: Scale residual output projections by depth: nn.init.normal_(w, std=0.02 / math.sqrt(2 * n_layers))
deep-attention-default-init

Do this to your own model

Same numbers, on a model in your repo, in one command. No account.

pip install neurarch-trace
neurarch-trace facebook/w2v-bert-2.0 --plan --share