Models / bart
bart-large-mnli
Reconstructed from its own config.json
with no weights read. 3.2M downloads on Hugging Face.
Our count against the checkpoint
The left number comes from the graph. The right one is the number of scalars in the published weight files. Nothing on this page was tuned to make them agree.
Derived from structure
405M
405,185,536 parameters
Delta
-0.53%
What it costs to run
Cost is a roofline estimate on the priced GPU for 10 epochs at batch 32 over 50,000 samples (assumed; no dataset attached). GPU fit is fp32 weights plus gradients plus two Adam moments (16 bytes per parameter) with 1.3x headroom; activations are not included and grow with batch size.
Layers
136
Will it forward-pass
Yes
Priced on
A10G (24GB)
Est. one run
$14.56
| Card | Memory | |
|---|---|---|
| T4 (16GB) | weights + activations | fits |
| A100 (40GB) | weights + activations | fits |
| H100 (80GB) | weights + activations | fits |
Structure
138 nodes. Output shapes are propagated from the input shape, batch dimension excluded.
| Layer | Type | Output shape | |
|---|---|---|---|
| 1 | Input | Input | 1 × 1024 |
| 2 | Encoder_Embedding | Embedding | 1 × 1024 × 1024 |
| 3 | Encoder_Position_Embedding | Learned Pos Embed | 1 × 1024 × 1024 |
| 4 | Enc_Attn_1 | Multi-Head Attention | 1 × 1024 × 1024 |
| 5 | Enc_Add_1 | Add | 1 × 1024 × 1024 |
| 6 | Enc_Norm_1 | LayerNorm | 1 × 1024 × 1024 |
| 7 | Enc_FFN_1 | Feed Forward | 1 × 1024 × 1024 |
| 8 | Enc_Attn_2 | Multi-Head Attention | 1 × 1024 × 1024 |
| 9 | Enc_Add_2 | Add | 1 × 1024 × 1024 |
| 10 | Enc_Norm_2 | LayerNorm | 1 × 1024 × 1024 |
| 11 | Enc_FFN_2 | Feed Forward | 1 × 1024 × 1024 |
| 12 | Enc_Attn_3 | Multi-Head Attention | 1 × 1024 × 1024 |
| 13 | Enc_Add_3 | Add | 1 × 1024 × 1024 |
| 14 | Enc_Norm_3 | LayerNorm | 1 × 1024 × 1024 |
| 15 | Enc_FFN_3 | Feed Forward | 1 × 1024 × 1024 |
| 16 | Enc_Attn_4 | Multi-Head Attention | 1 × 1024 × 1024 |
| 17 | Enc_Add_4 | Add | 1 × 1024 × 1024 |
| 18 | Enc_Norm_4 | LayerNorm | 1 × 1024 × 1024 |
| 19 | Enc_FFN_4 | Feed Forward | 1 × 1024 × 1024 |
| 20 | Enc_Attn_5 | Multi-Head Attention | 1 × 1024 × 1024 |
| 21 | Enc_Add_5 | Add | 1 × 1024 × 1024 |
| 22 | Enc_Norm_5 | LayerNorm | 1 × 1024 × 1024 |
| 23 | Enc_FFN_5 | Feed Forward | 1 × 1024 × 1024 |
| 24 | Enc_Attn_6 | Multi-Head Attention | 1 × 1024 × 1024 |
| 25 | Enc_Add_6 | Add | 1 × 1024 × 1024 |
| 26 | Enc_Norm_6 | LayerNorm | 1 × 1024 × 1024 |
| 27 | Enc_FFN_6 | Feed Forward | 1 × 1024 × 1024 |
| 28 | Enc_Attn_7 | Multi-Head Attention | 1 × 1024 × 1024 |
| 29 | Enc_Add_7 | Add | 1 × 1024 × 1024 |
| 30 | Enc_Norm_7 | LayerNorm | 1 × 1024 × 1024 |
| 31 | Enc_FFN_7 | Feed Forward | 1 × 1024 × 1024 |
| 32 | Enc_Attn_8 | Multi-Head Attention | 1 × 1024 × 1024 |
| 33 | Enc_Add_8 | Add | 1 × 1024 × 1024 |
| 34 | Enc_Norm_8 | LayerNorm | 1 × 1024 × 1024 |
| 35 | Enc_FFN_8 | Feed Forward | 1 × 1024 × 1024 |
| 36 | Enc_Attn_9 | Multi-Head Attention | 1 × 1024 × 1024 |
| 37 | Enc_Add_9 | Add | 1 × 1024 × 1024 |
| 38 | Enc_Norm_9 | LayerNorm | 1 × 1024 × 1024 |
| 39 | Enc_FFN_9 | Feed Forward | 1 × 1024 × 1024 |
| 40 | Enc_Attn_10 | Multi-Head Attention | 1 × 1024 × 1024 |
| 41 | Enc_Add_10 | Add | 1 × 1024 × 1024 |
| 42 | Enc_Norm_10 | LayerNorm | 1 × 1024 × 1024 |
| 43 | Enc_FFN_10 | Feed Forward | 1 × 1024 × 1024 |
| 44 | Enc_Attn_11 | Multi-Head Attention | 1 × 1024 × 1024 |
| 45 | Enc_Add_11 | Add | 1 × 1024 × 1024 |
| 46 | Enc_Norm_11 | LayerNorm | 1 × 1024 × 1024 |
| 47 | Enc_FFN_11 | Feed Forward | 1 × 1024 × 1024 |
| 48 | Enc_Attn_12 | Multi-Head Attention | 1 × 1024 × 1024 |
| 49 | Enc_Add_12 | Add | 1 × 1024 × 1024 |
| 50 | Enc_Norm_12 | LayerNorm | 1 × 1024 × 1024 |
| 51 | Enc_FFN_12 | Feed Forward | 1 × 1024 × 1024 |
| 52 | Decoder_Embedding | Embedding | 1 × 1024 × 1024 |
| 53 | Dec_SelfAttn_1 | Multi-Head Attention | 1 × 1024 × 1024 |
| 54 | Dec_Add_1 | Add | 1 × 1024 × 1024 |
| 55 | Dec_Norm1_1 | LayerNorm | 1 × 1024 × 1024 |
| 56 | Dec_CrossAttn_1 | Cross-Attention | 1 × 1024 × 1024 |
| 57 | Dec_Add2_1 | Add | 1 × 1024 × 1024 |
| 58 | Dec_Norm2_1 | LayerNorm | 1 × 1024 × 1024 |
| 59 | Dec_FFN_1 | Feed Forward | 1 × 1024 × 1024 |
| 60 | Dec_SelfAttn_2 | Multi-Head Attention | 1 × 1024 × 1024 |
| 61 | Dec_Add_2 | Add | 1 × 1024 × 1024 |
| 62 | Dec_Norm1_2 | LayerNorm | 1 × 1024 × 1024 |
| 63 | Dec_CrossAttn_2 | Cross-Attention | 1 × 1024 × 1024 |
| 64 | Dec_Add2_2 | Add | 1 × 1024 × 1024 |
| 65 | Dec_Norm2_2 | LayerNorm | 1 × 1024 × 1024 |
| 66 | Dec_FFN_2 | Feed Forward | 1 × 1024 × 1024 |
| 67 | Dec_SelfAttn_3 | Multi-Head Attention | 1 × 1024 × 1024 |
| 68 | Dec_Add_3 | Add | 1 × 1024 × 1024 |
| 69 | Dec_Norm1_3 | LayerNorm | 1 × 1024 × 1024 |
| 70 | Dec_CrossAttn_3 | Cross-Attention | 1 × 1024 × 1024 |
| 71 | Dec_Add2_3 | Add | 1 × 1024 × 1024 |
| 72 | Dec_Norm2_3 | LayerNorm | 1 × 1024 × 1024 |
| 73 | Dec_FFN_3 | Feed Forward | 1 × 1024 × 1024 |
| 74 | Dec_SelfAttn_4 | Multi-Head Attention | 1 × 1024 × 1024 |
| 75 | Dec_Add_4 | Add | 1 × 1024 × 1024 |
| 76 | Dec_Norm1_4 | LayerNorm | 1 × 1024 × 1024 |
| 77 | Dec_CrossAttn_4 | Cross-Attention | 1 × 1024 × 1024 |
| 78 | Dec_Add2_4 | Add | 1 × 1024 × 1024 |
| 79 | Dec_Norm2_4 | LayerNorm | 1 × 1024 × 1024 |
| 80 | Dec_FFN_4 | Feed Forward | 1 × 1024 × 1024 |
| 81 | Dec_SelfAttn_5 | Multi-Head Attention | 1 × 1024 × 1024 |
| 82 | Dec_Add_5 | Add | 1 × 1024 × 1024 |
| 83 | Dec_Norm1_5 | LayerNorm | 1 × 1024 × 1024 |
| 84 | Dec_CrossAttn_5 | Cross-Attention | 1 × 1024 × 1024 |
| 85 | Dec_Add2_5 | Add | 1 × 1024 × 1024 |
| 86 | Dec_Norm2_5 | LayerNorm | 1 × 1024 × 1024 |
| 87 | Dec_FFN_5 | Feed Forward | 1 × 1024 × 1024 |
| 88 | Dec_SelfAttn_6 | Multi-Head Attention | 1 × 1024 × 1024 |
| 89 | Dec_Add_6 | Add | 1 × 1024 × 1024 |
| 90 | Dec_Norm1_6 | LayerNorm | 1 × 1024 × 1024 |
| 91 | Dec_CrossAttn_6 | Cross-Attention | 1 × 1024 × 1024 |
| 92 | Dec_Add2_6 | Add | 1 × 1024 × 1024 |
| 93 | Dec_Norm2_6 | LayerNorm | 1 × 1024 × 1024 |
| 94 | Dec_FFN_6 | Feed Forward | 1 × 1024 × 1024 |
| 95 | Dec_SelfAttn_7 | Multi-Head Attention | 1 × 1024 × 1024 |
| 96 | Dec_Add_7 | Add | 1 × 1024 × 1024 |
| 97 | Dec_Norm1_7 | LayerNorm | 1 × 1024 × 1024 |
| 98 | Dec_CrossAttn_7 | Cross-Attention | 1 × 1024 × 1024 |
| 99 | Dec_Add2_7 | Add | 1 × 1024 × 1024 |
| 100 | Dec_Norm2_7 | LayerNorm | 1 × 1024 × 1024 |
| 101 | Dec_FFN_7 | Feed Forward | 1 × 1024 × 1024 |
| 102 | Dec_SelfAttn_8 | Multi-Head Attention | 1 × 1024 × 1024 |
| 103 | Dec_Add_8 | Add | 1 × 1024 × 1024 |
| 104 | Dec_Norm1_8 | LayerNorm | 1 × 1024 × 1024 |
| 105 | Dec_CrossAttn_8 | Cross-Attention | 1 × 1024 × 1024 |
| 106 | Dec_Add2_8 | Add | 1 × 1024 × 1024 |
| 107 | Dec_Norm2_8 | LayerNorm | 1 × 1024 × 1024 |
| 108 | Dec_FFN_8 | Feed Forward | 1 × 1024 × 1024 |
| 109 | Dec_SelfAttn_9 | Multi-Head Attention | 1 × 1024 × 1024 |
| 110 | Dec_Add_9 | Add | 1 × 1024 × 1024 |
| 111 | Dec_Norm1_9 | LayerNorm | 1 × 1024 × 1024 |
| 112 | Dec_CrossAttn_9 | Cross-Attention | 1 × 1024 × 1024 |
| 113 | Dec_Add2_9 | Add | 1 × 1024 × 1024 |
| 114 | Dec_Norm2_9 | LayerNorm | 1 × 1024 × 1024 |
| 115 | Dec_FFN_9 | Feed Forward | 1 × 1024 × 1024 |
| 116 | Dec_SelfAttn_10 | Multi-Head Attention | 1 × 1024 × 1024 |
| 117 | Dec_Add_10 | Add | 1 × 1024 × 1024 |
| 118 | Dec_Norm1_10 | LayerNorm | 1 × 1024 × 1024 |
| 119 | Dec_CrossAttn_10 | Cross-Attention | 1 × 1024 × 1024 |
| 120 | Dec_Add2_10 | Add | 1 × 1024 × 1024 |
| 121 | Dec_Norm2_10 | LayerNorm | 1 × 1024 × 1024 |
| 122 | Dec_FFN_10 | Feed Forward | 1 × 1024 × 1024 |
| 123 | Dec_SelfAttn_11 | Multi-Head Attention | 1 × 1024 × 1024 |
| 124 | Dec_Add_11 | Add | 1 × 1024 × 1024 |
| 125 | Dec_Norm1_11 | LayerNorm | 1 × 1024 × 1024 |
| 126 | Dec_CrossAttn_11 | Cross-Attention | 1 × 1024 × 1024 |
| 127 | Dec_Add2_11 | Add | 1 × 1024 × 1024 |
| 128 | Dec_Norm2_11 | LayerNorm | 1 × 1024 × 1024 |
| 129 | Dec_FFN_11 | Feed Forward | 1 × 1024 × 1024 |
| 130 | Dec_SelfAttn_12 | Multi-Head Attention | 1 × 1024 × 1024 |
| 131 | Dec_Add_12 | Add | 1 × 1024 × 1024 |
| 132 | Dec_Norm1_12 | LayerNorm | 1 × 1024 × 1024 |
| 133 | Dec_CrossAttn_12 | Cross-Attention | 1 × 1024 × 1024 |
| 134 | Dec_Add2_12 | Add | 1 × 1024 × 1024 |
| 135 | Dec_Norm2_12 | LayerNorm | 1 × 1024 × 1024 |
| 136 | Dec_FFN_12 | Feed Forward | 1 × 1024 × 1024 |
| 137 | LM_Head | Linear | 1 × 1024 × 50265 |
| 138 | Output | Output | 1 × 1024 × 50265 |
What the verifier says
infoAt 24 stacked attention layers, residual-branch outputs add up; unscaled init lets activation variance grow with depth. GPT-2/LLaMA-family models scale the residual projections by depth (N(0, 0.02 / √(2L))). Fix: Scale residual output projections by depth: nn.init.normal_(w, std=0.02 / math.sqrt(2 * n_layers))
deep-attention-default-init
deep-attention-default-init
Do this to your own model
Same numbers, on a model in your repo, in one command. No account.
pip install neurarch-trace
neurarch-trace facebook/bart-large-mnli --plan --share