N Neurarch Architectures Models Checks Data Docs Open the app

Models / minimax_m3_vl

MiniMax-M3-MXFP4

Reconstructed from its own config.json with no weights read. 122K downloads on Hugging Face.

Our count against the checkpoint

The left number comes from the graph. The right one is the number of scalars in the published weight files. Nothing on this page was tuned to make them agree.

Derived from structure
19.00B
18,999,029,760 parameters
In the published checkpoint
232B
231,876,225,920 scalars · safetensors.total, read 2026-07-17
Delta
-91.8%

quantized This checkpoint is stored quantized (quark). The tensor count in the file counts stored elements under a packing scheme, not logical parameters, so the two numbers below are not measuring the same thing in either direction.

What it costs to run

Cost is a roofline estimate on the priced GPU for 10 epochs at batch 32 over 50,000 samples (assumed; no dataset attached). GPU fit is fp32 weights plus gradients plus two Adam moments (16 bytes per parameter) with 1.3x headroom; activations are not included and grow with batch size.

Layers
242
Will it forward-pass
Yes
Priced on
A10G (24GB)
Est. one run
$15614498.88
CardMemory
T4 (16GB)weights + activationsdoes not fit
A100 (40GB)weights + activationsdoes not fit
H100 (80GB)weights + activationsdoes not fit

Structure

244 nodes. Output shapes are propagated from the input shape, batch dimension excluded.

LayerTypeOutput shape
1InputInput1 × 1048576
2EmbeddingEmbedding1 × 1048576 × 6144
3Positional_EmbeddingLearned Pos Embed1 × 1048576 × 6144
4Attention_1Multi-Head Attention1 × 1048576 × 6144
5Add_1Add1 × 1048576 × 6144
6LayerNorm_1_1LayerNorm1 × 1048576 × 6144
7FFN_1Feed Forward1 × 1048576 × 6144
8Attention_2Multi-Head Attention1 × 1048576 × 6144
9Add_2Add1 × 1048576 × 6144
10LayerNorm_2_1LayerNorm1 × 1048576 × 6144
11FFN_2Feed Forward1 × 1048576 × 6144
12Attention_3Multi-Head Attention1 × 1048576 × 6144
13Add_3Add1 × 1048576 × 6144
14LayerNorm_3_1LayerNorm1 × 1048576 × 6144
15FFN_3Feed Forward1 × 1048576 × 6144
16Attention_4Multi-Head Attention1 × 1048576 × 6144
17Add_4Add1 × 1048576 × 6144
18LayerNorm_4_1LayerNorm1 × 1048576 × 6144
19FFN_4Feed Forward1 × 1048576 × 6144
20Attention_5Multi-Head Attention1 × 1048576 × 6144
21Add_5Add1 × 1048576 × 6144
22LayerNorm_5_1LayerNorm1 × 1048576 × 6144
23FFN_5Feed Forward1 × 1048576 × 6144
24Attention_6Multi-Head Attention1 × 1048576 × 6144
25Add_6Add1 × 1048576 × 6144
26LayerNorm_6_1LayerNorm1 × 1048576 × 6144
27FFN_6Feed Forward1 × 1048576 × 6144
28Attention_7Multi-Head Attention1 × 1048576 × 6144
29Add_7Add1 × 1048576 × 6144
30LayerNorm_7_1LayerNorm1 × 1048576 × 6144
31FFN_7Feed Forward1 × 1048576 × 6144
32Attention_8Multi-Head Attention1 × 1048576 × 6144
33Add_8Add1 × 1048576 × 6144
34LayerNorm_8_1LayerNorm1 × 1048576 × 6144
35FFN_8Feed Forward1 × 1048576 × 6144
36Attention_9Multi-Head Attention1 × 1048576 × 6144
37Add_9Add1 × 1048576 × 6144
38LayerNorm_9_1LayerNorm1 × 1048576 × 6144
39FFN_9Feed Forward1 × 1048576 × 6144
40Attention_10Multi-Head Attention1 × 1048576 × 6144
41Add_10Add1 × 1048576 × 6144
42LayerNorm_10_1LayerNorm1 × 1048576 × 6144
43FFN_10Feed Forward1 × 1048576 × 6144
44Attention_11Multi-Head Attention1 × 1048576 × 6144
45Add_11Add1 × 1048576 × 6144
46LayerNorm_11_1LayerNorm1 × 1048576 × 6144
47FFN_11Feed Forward1 × 1048576 × 6144
48Attention_12Multi-Head Attention1 × 1048576 × 6144
49Add_12Add1 × 1048576 × 6144
50LayerNorm_12_1LayerNorm1 × 1048576 × 6144
51FFN_12Feed Forward1 × 1048576 × 6144
52Attention_13Multi-Head Attention1 × 1048576 × 6144
53Add_13Add1 × 1048576 × 6144
54LayerNorm_13_1LayerNorm1 × 1048576 × 6144
55FFN_13Feed Forward1 × 1048576 × 6144
56Attention_14Multi-Head Attention1 × 1048576 × 6144
57Add_14Add1 × 1048576 × 6144
58LayerNorm_14_1LayerNorm1 × 1048576 × 6144
59FFN_14Feed Forward1 × 1048576 × 6144
60Attention_15Multi-Head Attention1 × 1048576 × 6144
61Add_15Add1 × 1048576 × 6144
62LayerNorm_15_1LayerNorm1 × 1048576 × 6144
63FFN_15Feed Forward1 × 1048576 × 6144
64Attention_16Multi-Head Attention1 × 1048576 × 6144
65Add_16Add1 × 1048576 × 6144
66LayerNorm_16_1LayerNorm1 × 1048576 × 6144
67FFN_16Feed Forward1 × 1048576 × 6144
68Attention_17Multi-Head Attention1 × 1048576 × 6144
69Add_17Add1 × 1048576 × 6144
70LayerNorm_17_1LayerNorm1 × 1048576 × 6144
71FFN_17Feed Forward1 × 1048576 × 6144
72Attention_18Multi-Head Attention1 × 1048576 × 6144
73Add_18Add1 × 1048576 × 6144
74LayerNorm_18_1LayerNorm1 × 1048576 × 6144
75FFN_18Feed Forward1 × 1048576 × 6144
76Attention_19Multi-Head Attention1 × 1048576 × 6144
77Add_19Add1 × 1048576 × 6144
78LayerNorm_19_1LayerNorm1 × 1048576 × 6144
79FFN_19Feed Forward1 × 1048576 × 6144
80Attention_20Multi-Head Attention1 × 1048576 × 6144
81Add_20Add1 × 1048576 × 6144
82LayerNorm_20_1LayerNorm1 × 1048576 × 6144
83FFN_20Feed Forward1 × 1048576 × 6144
84Attention_21Multi-Head Attention1 × 1048576 × 6144
85Add_21Add1 × 1048576 × 6144
86LayerNorm_21_1LayerNorm1 × 1048576 × 6144
87FFN_21Feed Forward1 × 1048576 × 6144
88Attention_22Multi-Head Attention1 × 1048576 × 6144
89Add_22Add1 × 1048576 × 6144
90LayerNorm_22_1LayerNorm1 × 1048576 × 6144
91FFN_22Feed Forward1 × 1048576 × 6144
92Attention_23Multi-Head Attention1 × 1048576 × 6144
93Add_23Add1 × 1048576 × 6144
94LayerNorm_23_1LayerNorm1 × 1048576 × 6144
95FFN_23Feed Forward1 × 1048576 × 6144
96Attention_24Multi-Head Attention1 × 1048576 × 6144
97Add_24Add1 × 1048576 × 6144
98LayerNorm_24_1LayerNorm1 × 1048576 × 6144
99FFN_24Feed Forward1 × 1048576 × 6144
100Attention_25Multi-Head Attention1 × 1048576 × 6144
101Add_25Add1 × 1048576 × 6144
102LayerNorm_25_1LayerNorm1 × 1048576 × 6144
103FFN_25Feed Forward1 × 1048576 × 6144
104Attention_26Multi-Head Attention1 × 1048576 × 6144
105Add_26Add1 × 1048576 × 6144
106LayerNorm_26_1LayerNorm1 × 1048576 × 6144
107FFN_26Feed Forward1 × 1048576 × 6144
108Attention_27Multi-Head Attention1 × 1048576 × 6144
109Add_27Add1 × 1048576 × 6144
110LayerNorm_27_1LayerNorm1 × 1048576 × 6144
111FFN_27Feed Forward1 × 1048576 × 6144
112Attention_28Multi-Head Attention1 × 1048576 × 6144
113Add_28Add1 × 1048576 × 6144
114LayerNorm_28_1LayerNorm1 × 1048576 × 6144
115FFN_28Feed Forward1 × 1048576 × 6144
116Attention_29Multi-Head Attention1 × 1048576 × 6144
117Add_29Add1 × 1048576 × 6144
118LayerNorm_29_1LayerNorm1 × 1048576 × 6144
119FFN_29Feed Forward1 × 1048576 × 6144
120Attention_30Multi-Head Attention1 × 1048576 × 6144
121Add_30Add1 × 1048576 × 6144
122LayerNorm_30_1LayerNorm1 × 1048576 × 6144
123FFN_30Feed Forward1 × 1048576 × 6144
124Attention_31Multi-Head Attention1 × 1048576 × 6144
125Add_31Add1 × 1048576 × 6144
126LayerNorm_31_1LayerNorm1 × 1048576 × 6144
127FFN_31Feed Forward1 × 1048576 × 6144
128Attention_32Multi-Head Attention1 × 1048576 × 6144
129Add_32Add1 × 1048576 × 6144
130LayerNorm_32_1LayerNorm1 × 1048576 × 6144
131FFN_32Feed Forward1 × 1048576 × 6144
132Attention_33Multi-Head Attention1 × 1048576 × 6144
133Add_33Add1 × 1048576 × 6144
134LayerNorm_33_1LayerNorm1 × 1048576 × 6144
135FFN_33Feed Forward1 × 1048576 × 6144
136Attention_34Multi-Head Attention1 × 1048576 × 6144
137Add_34Add1 × 1048576 × 6144
138LayerNorm_34_1LayerNorm1 × 1048576 × 6144
139FFN_34Feed Forward1 × 1048576 × 6144
140Attention_35Multi-Head Attention1 × 1048576 × 6144
141Add_35Add1 × 1048576 × 6144
142LayerNorm_35_1LayerNorm1 × 1048576 × 6144
143FFN_35Feed Forward1 × 1048576 × 6144
144Attention_36Multi-Head Attention1 × 1048576 × 6144
145Add_36Add1 × 1048576 × 6144
146LayerNorm_36_1LayerNorm1 × 1048576 × 6144
147FFN_36Feed Forward1 × 1048576 × 6144
148Attention_37Multi-Head Attention1 × 1048576 × 6144
149Add_37Add1 × 1048576 × 6144
150LayerNorm_37_1LayerNorm1 × 1048576 × 6144
151FFN_37Feed Forward1 × 1048576 × 6144
152Attention_38Multi-Head Attention1 × 1048576 × 6144
153Add_38Add1 × 1048576 × 6144
154LayerNorm_38_1LayerNorm1 × 1048576 × 6144
155FFN_38Feed Forward1 × 1048576 × 6144
156Attention_39Multi-Head Attention1 × 1048576 × 6144
157Add_39Add1 × 1048576 × 6144
158LayerNorm_39_1LayerNorm1 × 1048576 × 6144
159FFN_39Feed Forward1 × 1048576 × 6144
160Attention_40Multi-Head Attention1 × 1048576 × 6144
161Add_40Add1 × 1048576 × 6144
162LayerNorm_40_1LayerNorm1 × 1048576 × 6144
163FFN_40Feed Forward1 × 1048576 × 6144
164Attention_41Multi-Head Attention1 × 1048576 × 6144
165Add_41Add1 × 1048576 × 6144
166LayerNorm_41_1LayerNorm1 × 1048576 × 6144
167FFN_41Feed Forward1 × 1048576 × 6144
168Attention_42Multi-Head Attention1 × 1048576 × 6144
169Add_42Add1 × 1048576 × 6144
170LayerNorm_42_1LayerNorm1 × 1048576 × 6144
171FFN_42Feed Forward1 × 1048576 × 6144
172Attention_43Multi-Head Attention1 × 1048576 × 6144
173Add_43Add1 × 1048576 × 6144
174LayerNorm_43_1LayerNorm1 × 1048576 × 6144
175FFN_43Feed Forward1 × 1048576 × 6144
176Attention_44Multi-Head Attention1 × 1048576 × 6144
177Add_44Add1 × 1048576 × 6144
178LayerNorm_44_1LayerNorm1 × 1048576 × 6144
179FFN_44Feed Forward1 × 1048576 × 6144
180Attention_45Multi-Head Attention1 × 1048576 × 6144
181Add_45Add1 × 1048576 × 6144
182LayerNorm_45_1LayerNorm1 × 1048576 × 6144
183FFN_45Feed Forward1 × 1048576 × 6144
184Attention_46Multi-Head Attention1 × 1048576 × 6144
185Add_46Add1 × 1048576 × 6144
186LayerNorm_46_1LayerNorm1 × 1048576 × 6144
187FFN_46Feed Forward1 × 1048576 × 6144
188Attention_47Multi-Head Attention1 × 1048576 × 6144
189Add_47Add1 × 1048576 × 6144
190LayerNorm_47_1LayerNorm1 × 1048576 × 6144
191FFN_47Feed Forward1 × 1048576 × 6144
192Attention_48Multi-Head Attention1 × 1048576 × 6144
193Add_48Add1 × 1048576 × 6144
194LayerNorm_48_1LayerNorm1 × 1048576 × 6144
195FFN_48Feed Forward1 × 1048576 × 6144
196Attention_49Multi-Head Attention1 × 1048576 × 6144
197Add_49Add1 × 1048576 × 6144
198LayerNorm_49_1LayerNorm1 × 1048576 × 6144
199FFN_49Feed Forward1 × 1048576 × 6144
200Attention_50Multi-Head Attention1 × 1048576 × 6144
201Add_50Add1 × 1048576 × 6144
202LayerNorm_50_1LayerNorm1 × 1048576 × 6144
203FFN_50Feed Forward1 × 1048576 × 6144
204Attention_51Multi-Head Attention1 × 1048576 × 6144
205Add_51Add1 × 1048576 × 6144
206LayerNorm_51_1LayerNorm1 × 1048576 × 6144
207FFN_51Feed Forward1 × 1048576 × 6144
208Attention_52Multi-Head Attention1 × 1048576 × 6144
209Add_52Add1 × 1048576 × 6144
210LayerNorm_52_1LayerNorm1 × 1048576 × 6144
211FFN_52Feed Forward1 × 1048576 × 6144
212Attention_53Multi-Head Attention1 × 1048576 × 6144
213Add_53Add1 × 1048576 × 6144
214LayerNorm_53_1LayerNorm1 × 1048576 × 6144
215FFN_53Feed Forward1 × 1048576 × 6144
216Attention_54Multi-Head Attention1 × 1048576 × 6144
217Add_54Add1 × 1048576 × 6144
218LayerNorm_54_1LayerNorm1 × 1048576 × 6144
219FFN_54Feed Forward1 × 1048576 × 6144
220Attention_55Multi-Head Attention1 × 1048576 × 6144
221Add_55Add1 × 1048576 × 6144
222LayerNorm_55_1LayerNorm1 × 1048576 × 6144
223FFN_55Feed Forward1 × 1048576 × 6144
224Attention_56Multi-Head Attention1 × 1048576 × 6144
225Add_56Add1 × 1048576 × 6144
226LayerNorm_56_1LayerNorm1 × 1048576 × 6144
227FFN_56Feed Forward1 × 1048576 × 6144
228Attention_57Multi-Head Attention1 × 1048576 × 6144
229Add_57Add1 × 1048576 × 6144
230LayerNorm_57_1LayerNorm1 × 1048576 × 6144
231FFN_57Feed Forward1 × 1048576 × 6144
232Attention_58Multi-Head Attention1 × 1048576 × 6144
233Add_58Add1 × 1048576 × 6144
234LayerNorm_58_1LayerNorm1 × 1048576 × 6144
235FFN_58Feed Forward1 × 1048576 × 6144
236Attention_59Multi-Head Attention1 × 1048576 × 6144
237Add_59Add1 × 1048576 × 6144
238LayerNorm_59_1LayerNorm1 × 1048576 × 6144
239FFN_59Feed Forward1 × 1048576 × 6144
240Attention_60Multi-Head Attention1 × 1048576 × 6144
241Add_60Add1 × 1048576 × 6144
242LayerNorm_60_1LayerNorm1 × 1048576 × 6144
243FFN_60Feed Forward1 × 1048576 × 6144
244OutputOutput1 × 1048576 × 6144

What the verifier says

info60 attention layers at embedDim 6144 cache full per-head K/V: about 1440 KB per token at fp16, which dominates memory at long context. Grouped-query attention (e.g. 8:1) would cut this ~8×; multi-head latent attention (MLA) shrinks it ~10× or more. This is the move production LLMs make; it does not change the parameter count. Fix: Switch attention to groupedQueryAttention (set numKVHeads below numHeads, e.g. numHeads/4) or mla (a low-rank cached latent).
full-mha-serving-cost
infoAt 60 stacked attention layers, residual-branch outputs add up; unscaled init lets activation variance grow with depth. GPT-2/LLaMA-family models scale the residual projections by depth (N(0, 0.02 / √(2L))). Fix: Scale residual output projections by depth: nn.init.normal_(w, std=0.02 / math.sqrt(2 * n_layers))
deep-attention-default-init
warnAcross 60 attention layers this design caches 1440 KB per token, so a single 8,192-token sequence needs ~12.1 GB of KV cache before weights or activations. That exceeds the 4 GB budget this rule assumes for serving headroom. Fix: Cut KV width: raise the GQA ratio (fewer numKVHeads), switch to MLA, reduce depth or embedDim, or accept a shorter serving context.
kv-cache-context-budget

Do this to your own model

Same numbers, on a model in your repo, in one command. No account.

pip install neurarch-trace
neurarch-trace amd/MiniMax-M3-MXFP4 --plan --share

Other minimax_m3_vl checkpoints

MiniMax-M3
19.00B derived · -95.6% against the checkpoint
MiniMax-M3-MXFP8
19.00B derived · -95.7% against the checkpoint
MiniMax-M3-NVFP4
19.00B derived · -91.4% against the checkpoint