AMD · datacenter

Instinct MI325X

Instinct MI325X has 256 GB of VRAM at 6000 GB/s — about 238.08 GiB usable after driver and compositor overhead. 2115 of 2118 indexed models fit at 4K context with q4_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
256 GB
HBM3e
Bandwidth
6000 GB/s
8192-bit bus
Tensor FP16
1307 TF
dense
TDP
1000 W
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1817vision language 194image 2audio tts 21audio asr 39video 16embedding 26

What fits at 4K context

largest quantization that fits, per model · 2115 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
MiMo-V2-FlashMoEKV unresolvedQ6_K310B236.11 GiB0.13 GiB237.19 GiB0.89 GiB91±37%
MiniMax-M3MoEQ4_K_S427B234.10 GiB0.13 GiB235.14 GiB2.94 GiB91±37%
Llama-4-Maverick-17B-128E-InstructMoEKV unresolvedQ4_1402B233.50 GiB0.21 GiB234.63 GiB3.45 GiB116±37%
DeepSeek-Coder-V2-Instruct-0724MoEQ8_0236B233.41 GiB0.07 GiB234.42 GiB3.66 GiB87±37%
DeepSeek-V2.5MoEQ8_0236B233.41 GiB0.07 GiB234.42 GiB3.66 GiB87±37%
DeepSeek-Coder-V2-InstructMoEQ8_0236B233.41 GiB0.07 GiB234.42 GiB3.66 GiB87±37%
Devstral-2-123B-Instruct-2512BF16125B232.89 GiB0.39 GiB234.33 GiB3.75 GiB16±26.5%
Mistral-Medium-3.5-128BBF16128B232.89 GiB0.39 GiB234.33 GiB3.75 GiB16±26.5%
NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16MoEUD-IQ3_S561B233.30 GiB0.00 GiB234.23 GiB3.85 GiB83±37%
Trinity-Large-ThinkingMoEQ4_1399B232.94 GiB0.26 GiB234.13 GiB3.95 GiB106±37%
Qwen3-Coder-REAP-363B-A35BMoEQ5_K_S363B232.76 GiB0.27 GiB233.97 GiB4.11 GiB69±37%
Trinity-Large-PreviewMoEQ4_1399B232.76 GiB0.26 GiB233.95 GiB4.13 GiB106±37%
Trinity-Large-TrueBaseMoEQ4_1399B232.76 GiB0.26 GiB233.95 GiB4.13 GiB106±37%
Qwen3-VL-235B-A22B-InstructMoEQ8_0236B232.77 GiB0.21 GiB233.91 GiB4.17 GiB71±37%
Qwen3-VL-235B-A22B-ThinkingMoEQ8_0236B232.77 GiB0.21 GiB233.91 GiB4.17 GiB71±37%
Qwen3-235B-A22BMoEQ8_0235B232.77 GiB0.21 GiB233.91 GiB4.17 GiB71±37%
Qwen3-235B-A22B-Thinking-2507MoEQ8_0235B232.77 GiB0.21 GiB233.91 GiB4.17 GiB71±37%
Qwen3-235B-A22B-Instruct-2507MoEQ8_0235B232.77 GiB0.21 GiB233.91 GiB4.17 GiB71±37%
Qwen3.5-122B-A10B-hereticMoEBF16123B232.24 GiB0.03 GiB233.19 GiB4.89 GiB92±37%
Qwen3.5-122B-A10BMoEBF16125B232.24 GiB0.03 GiB233.19 GiB4.89 GiB92±37%
Ornith-1.0-397BMoEQ4_1397B231.99 GiB0.03 GiB232.97 GiB5.11 GiB103±37%
Nex-N2-ProMoEQ4_1397B231.99 GiB0.03 GiB232.97 GiB5.11 GiB103±37%
Qwen3.5-397B-A17BMoEQ4_K_L403B231.91 GiB0.03 GiB232.90 GiB5.18 GiB103±37%
GLM-4.7MoEQ5_K_S358B230.45 GiB0.40 GiB231.79 GiB6.29 GiB78±37%
GLM-4.5MoEQ5_K_S358B230.45 GiB0.40 GiB231.79 GiB6.29 GiB78±37%
Kimi-K2-ThinkingMoEUD-TQ1_01058B229.90 GiB0.08 GiB230.95 GiB7.13 GiB103±37%
GLM-4.6-Derestricted-v3MoEQ5_K_S357B229.46 GiB0.40 GiB230.80 GiB7.28 GiB79±37%
GLM-4.6MoEQ5_K_S357B229.46 GiB0.40 GiB230.80 GiB7.28 GiB79±37%
ERNIE-4.5-300B-A47B-PTQ6_K300B228.88 GiB0.24 GiB230.14 GiB7.94 GiB17±26.5%
DeepSeek-V3.1MoEQ2_K_L685B229.03 GiB0.08 GiB230.08 GiB8.00 GiB93±37%
DeepSeek-V3.1-TerminusMoEQ2_K_L685B229.03 GiB0.08 GiB230.08 GiB8.00 GiB93±37%
cogito-671b-v2.1MoEQ2_K_L671B229.02 GiB0.08 GiB230.07 GiB8.01 GiB93±37%
DeepSeek-V3.2MoEQ2_K_L685B228.72 GiB0.08 GiB229.77 GiB8.31 GiB93±37%
Hermes-3-Llama-3.1-405BQ4_K_L406B227.83 GiB0.55 GiB229.56 GiB8.52 GiB17±26.5%
DeepSeek-R1-0528MoEQ2_K_L685B228.17 GiB0.08 GiB229.23 GiB8.85 GiB94±37%
DeepSeek-TNG-R1T2-ChimeraMoEQ2_K_L685B228.17 GiB0.08 GiB229.23 GiB8.85 GiB94±37%
cogito-v2-preview-deepseek-671B-MoEMoEQ2_K_L671B228.17 GiB0.08 GiB229.22 GiB8.86 GiB94±37%
DeepSeek-V3-0324MoEQ2_K_L685B228.11 GiB0.08 GiB229.17 GiB8.91 GiB94±37%
r1-1776MoEQ2_K_L671B228.11 GiB0.08 GiB229.17 GiB8.91 GiB94±37%
DeepSeek-R1MoEQ2_K_L685B228.11 GiB0.08 GiB229.17 GiB8.91 GiB94±37%
DeepSeek-Prover-V2-671BMoEQ2_K_L685B227.64 GiB0.08 GiB228.70 GiB9.38 GiB94±37%
Hermes-4-405BQ4_K_M406B226.38 GiB0.55 GiB228.11 GiB9.97 GiB17±26.5%
Kimi-K2-InstructMoEUD-TQ1_01026B226.87 GiB0.08 GiB227.93 GiB10.15 GiB104±37%
MiniMax-M2.1MoEQ8_0229B226.44 GiB0.27 GiB227.60 GiB10.48 GiB93±37%
MiniMax-M2.5MoEQ8_0229B226.44 GiB0.27 GiB227.60 GiB10.48 GiB93±37%
MiniMax-M2MoEQ8_0229B226.44 GiB0.27 GiB227.60 GiB10.48 GiB93±37%
MiniMax-M2.7MoEQ8_0229B226.44 GiB0.27 GiB227.60 GiB10.48 GiB93±37%
NVIDIA-Nemotron-3-Super-120B-A12B-BF16MoEBF16124B224.93 GiB0.10 GiB225.92 GiB12.16 GiB86±37%
GLM-5MoEUD-IQ2_XXS754B224.52 GiB0.10 GiB225.56 GiB12.52 GiB95±37%
Laguna-M.1MoEQ8_0226B223.63 GiB0.31 GiB224.88 GiB13.20 GiB74±37%
Kimi-K2.5MoEUD-TQ1_01059B223.09 GiB0.08 GiB224.14 GiB13.94 GiB105±37%
GLM-5.2MoEUD-IQ2_M753B222.19 GiB0.10 GiB223.24 GiB14.84 GiB96±37%
Mistral-Small-4-119B-2603MoEBF16119B221.65 GiB0.02 GiB222.60 GiB15.48 GiB96±37%
MiMo-V2.5-ProMoEKV unresolvedIQ1_M1023B220.44 GiB0.38 GiB221.79 GiB16.29 GiB105±37%
GLM-5.1MoEUD-IQ2_M754B219.96 GiB0.10 GiB221.01 GiB17.07 GiB97±37%
Laguna-S-2.1MoEBF16118B219.05 GiB0.09 GiB220.06 GiB18.02 GiB91±37%
GLM-4.7-REAP-218B-A32BMoEQ8_0218B216.23 GiB0.40 GiB217.58 GiB20.50 GiB66±37%
Kimi-K2.6MoEIQ1_M1059B216.46 GiB0.08 GiB217.52 GiB20.56 GiB108±37%
command-a-plus-05-2026-bf16MoEQ8_0219B216.03 GiB0.14 GiB217.07 GiB21.01 GiB77±37%
MiMo-V2.5MoEKV unresolvedUD-Q5_K_M311B214.37 GiB0.13 GiB215.45 GiB22.63 GiB99±37%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Instinct MI325X run?
2115 of 2118 indexed open-weight models fit a Instinct MI325X at 4,096 context with q4_0 KV cache, the largest being MiMo-V2-Flash at Q6_K. That covers text, vision-language, image, video and speech models.
How much usable memory does a Instinct MI325X actually have?
Its nameplate is 256 GB, but about 238.08 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Instinct MI325X fast for local AI?
Its memory bandwidth is 6000 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.