AMD · datacenter

Instinct MI325X

Instinct MI325X has 256 GB of VRAM at 6000 GB/s — about 238.08 GiB usable after driver and compositor overhead. 2115 of 2118 indexed models fit at 128K context with q4_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
256 GB
HBM3e
Bandwidth
6000 GB/s
8192-bit bus
Tensor FP16
1307 TF
dense
TDP
1000 W
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1817vision language 194image 2audio tts 21audio asr 39video 16embedding 26

What fits at 128K context

largest quantization that fits, per model · 2115 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
ERNIE-4.5-300B-A47B-PTQ6_K300B228.88 GiB7.59 GiB237.50 GiB0.58 GiB16±26.5%
DeepSeek-Coder-V2-Instruct-0724MoEQ8_0236B233.41 GiB2.37 GiB236.72 GiB1.36 GiB80±37%
DeepSeek-V2.5MoEQ8_0236B233.41 GiB2.37 GiB236.72 GiB1.36 GiB80±37%
DeepSeek-Coder-V2-InstructMoEQ8_0236B233.41 GiB2.37 GiB236.72 GiB1.36 GiB80±37%
Trinity-Large-ThinkingMoEQ4_1399B232.94 GiB2.33 GiB236.20 GiB1.88 GiB97±37%
MiniMax-M2.1MoEQ8_0229B226.44 GiB8.72 GiB236.04 GiB2.04 GiB69±37%
MiniMax-M2.5MoEQ8_0229B226.44 GiB8.72 GiB236.04 GiB2.04 GiB69±37%
MiniMax-M2MoEQ8_0229B226.44 GiB8.72 GiB236.04 GiB2.04 GiB69±37%
MiniMax-M2.7MoEQ8_0229B226.44 GiB8.72 GiB236.04 GiB2.04 GiB69±37%
Trinity-Large-PreviewMoEQ4_1399B232.76 GiB2.33 GiB236.02 GiB2.06 GiB97±37%
Trinity-Large-TrueBaseMoEQ4_1399B232.76 GiB2.33 GiB236.02 GiB2.06 GiB97±37%
MiniMax-M3MoEUD-Q4_K_S427B230.71 GiB4.22 GiB235.84 GiB2.24 GiB79±37%
Laguna-M.1MoEQ8_0226B223.63 GiB9.84 GiB234.42 GiB3.66 GiB56±37%
NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16MoEUD-IQ3_S561B233.30 GiB0.00 GiB234.23 GiB3.85 GiB83±37%
Qwen3.5-122B-A10B-hereticMoEBF16123B232.24 GiB0.84 GiB234.01 GiB4.07 GiB89±37%
Qwen3.5-122B-A10BMoEBF16125B232.24 GiB0.84 GiB234.01 GiB4.07 GiB89±37%
Ornith-1.0-397BMoEQ4_1397B231.99 GiB1.05 GiB233.99 GiB4.09 GiB99±37%
Nex-N2-ProMoEQ4_1397B231.99 GiB1.05 GiB233.99 GiB4.09 GiB99±37%
Qwen3.5-397B-A17BMoEQ4_K_L403B231.91 GiB1.05 GiB233.92 GiB4.16 GiB99±37%
Llama-4-Maverick-17B-128E-InstructMoEKV unresolvedQ4_K_M402B226.09 GiB6.75 GiB233.77 GiB4.31 GiB88±37%
MiMo-V2.5-ProMoEKV unresolvedIQ1_M1023B220.44 GiB12.30 GiB233.71 GiB4.37 GiB67±37%
Hermes-3-Llama-3.1-405BQ4_K_S406B214.67 GiB17.72 GiB233.57 GiB4.51 GiB16±26.5%
Kimi-K2-ThinkingMoEUD-TQ1_01058B229.90 GiB2.41 GiB233.29 GiB4.79 GiB93±37%
DeepSeek-V3.1MoEQ2_K_L685B229.03 GiB2.41 GiB232.42 GiB5.66 GiB85±37%
DeepSeek-V3.1-TerminusMoEQ2_K_L685B229.03 GiB2.41 GiB232.42 GiB5.66 GiB85±37%
cogito-671b-v2.1MoEQ2_K_L671B229.02 GiB2.41 GiB232.41 GiB5.67 GiB85±37%
DeepSeek-V3.2MoEQ2_K_L685B228.72 GiB2.41 GiB232.11 GiB5.97 GiB85±37%
DeepSeek-R1-0528MoEQ2_K_L685B228.17 GiB2.41 GiB231.56 GiB6.52 GiB85±37%
DeepSeek-TNG-R1T2-ChimeraMoEQ2_K_L685B228.17 GiB2.41 GiB231.56 GiB6.52 GiB85±37%
cogito-v2-preview-deepseek-671B-MoEMoEQ2_K_L671B228.17 GiB2.41 GiB231.56 GiB6.52 GiB85±37%
DeepSeek-V3-0324MoEQ2_K_L685B228.11 GiB2.41 GiB231.50 GiB6.58 GiB85±37%
r1-1776MoEQ2_K_L671B228.11 GiB2.41 GiB231.50 GiB6.58 GiB85±37%
DeepSeek-R1MoEQ2_K_L685B228.11 GiB2.41 GiB231.50 GiB6.58 GiB85±37%
DeepSeek-Prover-V2-671BMoEQ2_K_L685B227.64 GiB2.41 GiB231.03 GiB7.05 GiB85±37%
Kimi-K2-InstructMoEUD-TQ1_01026B226.87 GiB2.41 GiB230.27 GiB7.81 GiB94±37%
GLM-4.7-REAP-218B-A32BMoEQ8_0218B216.23 GiB12.94 GiB230.11 GiB7.97 GiB48±37%
NVIDIA-Nemotron-3-Super-120B-A12B-BF16MoEBF16124B224.93 GiB3.09 GiB228.92 GiB9.16 GiB77±37%
GLM-5MoEUD-IQ2_XXS754B224.52 GiB3.08 GiB228.55 GiB9.53 GiB84±37%
Kimi-K2.5MoEUD-TQ1_01059B223.09 GiB2.41 GiB226.48 GiB11.60 GiB95±37%
GLM-5.2MoEUD-IQ2_M753B222.19 GiB3.08 GiB226.23 GiB11.85 GiB85±37%
GLM-5.1MoEUD-IQ2_M754B219.96 GiB3.08 GiB224.00 GiB14.08 GiB85±37%
GLM-4.7MoEQ4_1358B209.72 GiB12.94 GiB223.60 GiB14.48 GiB58±37%
GLM-4.5MoEQ4_1358B209.66 GiB12.94 GiB223.54 GiB14.54 GiB58±37%
Mistral-Small-4-119B-2603MoEBF16119B221.65 GiB0.79 GiB223.37 GiB14.71 GiB93±37%
Qwen3-Coder-480B-A35B-InstructMoEQ3_K_M480B213.50 GiB8.72 GiB223.16 GiB14.92 GiB64±37%
GLM-4.6-Derestricted-v3MoEQ4_1357B208.76 GiB12.94 GiB222.64 GiB15.44 GiB58±37%
GLM-4.6MoEQ4_1357B208.76 GiB12.94 GiB222.64 GiB15.44 GiB58±37%
Laguna-S-2.1MoEBF16118B219.05 GiB1.73 GiB221.70 GiB16.38 GiB85±37%
Qwen3-Coder-REAP-363B-A35BMoEQ4_1363B211.68 GiB8.72 GiB221.34 GiB16.74 GiB59±37%
InklingMoEIQ1_M952B210.69 GiB9.28 GiB220.88 GiB17.20 GiB75±37%
Kimi-K2.6MoEIQ1_M1059B216.46 GiB2.41 GiB219.86 GiB18.22 GiB97±37%
GLM-4.6-REAP-268B-A32BMoEQ6_K269B205.68 GiB12.94 GiB219.56 GiB18.52 GiB54±37%
MiMo-V2.5MoEKV unresolvedUD-Q5_K_M311B214.37 GiB4.22 GiB219.54 GiB18.54 GiB83±37%
command-a-plus-05-2026-bf16MoEQ8_0219B216.03 GiB1.24 GiB218.17 GiB19.91 GiB74±37%
grok-2MoEQ6_K270B206.17 GiB9.00 GiB216.21 GiB21.87 GiB30±37%
GLM-4.5-AirMoEBF16110B205.82 GiB6.47 GiB213.22 GiB24.86 GiB65±37%
Step-3.7-FlashQ8_0201B197.44 GiB13.79 GiB212.16 GiB25.92 GiB18±26.5%
Hy3MoEQ5_K_M299B198.22 GiB11.25 GiB210.41 GiB27.67 GiB65±37%
step-3.5-flashQ8_0199B195.04 GiB13.79 GiB209.75 GiB28.33 GiB18±26.5%
MiMo-V2-FlashMoEKV unresolvedQ5_K_M310B204.17 GiB4.22 GiB209.33 GiB28.75 GiB86±37%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Instinct MI325X run?
2115 of 2118 indexed open-weight models fit a Instinct MI325X at 131,072 context with q4_0 KV cache, the largest being ERNIE-4.5-300B-A47B-PT at Q6_K. That covers text, vision-language, image, video and speech models.
How much usable memory does a Instinct MI325X actually have?
Its nameplate is 256 GB, but about 238.08 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Instinct MI325X fast for local AI?
Its memory bandwidth is 6000 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.