AMD · datacenter

Instinct MI325X

Instinct MI325X has 256 GB of VRAM at 6000 GB/s — about 238.08 GiB usable after driver and compositor overhead. 2114 of 2118 indexed models fit at 128K context with q8_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
256 GB
HBM3e
Bandwidth
6000 GB/s
8192-bit bus
Tensor FP16
1307 TF
dense
TDP
1000 W
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1816vision language 194image 2audio tts 21audio asr 39video 16embedding 26

What fits at 128K context

largest quantization that fits, per model · 2114 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
Hermes-3-Llama-3.1-405BIQ4_XS406B201.70 GiB33.47 GiB236.35 GiB1.73 GiB16±26.5%
MiniMax-M3MoEQ4_0427B226.91 GiB7.97 GiB235.79 GiB2.29 GiB71±37%
Kimi-K2-ThinkingMoEUD-TQ1_01058B229.90 GiB4.56 GiB235.43 GiB2.65 GiB85±37%
GLM-4.7MoEQ4_1358B209.72 GiB24.44 GiB235.10 GiB2.98 GiB44±37%
GLM-4.5MoEQ4_1358B209.66 GiB24.44 GiB235.04 GiB3.04 GiB44±37%
Ornith-1.0-397BMoEQ4_1397B231.99 GiB1.99 GiB234.93 GiB3.15 GiB95±37%
Nex-N2-ProMoEQ4_1397B231.99 GiB1.99 GiB234.93 GiB3.15 GiB95±37%
Qwen3.5-397B-A17BMoEQ4_K_L403B231.91 GiB1.99 GiB234.86 GiB3.22 GiB95±37%
Qwen3.5-122B-A10B-hereticMoEBF16123B232.24 GiB1.59 GiB234.76 GiB3.32 GiB87±37%
Qwen3.5-122B-A10BMoEBF16125B232.24 GiB1.59 GiB234.76 GiB3.32 GiB87±37%
DeepSeek-V3.1MoEQ2_K_L685B229.03 GiB4.56 GiB234.56 GiB3.52 GiB79±37%
DeepSeek-V3.1-TerminusMoEQ2_K_L685B229.03 GiB4.56 GiB234.56 GiB3.52 GiB79±37%
cogito-671b-v2.1MoEQ2_K_L671B229.02 GiB4.56 GiB234.56 GiB3.52 GiB79±37%
DeepSeek-V3.2MoEQ2_K_L685B228.72 GiB4.56 GiB234.25 GiB3.83 GiB79±37%
NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16MoEUD-IQ3_S561B233.30 GiB0.00 GiB234.23 GiB3.85 GiB83±37%
GLM-4.6-Derestricted-v3MoEQ4_1357B208.76 GiB24.44 GiB234.14 GiB3.94 GiB44±37%
GLM-4.6MoEQ4_1357B208.76 GiB24.44 GiB234.14 GiB3.94 GiB44±37%
DeepSeek-R1-0528MoEQ2_K_L685B228.17 GiB4.56 GiB233.71 GiB4.37 GiB79±37%
DeepSeek-TNG-R1T2-ChimeraMoEQ2_K_L685B228.17 GiB4.56 GiB233.71 GiB4.37 GiB79±37%
cogito-v2-preview-deepseek-671B-MoEMoEQ2_K_L671B228.17 GiB4.56 GiB233.70 GiB4.38 GiB79±37%
DeepSeek-V3-0324MoEQ2_K_L685B228.11 GiB4.56 GiB233.65 GiB4.43 GiB79±37%
r1-1776MoEQ2_K_L671B228.11 GiB4.56 GiB233.65 GiB4.43 GiB79±37%
DeepSeek-R1MoEQ2_K_L685B228.11 GiB4.56 GiB233.65 GiB4.43 GiB79±37%
DeepSeek-Prover-V2-671BMoEQ2_K_L685B227.64 GiB4.56 GiB233.18 GiB4.90 GiB79±37%
Kimi-K2-InstructMoEUD-TQ1_01026B226.87 GiB4.56 GiB232.41 GiB5.67 GiB86±37%
NVIDIA-Nemotron-3-Super-120B-A12B-BF16MoEBF16124B224.93 GiB5.84 GiB231.67 GiB6.41 GiB70±37%
GLM-5MoEUD-IQ2_XXS754B224.52 GiB5.83 GiB231.29 GiB6.79 GiB76±37%
GLM-4.6-REAP-268B-A32BMoEQ6_K269B205.68 GiB24.44 GiB231.06 GiB7.02 GiB42±37%
Trinity-Large-ThinkingMoEQ4_K_L399B225.66 GiB4.40 GiB230.99 GiB7.09 GiB91±37%
Qwen3-Coder-480B-A35B-InstructMoEQ3_K_M480B213.50 GiB16.47 GiB230.91 GiB7.17 GiB52±37%
Trinity-Large-PreviewMoEQ4_K_L399B225.46 GiB4.40 GiB230.79 GiB7.29 GiB91±37%
Trinity-Large-TrueBaseMoEQ4_K_L399B225.46 GiB4.40 GiB230.79 GiB7.29 GiB91±37%
InklingMoEIQ1_M952B210.69 GiB17.53 GiB229.13 GiB8.95 GiB58±37%
Qwen3-Coder-REAP-363B-A35BMoEQ4_1363B211.68 GiB16.47 GiB229.09 GiB8.99 GiB49±37%
GLM-5.2MoEUD-IQ2_M753B222.19 GiB5.83 GiB228.97 GiB9.11 GiB77±37%
Kimi-K2.5MoEUD-TQ1_01059B223.09 GiB4.56 GiB228.62 GiB9.46 GiB87±37%
GLM-5.1MoEUD-IQ2_M754B219.96 GiB5.83 GiB226.74 GiB11.34 GiB77±37%
Llama-4-Maverick-17B-128E-InstructMoEKV unresolvedQ4_K_S402B212.15 GiB12.75 GiB225.83 GiB12.25 GiB73±37%
Step-3.7-FlashQ8_0201B197.44 GiB26.05 GiB224.41 GiB13.67 GiB17±26.5%
grok-2MoEQ6_K270B206.17 GiB17.00 GiB224.21 GiB13.87 GiB27±37%
Mistral-Small-4-119B-2603MoEBF16119B221.65 GiB1.49 GiB224.07 GiB14.01 GiB90±37%
MiMo-V2.5MoEKV unresolvedUD-Q5_K_M311B214.37 GiB7.97 GiB223.29 GiB14.79 GiB73±37%
Laguna-S-2.1MoEBF16118B219.05 GiB3.26 GiB223.23 GiB14.85 GiB80±37%
Llama-3_1-Nemotron-51B-InstructQ8_051.5B50.97 GiB170.00 GiB222.01 GiB16.07 GiB17±26.5%
step-3.5-flashQ8_0199B195.04 GiB26.05 GiB222.01 GiB16.07 GiB17±26.5%
Kimi-K2.6MoEIQ1_M1059B216.46 GiB4.56 GiB222.00 GiB16.08 GiB89±37%
MiMo-V2.5-ProMoEKV unresolvedIQ1_S1023B197.49 GiB23.24 GiB221.69 GiB16.39 GiB53±37%
Hy3MoEQ5_K_M299B198.22 GiB21.25 GiB220.41 GiB17.67 GiB50±37%
Llama-3_3-Nemotron-Super-49B-v1_5Q8_049.9B49.36 GiB170.00 GiB220.40 GiB17.68 GiB17±26.5%
Valkyrie-49B-v2.1Q8_049.9B49.36 GiB170.00 GiB220.40 GiB17.68 GiB17±26.5%
Llama-3_3-Nemotron-Super-49B-v1Q8_049.9B49.36 GiB170.00 GiB220.40 GiB17.68 GiB17±26.5%
command-a-plus-05-2026-bf16MoEQ8_0219B216.03 GiB2.35 GiB219.28 GiB18.80 GiB71±37%
GLM-4.5-AirMoEBF16110B205.82 GiB12.22 GiB218.97 GiB19.11 GiB56±37%
Hermes-4-405BQ3_K_M406B181.96 GiB33.47 GiB216.61 GiB21.47 GiB18±26.5%
Llama-4-Scout-17B-16E-InstructMoEKV unresolvedBF16109B200.76 GiB12.75 GiB214.43 GiB23.65 GiB56±37%
MiMo-V2-FlashMoEKV unresolvedQ5_K_M310B204.17 GiB7.97 GiB213.08 GiB25.00 GiB75±37%
ERNIE-4.5-300B-A47B-PTQ5_K_M300B197.41 GiB14.34 GiB212.78 GiB25.30 GiB18±26.5%
GLM-4.6VMoEBF16108B199.08 GiB12.22 GiB212.23 GiB25.85 GiB57±37%
dots.llm1.instMoEQ8_0143B141.37 GiB65.88 GiB208.18 GiB29.90 GiB27±37%
Solar-Open2-250BMoEQ6_K250B191.44 GiB12.75 GiB205.11 GiB32.97 GiB70±37%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Instinct MI325X run?
2114 of 2118 indexed open-weight models fit a Instinct MI325X at 131,072 context with q8_0 KV cache, the largest being Hermes-3-Llama-3.1-405B at IQ4_XS. That covers text, vision-language, image, video and speech models.
How much usable memory does a Instinct MI325X actually have?
Its nameplate is 256 GB, but about 238.08 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Instinct MI325X fast for local AI?
Its memory bandwidth is 6000 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.