AMD · datacenter

Instinct MI250X

Instinct MI250X has 128 GB of VRAM at 3277 GB/s — about 119.04 GiB usable after driver and compositor overhead. 2085 of 2118 indexed models fit at 128K context with q8_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
128 GB
HBM2e
Bandwidth
3277 GB/s
8192-bit bus
Tensor FP16
383 TF
dense
TDP
560 W
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1790vision language 191audio tts 21image 2audio asr 39video 16embedding 26

What fits at 128K context

largest quantization that fits, per model · 2085 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
gpt-oss-120b-abliteratedMoEI1-Q6_K117B115.67 GiB2.40 GiB118.96 GiB0.08 GiB84±37%
GLM-4.6VMoEQ8_0108B105.81 GiB12.22 GiB118.96 GiB0.08 GiB46±37%
Ornith-1.0-397BMoEUD-IQ2_M397B115.83 GiB1.99 GiB118.77 GiB0.27 GiB94±37%
MiniMax-M2.7MoEIQ3_M229B101.33 GiB16.47 GiB118.68 GiB0.36 GiB45±37%
Wizard-Vicuna-30B-UncensoredI1-IQ3_M32.5B13.86 GiB103.59 GiB118.42 GiB0.62 GiB18±26.5%
archangel_sft-kto_llama30bI1-IQ3_M32.5B13.86 GiB103.59 GiB118.42 GiB0.62 GiB18±26.5%
Qwen3-VL-235B-A22B-ThinkingMoEQ3_K_M236B104.72 GiB12.48 GiB118.14 GiB0.90 GiB46±37%
Qwen3-VL-235B-A22B-InstructMoEQ3_K_M236B104.72 GiB12.48 GiB118.14 GiB0.90 GiB46±37%
Qwen3-235B-A22BMoEQ3_K_M235B104.72 GiB12.48 GiB118.14 GiB0.90 GiB46±37%
Qwen3-235B-A22B-abliteratedMoEI1-Q3_K_M235B104.72 GiB12.48 GiB118.14 GiB0.90 GiB46±37%
Qwen3-235B-A22B-Thinking-2507MoEQ3_K_M235B104.72 GiB12.48 GiB118.14 GiB0.90 GiB46±37%
Qwen3-235B-A22B-Instruct-2507MoEQ3_K_M235B104.72 GiB12.48 GiB118.14 GiB0.90 GiB46±37%
MiniMax-M2.1MoEQ3_K_L229B100.78 GiB16.47 GiB118.13 GiB0.91 GiB45±37%
MiniMax-M2MoEQ3_K_L229B100.78 GiB16.47 GiB118.13 GiB0.91 GiB45±37%
Behemoth-X-123B-v2Q6_K123B93.68 GiB23.38 GiB118.11 GiB0.93 GiB18±26.5%
Mistral-Large-Instruct-2411Q6_K123B93.68 GiB23.38 GiB118.11 GiB0.93 GiB18±26.5%
WizardLM-Uncensored-SuperCOT-StoryTelling-30bQ3_K_S32.5B13.10 GiB103.59 GiB117.66 GiB1.38 GiB18±26.5%
grok-2MoEIQ3_XXS270B99.62 GiB17.00 GiB117.66 GiB1.38 GiB25±37%
Step-3.7-FlashUD-IQ4_NL201B90.63 GiB26.05 GiB117.61 GiB1.43 GiB18±26.5%
GLM-4.6-REAP-268B-A32BMoEQ2_K_L269B92.11 GiB24.44 GiB117.49 GiB1.55 GiB32±37%
MiniMax-M3MoEIQ2_XXS427B108.60 GiB7.97 GiB117.49 GiB1.55 GiB62±37%
Trinity-Large-ThinkingMoEIQ2_S399B112.03 GiB4.40 GiB117.36 GiB1.68 GiB83±37%
SuperHY3-abliterated-NVFP4MoEIQ2_M172B95.10 GiB21.25 GiB117.29 GiB1.75 GiB37±37%
Hy3MoEIQ2_M299B95.08 GiB21.25 GiB117.27 GiB1.77 GiB37±37%
dots.llm1.instMoEIQ2_S143B50.40 GiB65.88 GiB117.20 GiB1.84 GiB17±37%
ERNIE-4.5-300B-A47B-PTQ2_K_L300B101.76 GiB14.34 GiB117.13 GiB1.91 GiB18±26.5%
MiMo-V2.5MoEKV unresolvedUD-IQ3_S311B106.98 GiB7.97 GiB115.89 GiB3.15 GiB63±37%
GLM-4.7MoEUD-IQ1_S358B90.50 GiB24.44 GiB115.88 GiB3.16 GiB34±37%
Hermes-4-405BUD-IQ1_S406B81.23 GiB33.47 GiB115.88 GiB3.16 GiB18±26.5%
GLM-4.7-REAP-218B-A32BMoEQ3_K_S218B90.39 GiB24.44 GiB115.76 GiB3.28 GiB31±37%
GLM-4.5MoEUD-IQ1_S358B90.38 GiB24.44 GiB115.76 GiB3.28 GiB34±37%
Qwen3.5-397B-A17BMoEUD-IQ1_M403B112.75 GiB1.99 GiB115.70 GiB3.34 GiB96±37%
GLM-4.6MoEUD-IQ1_S357B90.28 GiB24.44 GiB115.66 GiB3.38 GiB34±37%
Gemma-4-Dark-Gemistry-31BQ8_032.7B102.98 GiB11.25 GiB115.21 GiB3.83 GiB18±26.5%
Nex-N2-ProMoEIQ2_S397B112.23 GiB1.99 GiB115.18 GiB3.86 GiB97±37%
gemma-2-27b-itF3227.2B101.43 GiB12.65 GiB115.12 GiB3.92 GiB18±26.5%
Qwen3-Coder-REAP-363B-A35BMoEUD-IQ1_S363B97.24 GiB16.47 GiB114.64 GiB4.40 GiB40±37%
command-a-plus-05-2026-bf16MoEIQ4_XS219B110.67 GiB2.35 GiB113.92 GiB5.12 GiB70±37%
Trinity-Large-TrueBaseMoEI1-IQ2_S399B108.32 GiB4.40 GiB113.66 GiB5.38 GiB85±37%
MiMo-V2-FlashMoEKV unresolvedQ2_K_L310B104.70 GiB7.97 GiB113.62 GiB5.42 GiB64±37%
NVIDIA-Nemotron-3-Super-120B-A12B-BF16MoEUD-Q6_K124B106.87 GiB5.84 GiB113.61 GiB5.43 GiB66±37%
command-r-35b-writer-v2I1-Q6_K35.0B26.74 GiB85.00 GiB112.74 GiB6.30 GiB19±26.5%
Llama-4-Maverick-17B-128E-InstructMoEKV unresolvedUD-TQ1_0402B98.45 GiB12.75 GiB112.13 GiB6.91 GiB57±37%
step-3.5-flashQ3_K_M199B84.04 GiB26.05 GiB111.01 GiB8.03 GiB19±26.5%
MiniMax-M2.5MoEI1-IQ3_M229B93.13 GiB16.47 GiB110.48 GiB8.56 GiB46±37%
DeepSeek-Coder-V2-Instruct-0724MoEQ3_K236B104.93 GiB4.48 GiB110.35 GiB8.69 GiB75±37%
DeepSeek-V2.5MoEQ3_K236B104.93 GiB4.48 GiB110.35 GiB8.69 GiB75±37%
DeepSeek-Coder-V2-InstructMoEQ3_K236B104.93 GiB4.48 GiB110.35 GiB8.69 GiB75±37%
DeepSeek-V4-FlashMoEUD-IQ3_S291B109.25 GiB0.03 GiB110.24 GiB8.80 GiB113±37%
Mistral-Medium-3.5-128BQ5_K_L128B85.78 GiB23.38 GiB110.21 GiB8.83 GiB19±26.5%
Qwen3.5-REAP-262B-A17BMoEIQ3_M262B106.73 GiB1.99 GiB109.68 GiB9.36 GiB92±37%
MiniMax-M2.1-REAP-139B-A10BMoEI1-Q5_K_M139B91.98 GiB16.47 GiB109.33 GiB9.71 GiB43±37%
m51Lab-MiniMax-M2.7-REAP-139B-A10BMoEI1-Q5_K_M139B91.98 GiB16.47 GiB109.33 GiB9.71 GiB43±37%
MiniMax-M2.7-BF16-ultra-uncensored-hereticMoEI1-IQ3_S229B91.94 GiB16.47 GiB109.29 GiB9.75 GiB46±37%
DeepSeek-V4-Flash-0731MoEUD-IQ3_S304B108.10 GiB0.03 GiB109.08 GiB9.96 GiB114±37%
Mixtral-8x22B-Instruct-v0.1MoEQ5_K_M141B93.11 GiB14.88 GiB108.94 GiB10.10 GiB28±37%
Mixtral-8x22B-v0.1MoEQ5_K_M141B93.11 GiB14.88 GiB108.94 GiB10.10 GiB28±37%
Mixtral-8x22B-v0.1MoEQ5_K_M141B93.10 GiB14.88 GiB108.94 GiB10.10 GiB28±37%
Qwen3.5-REAP-212B-A17BMoEIQ4_XS212B105.39 GiB1.99 GiB108.34 GiB10.70 GiB88±37%
Trinity-Large-PreviewMoEIQ2_S399B102.49 GiB4.40 GiB107.82 GiB11.22 GiB88±37%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Measured on this card

third-party benchmarks, aggregated
WorkloadMedianMiddle 50%Runs
Image generation11.55 it/s8.3315.626
Benchmarked· n=6

Aggregated from community-submitted runs, so the spread is wide by nature — it covers different models, resolutions, step counts and settings, not one controlled configuration. Read the middle 50% rather than the median alone. These figures are reproduced with attribution from vladmandic-sd-data-benchmark, which publishes no licence — so we display and link rather than redistribute them.

Questions people ask

What AI models can a Instinct MI250X run?
2085 of 2118 indexed open-weight models fit a Instinct MI250X at 131,072 context with q8_0 KV cache, the largest being gpt-oss-120b-abliterated at I1-Q6_K. That covers text, vision-language, image, video and speech models.
How much usable memory does a Instinct MI250X actually have?
Its nameplate is 128 GB, but about 119.04 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Instinct MI250X fast for local AI?
Its memory bandwidth is 3277 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.