AMD · datacenter

Instinct MI210

Instinct MI210 has 64 GB of VRAM at 1638 GB/s — about 59.52 GiB usable after driver and compositor overhead. 2061 of 2118 indexed models fit at 32K context with q4_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
64 GB
HBM2e
Bandwidth
1638 GB/s
4096-bit bus
Tensor FP16
181 TF
dense
TDP
300 W
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1772vision language 185image 2audio asr 39audio tts 21video 16embedding 26

What fits at 32K context

largest quantization that fits, per model · 2061 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
gpt-oss-120b-uncensored-bf16MoEQ3_K_L117B58.30 GiB0.32 GiB59.51 GiB0.01 GiB94±37%
Qwen3.5-REAP-212B-A17BMoEIQ2_XS212B58.30 GiB0.26 GiB59.51 GiB0.01 GiB90±37%
gpt-oss-120bMoEQ2_K120B58.27 GiB0.32 GiB59.49 GiB0.03 GiB94±37%
gpt-oss-safeguard-120bMoEQ2_K120B58.27 GiB0.32 GiB59.49 GiB0.03 GiB94±37%
GLM-4.6VMoEIQ4_NL108B56.83 GiB1.62 GiB59.37 GiB0.15 GiB66±37%
Hypernova-60B-2605MoEQ8_058.7B58.13 GiB0.29 GiB59.31 GiB0.21 GiB82±37%
command-a-plus-05-2026-bf16MoEIQ2_XXS219B57.98 GiB0.40 GiB59.28 GiB0.24 GiB74±37%
Qwen3.5-88BMoEI1-Q5_K_M87.7B58.10 GiB0.21 GiB59.24 GiB0.28 GiB86±37%
Behemoth-X-123B-v2Q3_K_M123B55.04 GiB3.09 GiB59.19 GiB0.33 GiB18±26.5%
Mistral-Large-Instruct-2411Q3_K_M123B55.04 GiB3.09 GiB59.19 GiB0.33 GiB18±26.5%
GLM-4.5-Air-DerestrictedMoEIQ4_XS110B56.63 GiB1.62 GiB59.17 GiB0.35 GiB66±37%
GLM-4.5-AirMoEIQ4_XS110B56.63 GiB1.62 GiB59.17 GiB0.35 GiB66±37%
NVIDIA-Nemotron-3-Super-120B-A12B-BF16MoEUD-Q3_K_M124B57.47 GiB0.77 GiB59.14 GiB0.38 GiB82±37%
MiniMax-M2.1-REAP-139B-A10BMoEI1-IQ3_S139B56.04 GiB2.18 GiB59.11 GiB0.41 GiB66±37%
m51Lab-MiniMax-M2.7-REAP-139B-A10BMoEI1-IQ3_S139B56.04 GiB2.18 GiB59.11 GiB0.41 GiB66±37%
MiniMax-M2.7-BF16-ultra-uncensored-hereticMoEI1-IQ2_XXS229B55.99 GiB2.18 GiB59.05 GiB0.47 GiB75±37%
MiniMax-M2.1MoEI1-IQ2_XXS229B55.99 GiB2.18 GiB59.05 GiB0.47 GiB75±37%
MiniMax-M2.5MoEI1-IQ2_XXS229B55.99 GiB2.18 GiB59.05 GiB0.47 GiB75±37%
Qwen3.5-99BMoEI1-Q4_199.0B57.88 GiB0.21 GiB59.02 GiB0.50 GiB91±37%
GLM-4.5VMoEI1-Q4_0108B56.39 GiB1.62 GiB58.93 GiB0.59 GiB66±37%
Solar-Open2-250BMoEIQ1_M250B56.30 GiB1.69 GiB58.91 GiB0.61 GiB83±37%
GLM-4.5-Air-REAP-82B-A12BMoEQ5_K_S81.9B56.33 GiB1.62 GiB58.88 GiB0.64 GiB59±37%
c4ai-command-r-plus-08-2024Q4_K_S104B55.55 GiB2.25 GiB58.88 GiB0.64 GiB18±26.5%
Qwen3.5-122B-A10BMoEUD-IQ4_XS125B57.67 GiB0.21 GiB58.81 GiB0.71 GiB97±37%
DeepSeek-Coder-V2-Instruct-0724MoEIQ2_XXS236B57.28 GiB0.59 GiB58.81 GiB0.71 GiB87±37%
DeepSeek-V2.5MoEIQ2_XXS236B57.28 GiB0.59 GiB58.81 GiB0.71 GiB87±37%
DeepSeek-Coder-V2-InstructMoEIQ2_XXS236B57.28 GiB0.59 GiB58.81 GiB0.71 GiB87±37%
Qwen3-Coder-30B-A3B-InstructMoEBF1630.5B56.90 GiB0.84 GiB58.64 GiB0.88 GiB71±37%
Salience-1.5-FlashMoEBF1631.1B56.90 GiB0.84 GiB58.64 GiB0.88 GiB71±37%
Qwen3-VL-30B-A3B-InstructMoEBF1631.1B56.90 GiB0.84 GiB58.64 GiB0.88 GiB71±37%
Qwen3-VL-30B-A3B-ThinkingMoEBF1631.1B56.90 GiB0.84 GiB58.64 GiB0.88 GiB71±37%
MiroThinker-v1.0-30BMoEBF1630.5B56.90 GiB0.84 GiB58.64 GiB0.88 GiB71±37%
Qwen3-30B-A3BMoEBF1630.5B56.90 GiB0.84 GiB58.64 GiB0.88 GiB71±37%
Qwen3-30B-A3B-Thinking-2507-Claude-4.5-Sonnet-High-Reasoning-DistillMoEBF1630.5B56.90 GiB0.84 GiB58.64 GiB0.88 GiB71±37%
Qwen3-30B-A3B-Instruct-2507MoEBF1630.5B56.90 GiB0.84 GiB58.64 GiB0.88 GiB71±37%
Qwen3-30B-A3B-Thinking-2507MoEBF1630.5B56.90 GiB0.84 GiB58.64 GiB0.88 GiB71±37%
Pantheon-Proto-RP-1.8-30B-A3BMoEBF1630.5B56.90 GiB0.84 GiB58.64 GiB0.88 GiB71±37%
Tongyi-DeepResearch-30B-A3BMoEBF1630.5B56.90 GiB0.84 GiB58.63 GiB0.89 GiB71±37%
Mistral-MOE-4X7B-Dark-MultiVerse-Uncensored-Enhanced32-24BMoEQ6_K24.2B56.49 GiB1.13 GiB58.55 GiB0.97 GiB10±37%
Llama-4-Scout-17B-16E-InstructMoEKV unresolvedIQ4_XS109B55.78 GiB1.69 GiB58.39 GiB1.13 GiB66±37%
CalmeRys-78B-Orpo-v0.1Q5_K_M78.0B54.30 GiB3.02 GiB58.36 GiB1.16 GiB18±26.5%
calme-2.3-rys-78bQ5_K_M78.0B54.30 GiB3.02 GiB58.36 GiB1.16 GiB18±26.5%
Step-3.5-Flash-REAP-121B-A11BI1-Q3_K_M121B53.75 GiB3.67 GiB58.35 GiB1.17 GiB18±26.5%
Llama-3.3-70B-InstructQ6_K_L70.6B54.39 GiB2.81 GiB58.22 GiB1.30 GiB18±26.5%
Anubis-70B-v1.2Q6_K_L70.6B54.39 GiB2.81 GiB58.22 GiB1.30 GiB18±26.5%
Tess-R1-Limerick-Llama-3.1-70BQ6_K_L70.6B54.39 GiB2.81 GiB58.22 GiB1.30 GiB18±26.5%
Infinity-Instruct-7M-Gen-Llama3_1-70BQ6_K_L70.6B54.39 GiB2.81 GiB58.22 GiB1.30 GiB18±26.5%
Athene-70BQ6_K_L70.6B54.39 GiB2.81 GiB58.22 GiB1.30 GiB18±26.5%
Llama-3_1-Nemotron-51B-InstructQ5_K_L51.5B34.56 GiB22.50 GiB58.11 GiB1.41 GiB18±26.5%
openPangu-2.0-FlashMoEKV unresolvedQ4_K_M100B56.71 GiB0.45 GiB58.07 GiB1.45 GiB95±37%
North-Mini-Code-1.0MoEBF1630.5B56.81 GiB0.32 GiB58.01 GiB1.51 GiB76±37%
Qwen3-Omni-30B-A3B-InstructBF1635.3B56.90 GiB0.00 GiB57.85 GiB1.67 GiB18±26.5%
Qwen3-Omni-30B-A3B-ThinkingBF1631.7B56.90 GiB0.00 GiB57.85 GiB1.67 GiB18±26.5%
InternVL3_5-30B-A3BBF1630.8B56.90 GiB0.00 GiB57.84 GiB1.68 GiB18±26.5%
Apertus-70B-Instruct-2509Q6_K70.6B53.95 GiB2.81 GiB57.84 GiB1.68 GiB18±26.5%
Hy-MT2-30B-A3BMoEBF1630.1B56.03 GiB0.84 GiB57.77 GiB1.75 GiB72±37%
Meta-Llama-3-70B-InstructQ6_K70.6B53.92 GiB2.81 GiB57.76 GiB1.76 GiB18±26.5%
calme-2.4-llama3-70bQ6_K70.6B53.91 GiB2.81 GiB57.75 GiB1.77 GiB18±26.5%
calme-2.2-llama3-70bQ6_K70.6B53.91 GiB2.81 GiB57.75 GiB1.77 GiB18±26.5%
L3.3-70B-Magnum-v4-SEQ6_K70.6B53.91 GiB2.81 GiB57.75 GiB1.77 GiB18±26.5%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Instinct MI210 run?
2061 of 2118 indexed open-weight models fit a Instinct MI210 at 32,768 context with q4_0 KV cache, the largest being gpt-oss-120b-uncensored-bf16 at Q3_K_L. That covers text, vision-language, image, video and speech models.
How much usable memory does a Instinct MI210 actually have?
Its nameplate is 64 GB, but about 59.52 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Instinct MI210 fast for local AI?
Its memory bandwidth is 1638 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.