Radeon RX 7900 XT
Radeon RX 7900 XT has 20 GB of VRAM at 800 GB/s — about 18.60 GiB usable after driver and compositor overhead. 1793 of 2118 indexed models fit at 128K context with q4_0 KV.
What fits at 128K context
| Model | Best quant | Params | Weights● | KV● | Total in memory◐ | Headroom◐ | tok/s◐ |
|---|---|---|---|---|---|---|---|
| dolphin-2.6-mixtral-8x7bMoE | I1-IQ2_S | 46.7B | 13.16 GiB | 4.50 GiB | 18.59 GiB | 0.01 GiB | 34±37% |
| xLAM-8x7b-rMoE | IQ2_S | 46.7B | 13.16 GiB | 4.50 GiB | 18.59 GiB | 0.01 GiB | 34±37% |
| Muse-Glimmer-30B | Q4_K_M | 29.8B | 17.13 GiB | 0.48 GiB | 18.59 GiB | 0.01 GiB | 28±26.5% |
| Fallen-Gemma3-27B-v1 | Q4_K_M | 27.4B | 15.41 GiB | 2.23 GiB | 18.58 GiB | 0.02 GiB | 28±26.5% |
| Qwen3.6-35B-A3B-uncensored-hereticMoE | Q3_K_L | 35.1B | 16.97 GiB | 0.70 GiB | 18.57 GiB | 0.03 GiB | 112±37% |
| Nex-N2-mini-ultra-uncensored-hereticMoE | Q3_K_L | 35.1B | 16.97 GiB | 0.70 GiB | 18.57 GiB | 0.03 GiB | 112±37% |
| c4ai-command-r-08-2024 | Q2_K | 32.3B | 11.93 GiB | 5.63 GiB | 18.57 GiB | 0.03 GiB | 28±26.5% |
| KAT-Coder-V2.5-DevMoE | UD-IQ4_XS | 34.7B | 16.96 GiB | 0.70 GiB | 18.57 GiB | 0.03 GiB | 112±37% |
| Qwen3.6-35B-A3BMoE | UD-IQ4_XS | 36.0B | 16.96 GiB | 0.70 GiB | 18.57 GiB | 0.03 GiB | 112±37% |
| Qwen3.5-21B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking | I1-Q6_K | 21.3B | 15.91 GiB | 1.69 GiB | 18.56 GiB | 0.04 GiB | 28±26.5% |
| Qwen3.6-21B-IQ-Ultra-Heretic-Uncensored-Thinking | I1-Q6_K | 21.3B | 15.91 GiB | 1.69 GiB | 18.56 GiB | 0.04 GiB | 28±26.5% |
| medgemma-27b-it | I1-Q4_K_S | 28.8B | 14.60 GiB | 2.98 GiB | 18.56 GiB | 0.04 GiB | 28±26.5% |
| gemma-3-27b-it-abliterated-refined-vision | I1-Q4_K_S | 27.4B | 14.60 GiB | 2.98 GiB | 18.56 GiB | 0.04 GiB | 28±26.5% |
| gemma-3-27b-it-abliterated | Q4_K_S | 27.4B | 14.60 GiB | 2.98 GiB | 18.56 GiB | 0.04 GiB | 28±26.5% |
| Nidum-Gemma-3-27B-it-Uncensored | I1-Q4_K_S | 27.4B | 14.60 GiB | 2.98 GiB | 18.56 GiB | 0.04 GiB | 28±26.5% |
| gemma-3-27b-it | Q4_K_S | 27.4B | 14.60 GiB | 2.98 GiB | 18.56 GiB | 0.04 GiB | 28±26.5% |
| AtomicGPT-gemma3-27b | I1-Q4_K_S | 27.4B | 14.60 GiB | 2.98 GiB | 18.56 GiB | 0.04 GiB | 28±26.5% |
| Unbound-v1.12.0-27B | I1-Q4_K_S | 27.4B | 14.60 GiB | 2.98 GiB | 18.56 GiB | 0.04 GiB | 28±26.5% |
| Mira-v1.12-Ties-27B | I1-Q4_K_S | 27.4B | 14.60 GiB | 2.98 GiB | 18.56 GiB | 0.04 GiB | 28±26.5% |
| Medgamma27B | I1-Q4_K_S | 27.0B | 14.60 GiB | 2.98 GiB | 18.56 GiB | 0.04 GiB | 28±26.5% |
| medgemma-27b-text-it | Q4_K_S | 27.0B | 14.60 GiB | 2.98 GiB | 18.56 GiB | 0.04 GiB | 28±26.5% |
| GLM-4.7-Flash-Claude-Opus-4.5-High-Reasoning-DistillMoE | IQ4_NL | 31.2B | 15.79 GiB | 1.86 GiB | 18.56 GiB | 0.04 GiB | 71±37% |
| grug-27b | Q4_K_S | 27.4B | 15.34 GiB | 2.25 GiB | 18.56 GiB | 0.04 GiB | 28±26.5% |
| Carnice-V2-27b | Q4_K_S | 27.4B | 15.34 GiB | 2.25 GiB | 18.56 GiB | 0.04 GiB | 28±26.5% |
| Fara1.5-27B | Q4_K_S | 27.4B | 15.34 GiB | 2.25 GiB | 18.56 GiB | 0.04 GiB | 28±26.5% |
| Skyfall-31B-v4.2-heretic | I1-IQ2_M | 31.4B | 9.94 GiB | 7.59 GiB | 18.55 GiB | 0.05 GiB | 28±26.5% |
| Skyfall-31B-v4.2 | I1-IQ2_M | 31.4B | 9.94 GiB | 7.59 GiB | 18.55 GiB | 0.05 GiB | 28±26.5% |
| Devstral-Small-2-24B-Instruct-2512 | IQ4_XS | 24.0B | 11.90 GiB | 5.63 GiB | 18.55 GiB | 0.05 GiB | 28±26.5% |
| Mistral-Small-3.2-24B-Instruct-2506 | IQ4_XS | 24.0B | 11.90 GiB | 5.63 GiB | 18.55 GiB | 0.05 GiB | 28±26.5% |
| Devstral-Small-2507 | IQ4_XS | 23.6B | 11.90 GiB | 5.63 GiB | 18.55 GiB | 0.05 GiB | 28±26.5% |
| Devstral-Small-2505 | IQ4_XS | 23.6B | 11.90 GiB | 5.63 GiB | 18.55 GiB | 0.05 GiB | 28±26.5% |
| Magistral-Small-2509 | IQ4_XS | 24.0B | 11.90 GiB | 5.63 GiB | 18.55 GiB | 0.05 GiB | 28±26.5% |
| Magistral-Small-2507 | IQ4_XS | 23.6B | 11.90 GiB | 5.63 GiB | 18.55 GiB | 0.05 GiB | 28±26.5% |
| Mistral-Small-3.1-24B-Instruct-2503 | IQ4_XS | 24.0B | 11.90 GiB | 5.63 GiB | 18.55 GiB | 0.05 GiB | 28±26.5% |
| Magistral-Small-2506 | IQ4_XS | 23.6B | 11.90 GiB | 5.63 GiB | 18.55 GiB | 0.05 GiB | 28±26.5% |
| Gemma-3-27B-MeditronFO | IQ4_XS | 28.8B | 14.57 GiB | 2.98 GiB | 18.53 GiB | 0.07 GiB | 28±26.5% |
| Voxtral-Small-24B-2507 | IQ4_XS | 24.3B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Transformed-Journey-24B | I1-IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Magistry-24B-v1.1 | I1-IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Mergedonia-AETHER-24B-v1a | I1-IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Mergedonia-AETHER-24B-v1b | I1-IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Slimaki-Tavern-24B-v1.3 | I1-IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Maginum-Cydoms-24B | I1-IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Maginum-Cydoms-24B-absolute-heresy | I1-IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Morax-24B-v2 | IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Dolphin3.0-R1-Mistral-24B | IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Dolphin3.0-Mistral-24B | IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Mistral-Small-3.2-24B-Instruct-2506-ultra-uncensored-heretic | I1-IQ4_XS | 24.0B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Huihui-Mistral-Small-3.2-24B-Instruct-2506-abliterated-llamacppfixed | I1-IQ4_XS | 24.0B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Dans-PersonalityEngine-V1.2.0-24b | I1-IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Mistral-Small-3_2-24B-Instruct-2506-antislop.v2 | I1-IQ4_XS | 24.0B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Cydonia_Vistral | IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Dans-PersonalityEngine-V1.3.0-24b | I1-IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Goetia-24B-v1.1 | I1-IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| MS3.2-PaintedFantasy-v3-24B | I1-IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| RP-Spectrum-24B | I1-IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| MS3.2-PaintedFantasy-v4.1-24B-ultra-uncensored-heretic-v2 | I1-IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Magidonia-24B-v4.3-heretic-v1.2 | I1-IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| Magidonia-24B-v4.3-absolute-heresy | I1-IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
| MagiSeek-Pro-V1 | I1-IQ4_XS | 23.6B | 11.88 GiB | 5.63 GiB | 18.53 GiB | 0.07 GiB | 29±26.5% |
Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.
Measured on this card
| Workload◍ | Median | Middle 50% | Runs |
|---|---|---|---|
| Image generation | 11.45 it/s | 7.75–16.22 | 328 |
| Prompt processing | 3219.16 tok/s | 2738.95–3754.68 | 63 |
| Text generation | 101.20 tok/s | 99.80–107.45 | 39 |
Aggregated from community-submitted runs, so the spread is wide by nature — it covers different models, resolutions, step counts and settings, not one controlled configuration. Read the middle 50% rather than the median alone. These figures are reproduced with attribution from vladmandic-sd-data-benchmark, which publishes no licence — so we display and link rather than redistribute them.
Questions people ask
- What AI models can a Radeon RX 7900 XT run?
- 1793 of 2118 indexed open-weight models fit a Radeon RX 7900 XT at 131,072 context with q4_0 KV cache, the largest being dolphin-2.6-mixtral-8x7b at I1-IQ2_S. That covers text, vision-language, image, video and speech models.
- How much usable memory does a Radeon RX 7900 XT actually have?
- Its nameplate is 20 GB, but about 18.60 GiB is available to a model once driver and compositor overhead is accounted for.
- Is a Radeon RX 7900 XT fast for local AI?
- Its memory bandwidth is 800 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.