AMD · consumer

Radeon RX 7900 XTX

Radeon RX 7900 XTX has 24 GB of VRAM at 960 GB/s — about 22.32 GiB usable after driver and compositor overhead. 1723 of 2118 indexed models fit at 128K context with q8_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
24 GB
GDDR6
Bandwidth
960 GB/s
384-bit bus
Tensor FP16
dense
TDP
355 W
$999 MSRP
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1453vision language 167audio asr 39image 1video 16audio tts 21embedding 26

What fits at 128K context

largest quantization that fits, per model · 1723 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
Qwen3.6-27B-A3B-CoderMoEI1-Q6_K26.7B20.09 GiB1.33 GiB22.32 GiB0.00 GiB87±37%
Gemma4-Gutenberg-31BIQ2_XXS31.3B10.09 GiB11.25 GiB22.31 GiB0.01 GiB28±26.5%
gemma-4-31B-itIQ2_XXS31.3B10.09 GiB11.25 GiB22.31 GiB0.01 GiB28±26.5%
Gemma4-Gutenberg-31B-HereticIQ2_XXS31.3B10.09 GiB11.25 GiB22.31 GiB0.01 GiB28±26.5%
Equinox-31BIQ2_XXS31.3B10.09 GiB11.25 GiB22.31 GiB0.01 GiB28±26.5%
gemma-4-31B-it-SDFT-Heretic-RPIQ2_XXS30.7B10.09 GiB11.25 GiB22.31 GiB0.01 GiB28±26.5%
Qwen3.5-40B-RoughHouse-Claude-4.6-Opus-Polar-Deckard-Uncensored-Heretic-ThinkingI1-IQ3_XXS39.5B14.96 GiB6.38 GiB22.30 GiB0.02 GiB28±26.5%
Snowpiercer-15B-v4-hereticI1-Q4_K_S15.0B8.07 GiB13.28 GiB22.30 GiB0.02 GiB28±26.5%
Snowpiercer-15B-v4Q4_K_S15.0B8.07 GiB13.28 GiB22.30 GiB0.02 GiB28±26.5%
Falcon3-7B-InstructF167.5B13.89 GiB7.44 GiB22.29 GiB0.03 GiB28±26.5%
GLM-4.7-Flash-hereticMoEQ4_129.9B17.86 GiB3.51 GiB22.28 GiB0.04 GiB58±37%
Mistral-MOE-4X7B-Dark-MultiVerse-Uncensored-Enhanced32-24BMoEQ4_K_S24.2B12.84 GiB8.50 GiB22.28 GiB0.04 GiB16±37%
Qwen3-53B-A3B-2507-THINKING-TOTAL-RECALL-v2-MASTER-CODERMoEI1-IQ1_S53.0B10.22 GiB11.16 GiB22.27 GiB0.05 GiB27±37%
OLMoE-1B-7B-0924-InstructMoEF166.9B12.89 GiB8.50 GiB22.26 GiB0.06 GiB32±37%
Gemma-4-31B-Isometry-RPI1-IQ2_S32.7B10.02 GiB11.25 GiB22.25 GiB0.07 GiB28±26.5%
Gemma-4-Dark-Gemistry-31BI1-IQ2_S32.7B10.02 GiB11.25 GiB22.25 GiB0.07 GiB28±26.5%
Prosopon-31BI1-IQ2_S32.7B10.02 GiB11.25 GiB22.25 GiB0.07 GiB28±26.5%
Gemma-4-Novelist-Eclipse-31BI1-IQ2_S32.7B10.02 GiB11.25 GiB22.25 GiB0.07 GiB28±26.5%
Giftige-Blume-31B-v1-StyleSwapI1-IQ2_S32.7B10.02 GiB11.25 GiB22.25 GiB0.07 GiB28±26.5%
G4-MeroMero-31B-StyleSwapI1-IQ2_S32.7B10.02 GiB11.25 GiB22.25 GiB0.07 GiB28±26.5%
Gemma-4-31B-StyleTune-heretic-araI1-IQ2_S32.7B10.02 GiB11.25 GiB22.25 GiB0.07 GiB28±26.5%
Pantheon-Reasoning-31B-1.1I1-IQ2_S32.7B10.02 GiB11.25 GiB22.25 GiB0.07 GiB28±26.5%
Gemma-4-31B-StyleTuneI1-IQ2_S32.7B10.02 GiB11.25 GiB22.25 GiB0.07 GiB28±26.5%
Barcenas-StyleTune-31B-FableI1-IQ2_S32.1B10.02 GiB11.25 GiB22.25 GiB0.07 GiB28±26.5%
Trinity-MiniMoEQ6_K_L26.1B20.22 GiB1.12 GiB22.24 GiB0.08 GiB88±37%
Qwen3.5-35B-A3BMoEQ4_K_S36.0B20.01 GiB1.33 GiB22.24 GiB0.08 GiB98±37%
Qwen3.6-35B-A3BMoEQ4_K_S36.0B20.01 GiB1.33 GiB22.24 GiB0.08 GiB98±37%
EuroLLM-22B-Instruct-2512IQ2_S22.6B6.93 GiB14.34 GiB22.23 GiB0.09 GiB28±26.5%
Apriel-1.6-15b-ThinkerI1-Q4_114.9B8.53 GiB12.75 GiB22.23 GiB0.09 GiB28±26.5%
Qwen3-Coder-Next-Opus-4.6-Reasoning-DistilledMoEIQ2_XXS19.74 GiB1.59 GiB22.23 GiB0.09 GiB97±37%
Phi-3.5-MoE-instructMoEKV unresolvedIQ2_M41.9B12.82 GiB8.50 GiB22.22 GiB0.10 GiB32±37%
Phi-3-medium-128k-instructQ4_K_M14.0B7.98 GiB13.28 GiB22.22 GiB0.10 GiB28±26.5%
Phi-3-medium-4k-instructI1-Q4_K_M14.0B7.98 GiB13.28 GiB22.22 GiB0.10 GiB28±26.5%
gemma-4-26B-A4B-it-heretic-ara-v2MoEQ5_K_M25.8B18.52 GiB2.81 GiB22.22 GiB0.10 GiB28±26.5%
Ministral-3-14B-Instruct-2512-BF16Q6_K_L13.9B10.63 GiB10.63 GiB22.21 GiB0.11 GiB28±26.5%
INTELLECT-1-InstructQ8_010.2B10.11 GiB11.16 GiB22.21 GiB0.11 GiB28±26.5%
internlm2-math-plus-20bI1-IQ3_M19.9B8.50 GiB12.75 GiB22.21 GiB0.11 GiB28±26.5%
Rocinante-XL-16B-v1I1-IQ3_M16.1B6.91 GiB14.34 GiB22.20 GiB0.12 GiB28±26.5%
L3.2-Rogue-Creative-Instruct-Uncensored-Abliterated-7BQ3_K_M7.5B3.49 GiB17.80 GiB22.20 GiB0.12 GiB28±26.5%
Pantheon-Reasoning-26B-A4B-1.1MoEQ5_K_M26.5B18.47 GiB2.81 GiB22.16 GiB0.16 GiB28±26.5%
WizardCoder-Python-34B-V1.0I1-IQ2_XXS33.7B8.41 GiB12.75 GiB22.16 GiB0.16 GiB28±26.5%
Phind-CodeLlama-34B-Python-v1I1-IQ2_XXS33.7B8.41 GiB12.75 GiB22.16 GiB0.16 GiB28±26.5%
Phind-CodeLlama-34B-v2I1-IQ2_XXS33.7B8.41 GiB12.75 GiB22.16 GiB0.16 GiB28±26.5%
Llama3.2-24B-A3B-II-Dark-Champion-INSTRUCT-Heretic-Abliterated-UncensoredMoEI1-Q6_K18.0B13.81 GiB7.44 GiB22.16 GiB0.16 GiB34±37%
Darwin-35B-A3B-OpusMoEQ4_K_M36.0B19.92 GiB1.33 GiB22.15 GiB0.17 GiB98±37%
Aurora-Code-1MoEQ4_K_M34.7B19.92 GiB1.33 GiB22.15 GiB0.17 GiB98±37%
grug-35b-v2MoEQ4_K_M35.1B19.92 GiB1.33 GiB22.15 GiB0.17 GiB98±37%
grug-35bMoEQ4_K_M35.1B19.92 GiB1.33 GiB22.15 GiB0.17 GiB98±37%
WorldSim-Opus-3.6-35B-A3BMoEQ4_K_M35.1B19.92 GiB1.33 GiB22.15 GiB0.17 GiB98±37%
Qwen3.6-35B-A3B-AnkoMoEQ4_K_M35.1B19.92 GiB1.33 GiB22.15 GiB0.17 GiB98±37%
KAT-Coder-V2.5-DevMoEQ4_K_M34.7B19.92 GiB1.33 GiB22.15 GiB0.17 GiB98±37%
Ornith-1.0-35BMoEQ4_K_M34.7B19.92 GiB1.33 GiB22.15 GiB0.17 GiB98±37%
Nex-N2-miniMoEQ4_K_M35.1B19.92 GiB1.33 GiB22.15 GiB0.17 GiB98±37%
NVIDIA-Nemotron-Nano-9B-v2Q5_K_S8.9B6.32 GiB14.88 GiB22.14 GiB0.18 GiB28±26.5%
openNemo-9B-abliteratedQ5_K_S8.9B6.32 GiB14.88 GiB22.14 GiB0.18 GiB28±26.5%
umt5-xxlF325.7B21.17 GiB0.00 GiB22.12 GiB0.20 GiB28±26.5%
GLM-4.7-Flash-REAP-23B-A3BMoEQ6_K23.0B17.69 GiB3.51 GiB22.11 GiB0.21 GiB55±37%
dolphincoder-starcoder2-15bKV unresolvedQ8_016.0B15.80 GiB5.31 GiB22.10 GiB0.22 GiB28±26.5%
starcoder2-15bKV unresolvedQ8_016.0B15.80 GiB5.31 GiB22.10 GiB0.22 GiB28±26.5%
Phi-4-reasoning-plusQ4_K_S14.7B7.86 GiB13.28 GiB22.10 GiB0.22 GiB28±26.5%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Measured on this card

third-party benchmarks, aggregated
WorkloadMedianMiddle 50%Runs
Image generation14.33 it/s10.3219.101,258
Prompt processing3236.63 tok/s2011.823443.9051
Text generation134.87 tok/s122.64145.5551
Benchmarked· n=1,258

Aggregated from community-submitted runs, so the spread is wide by nature — it covers different models, resolutions, step counts and settings, not one controlled configuration. Read the middle 50% rather than the median alone. These figures are reproduced with attribution from vladmandic-sd-data-benchmark, which publishes no licence — so we display and link rather than redistribute them.

Questions people ask

What AI models can a Radeon RX 7900 XTX run?
1723 of 2118 indexed open-weight models fit a Radeon RX 7900 XTX at 131,072 context with q8_0 KV cache, the largest being Qwen3.6-27B-A3B-Coder at I1-Q6_K. That covers text, vision-language, image, video and speech models.
How much usable memory does a Radeon RX 7900 XTX actually have?
Its nameplate is 24 GB, but about 22.32 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Radeon RX 7900 XTX fast for local AI?
Its memory bandwidth is 960 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.