AMD · consumer

Radeon RX 7700

Radeon RX 7700 has 16 GB of VRAM at 624 GB/s — about 14.88 GiB usable after driver and compositor overhead. 1846 of 2118 indexed models fit at 32K context with q4_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
16 GB
GDDR6
Bandwidth
624 GB/s
256-bit bus
Tensor FP16
dense
TDP
263 W
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1581vision language 162embedding 26video 15audio asr 39image 2audio tts 21

What fits at 32K context

largest quantization that fits, per model · 1846 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
codellama-13b-oasst-sft-v10Q4_K_S13.0B6.91 GiB7.03 GiB14.88 GiB0.00 GiB28±26.5%
chronos-hermes-13b-v2Q4_K_S13.0B6.91 GiB7.03 GiB14.88 GiB0.00 GiB28±26.5%
CodeLlama-13b-Instruct-hfQ4_K_S13.0B6.91 GiB7.03 GiB14.88 GiB0.00 GiB28±26.5%
WizardLM-13B-UncensoredQ4_K_S13.0B6.91 GiB7.03 GiB14.88 GiB0.00 GiB28±26.5%
Llama-2-13b-chat-hfQ4_K_S13.0B6.91 GiB7.03 GiB14.88 GiB0.00 GiB28±26.5%
Guanaco-13B-UncensoredQ4_K_S13.0B6.91 GiB7.03 GiB14.88 GiB0.00 GiB28±26.5%
MythoMax-L2-13bQ4_K_S13.0B6.91 GiB7.03 GiB14.88 GiB0.00 GiB28±26.5%
WizardLM-1.0-Uncensored-Llama2-13bQ4_K_S13.0B6.91 GiB7.03 GiB14.88 GiB0.00 GiB28±26.5%
speechless-llama2-hermes-orca-platypus-wizardlm-13bQ4_K_S13.0B6.91 GiB7.03 GiB14.88 GiB0.00 GiB28±26.5%
mythalion-13bQ4_K_S13.0B6.91 GiB7.03 GiB14.88 GiB0.00 GiB28±26.5%
GLM-4.7-Flash-hereticMoEQ3_K_L29.9B13.50 GiB0.46 GiB14.88 GiB0.00 GiB96±37%
Orca-2-13b-Alpaca-UncensoredI1-Q4_013.0B6.88 GiB7.03 GiB14.85 GiB0.03 GiB28±26.5%
WizardCoder-Python-13B-V1.0I1-Q4_013.0B6.88 GiB7.03 GiB14.85 GiB0.03 GiB28±26.5%
Qwen3.6-28BMoEI1-Q3_K_L28.2B13.77 GiB0.18 GiB14.85 GiB0.03 GiB125±37%
Qwen3.5-28BMoEI1-Q3_K_L28.7B13.77 GiB0.18 GiB14.85 GiB0.03 GiB125±37%
Phi-3.5-MoE-instructMoEKV unresolvedIQ2_M41.9B12.82 GiB1.13 GiB14.85 GiB0.03 GiB62±37%
MiroThinker-v1.0-30BMoEQ3_K_M30.5B13.11 GiB0.84 GiB14.85 GiB0.03 GiB84±37%
Pantheon-Proto-RP-1.8-30B-A3BMoEQ3_K_M30.5B13.11 GiB0.84 GiB14.85 GiB0.03 GiB84±37%
Qwen3-VL-30B-A3B-ThinkingMoEIQ3_M31.1B13.11 GiB0.84 GiB14.85 GiB0.03 GiB84±37%
Qwen3-30B-A3BMoEIQ3_M30.5B13.11 GiB0.84 GiB14.85 GiB0.03 GiB84±37%
Qwen3-30B-A3B-Instruct-2507MoEIQ3_M30.5B13.11 GiB0.84 GiB14.85 GiB0.03 GiB84±37%
Qwen3-30B-A3B-Thinking-2507MoEIQ3_M30.5B13.11 GiB0.84 GiB14.85 GiB0.03 GiB84±37%
IQuest-Coder-V1-40B-InstructI1-IQ2_XS39.8B11.04 GiB2.81 GiB14.85 GiB0.03 GiB28±26.5%
Tongyi-DeepResearch-30B-A3BMoEQ3_K_M30.5B13.11 GiB0.84 GiB14.84 GiB0.04 GiB84±37%
OLMo-2-1124-13B-InstructQ3_K_L13.7B6.87 GiB7.03 GiB14.84 GiB0.04 GiB28±26.5%
GLM-4.7-Flash-REAP-23B-A3B-absolute-heresyMoEI1-Q4_123.0B13.47 GiB0.46 GiB14.84 GiB0.04 GiB87±37%
granite-20b-code-instruct-8kQ5_K_L20.1B13.86 GiB0.00 GiB14.84 GiB0.04 GiB28±26.5%
WhiteRabbitNeo-13B-v1Q4_013.0B6.86 GiB7.03 GiB14.83 GiB0.05 GiB28±26.5%
Wizard-Vicuna-13B-UncensoredQ4_013.0B6.86 GiB7.03 GiB14.83 GiB0.05 GiB28±26.5%
WizardLM-13b-V1.0-UncensoredQ4_013.0B6.86 GiB7.03 GiB14.83 GiB0.05 GiB28±26.5%
MythoMax-L2-Kimiko-v2-13bQ4_013.0B6.86 GiB7.03 GiB14.83 GiB0.05 GiB28±26.5%
solar-pro-preview-instructKV unresolvedIQ4_XS22.1B11.06 GiB2.81 GiB14.83 GiB0.05 GiB28±26.5%
c4ai-command-r-08-2024Q2_K_L32.3B12.40 GiB1.41 GiB14.82 GiB0.06 GiB28±26.5%
GLM-Z1-Rumination-32B-0414Q2_K33.1B11.69 GiB2.14 GiB14.82 GiB0.06 GiB28±26.5%
Goetia-26B-A4B-v1.3-Absolute-Heretic-ARAMoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
Frank-26B-A4BMoEI1-Q4_026.5B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
G4-MeroMero-26B-A4B-it-uncensored-hereticMoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
EVE-26b-XENO-HATMoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
Gemma-4-26B-A4B-Animus-V14.1-FFT-hereticMoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
gemma-4-26B-A4B-it-qat-q4_0-unquantized-hereticMoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
Huihui-gemma-4-26B-A4B-it-qat-q4_0-unquantized-abliteratedMoEI1-Q4_026.5B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
G4-MeroMero-26B-A4BMoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
G4-Dark-Soul-26B-A4BMoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
gemma-4-26B-A4B-it-local-abliterated-sota-internal-t34MoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
gemma-4-26B-A4B-it-SOMPOA-heresyMoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
gemma-4-26B-A4B-it-hereticMoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
gemma-4-26B-A4B-it-abliterixMoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
gemma-4-26B-A4B-it-heretic-ara-v2MoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
Gemma-4-26B-A4B-it-heretic-antislopMoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
gemma-4-26B-A4B-it-Claude-Opus-Distill-v2MoEI1-Q4_026.5B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
gemma-4-26B-A4B-Heretic-StableMoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
gemma-4-26B-A4B-it-Uncensored-MAXMoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
gemma-4-26B-A4B-it-ultra-uncensored-hereticMoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
gemma-4-26B-A4B-it-ara-abliteratedMoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
Huihui-gemma-4-26B-A4B-it-abliteratedMoEI1-Q4_026.5B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
Gemma-4-26B-A4B-AbliteratedMoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
gemma4-26b-fiction-bf16MoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
gemma-4-26B-A4B-it-heretic-araMoEI1-Q4_025.8B13.49 GiB0.43 GiB14.81 GiB0.07 GiB28±26.5%
reka-flash-3.1I1-Q4_K_M20.9B12.68 GiB1.16 GiB14.81 GiB0.07 GiB28±26.5%
reka-flash-3Q4_K_M20.9B12.68 GiB1.16 GiB14.81 GiB0.07 GiB28±26.5%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Radeon RX 7700 run?
1846 of 2118 indexed open-weight models fit a Radeon RX 7700 at 32,768 context with q4_0 KV cache, the largest being codellama-13b-oasst-sft-v10 at Q4_K_S. That covers text, vision-language, image, video and speech models.
How much usable memory does a Radeon RX 7700 actually have?
Its nameplate is 16 GB, but about 14.88 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Radeon RX 7700 fast for local AI?
Its memory bandwidth is 624 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.