AMD · consumer

Radeon RX 6600

Radeon RX 6600 has 8 GB of VRAM at 224 GB/s — about 7.44 GiB usable after driver and compositor overhead. 1436 of 2118 indexed models fit at 4K context with q4_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
8 GB
GDDR6
Bandwidth
224 GB/s
128-bit bus
Tensor FP16
dense
TDP
132 W
$329 MSRP
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
vision language 103text 1239video 7audio tts 21embedding 26image 2audio asr 38

What fits at 4K context

largest quantization that fits, per model · 1436 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
OpenCaption-2B-VL-SFT-v1.0F322.1B6.42 GiB0.12 GiB7.43 GiB0.01 GiB22±26.5%
DeepSeek-Coder-V2-Lite-BaseMoEI1-IQ3_XXS15.7B6.49 GiB0.03 GiB7.43 GiB0.01 GiB74±37%
DeepSeek-Coder-V2-Lite-InstructMoEIQ3_XXS15.7B6.49 GiB0.03 GiB7.43 GiB0.01 GiB74±37%
DeepSeek-V2-Lite-ChatMoEIQ3_XXS15.7B6.49 GiB0.03 GiB7.43 GiB0.01 GiB74±37%
Qwen3.6-12B-IQ-Ultra-Heretic-Uncensored-Thinking-V2-HightopQ4_012.1B6.43 GiB0.03 GiB7.42 GiB0.02 GiB22±26.5%
gemma-4-12B-it-hereticQ4_012.0B6.28 GiB0.20 GiB7.42 GiB0.02 GiB22±26.5%
Ministral-3-3B-Instruct-2512BF163.8B6.40 GiB0.11 GiB7.42 GiB0.02 GiB22±26.5%
Ministral-3-3B-Reasoning-2512BF164.3B6.40 GiB0.11 GiB7.42 GiB0.02 GiB22±26.5%
Ministral-3-3B-Instruct-2512-BF16BF164.3B6.39 GiB0.11 GiB7.42 GiB0.02 GiB22±26.5%
Amaretto-3BF164.3B6.39 GiB0.11 GiB7.42 GiB0.02 GiB22±26.5%
Nous-Hermes-2-SOLAR-10.7BQ4_110.7B6.27 GiB0.21 GiB7.42 GiB0.02 GiB22±26.5%
MN-GRAND-23.5B-Gutenberg-UNCENSORED-V2-GLM4.7-ThinkingI1-IQ2_XXS23.4B6.12 GiB0.36 GiB7.42 GiB0.02 GiB22±26.5%
Bielik-11B-v2.3-InstructQ4_K_M11.2B6.26 GiB0.22 GiB7.42 GiB0.02 GiB22±26.5%
Wan2.1-T2V-1.3BQ4_01.4B6.50 GiB0.00 GiB7.42 GiB0.02 GiB22±26.5%
Snowpiercer-15B-v4-hereticI1-Q3_K_S15.0B6.25 GiB0.22 GiB7.41 GiB0.03 GiB22±26.5%
Snowpiercer-15B-v4Q3_K_S15.0B6.25 GiB0.22 GiB7.41 GiB0.03 GiB22±26.5%
Forsaken-Void-12BI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Silver-Siren-ST-12BI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Tess-3-Mistral-Nemo-12BI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
KrakenSakura-Maelstrom-12B-v1IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
MN-12B-Runeweaver-RP-RUI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Impish_Bloodmoon_12BI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Wayfarer-2-12BI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Wayfarer-12BI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Muse-12BI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Vikhr-Nemo-12B-Instruct-R-21-09-24IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Dans-PersonalityEngine-V1.3.0-12bI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
writing-roleplay-20k-context-nemo-12b-v1.0IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Lumimaid-v0.2-12BIQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
MN-Violet-Lotus-12BI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Rocinante-X-12B-v1-Heretic-UncensoredI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Mistral-Heretica-12BI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Lumimaid-Magnum-v4-12BIQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
arcee-fusion-lumaid-12BI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Mistral-NeMo-12B-AbliteratedI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Captain-Eris_Violet-V0.420-12BI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Rocinante-X-12B-v1-absolute-heresyI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Rocinante-X-12B-v1I1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Mistral-Nemo-Gutenberg-Doppel-12BIQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Mistral-Nemo-Instruct-2407IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
MN-12b-RP-InkIQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Mistral-Nemo-2407-12B-Thinking-Claude-Gemini-GPT5.2-Uncensored-HERETICI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Dans-SakuraKaze-V1.0.0-12bI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Mistral-Nemo-Inst-2407-12B-Thinking-Uncensored-HERETIC-HI-Claude-OpusI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Mistral-Nemo-Instruct-2407-12B-Thinking-M-Claude-Opus-High-ReasoningI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Mordant-12B-ThinkI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Riverfish-Rocinante-12B-SFT-DPOI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
MN-Violet-Lotus-12B-HereticI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Himeyuri-Magnum-12B-HereticMergeI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Kinggaroo-12b-v1I1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Magnum-Picaro-0.7-v2-12bI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
magnum-v2.5-12b-ktoI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Mistral-Nemo-Prism-12BI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Nera_Noctis-12BI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
pixtral-12bIQ4_XS12.7B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Chronos-Gold-12B-1.0I1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
patricide-12B-Unslop-MellI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
MN-12B-Celeste-V1.9I1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
Crimson_Dawn-v0.2IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
magnum-v2-12bI1-IQ4_XS12.2B6.28 GiB0.18 GiB7.40 GiB0.04 GiB22±26.5%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Measured on this card

third-party benchmarks, aggregated
WorkloadMedianMiddle 50%Runs
Image generation2.06 it/s0.903.3091
Benchmarked· n=91

Aggregated from community-submitted runs, so the spread is wide by nature — it covers different models, resolutions, step counts and settings, not one controlled configuration. Read the middle 50% rather than the median alone. These figures are reproduced with attribution from vladmandic-sd-data-benchmark, which publishes no licence — so we display and link rather than redistribute them.

Questions people ask

What AI models can a Radeon RX 6600 run?
1436 of 2118 indexed open-weight models fit a Radeon RX 6600 at 4,096 context with q4_0 KV cache, the largest being OpenCaption-2B-VL-SFT-v1.0 at F32. That covers text, vision-language, image, video and speech models.
How much usable memory does a Radeon RX 6600 actually have?
Its nameplate is 8 GB, but about 7.44 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Radeon RX 6600 fast for local AI?
Its memory bandwidth is 224 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.