AMD · consumer

Radeon RX 6400

Radeon RX 6400 has 4 GB of VRAM at 128 GB/s — about 3.72 GiB usable after driver and compositor overhead. 846 of 2118 indexed models fit at 4K context with q4_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
4 GB
GDDR6
Bandwidth
128 GB/s
64-bit bus
Tensor FP16
dense
TDP
53 W
$159 MSRP
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
audio tts 19text 704audio asr 37vision language 58embedding 25image 1video 2

What fits at 4K context

largest quantization that fits, per model · 846 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
orpheus-3b-0.1-pretrainedQ5_13.8B2.68 GiB0.12 GiB3.72 GiB0.00 GiB28±26.5%
CycleGRPO-4BI1-Q4_14.8B2.65 GiB0.16 GiB3.71 GiB0.01 GiB28±26.5%
Hy-MT2-7BUD-IQ2_M8.0B2.63 GiB0.14 GiB3.71 GiB0.01 GiB29±26.5%
Jan-v3-4B-base-instructQ4_14.4B2.64 GiB0.16 GiB3.71 GiB0.01 GiB28±26.5%
Jan-code-4bQ4_14.4B2.64 GiB0.16 GiB3.71 GiB0.01 GiB28±26.5%
dolphin-2.9.3-mistral-7B-32kI1-IQ3_XXS7.2B2.64 GiB0.14 GiB3.71 GiB0.01 GiB29±26.5%
Mistral-7B-v0.3IQ3_XXS7.2B2.64 GiB0.14 GiB3.71 GiB0.01 GiB29±26.5%
Mistral-7B-Instruct-v0.3-ParasiteI1-IQ3_XXS7.2B2.64 GiB0.14 GiB3.71 GiB0.01 GiB29±26.5%
Mistral-7B-Instruct-v0.3-JbliteratedI1-IQ3_XXS7.2B2.64 GiB0.14 GiB3.71 GiB0.01 GiB29±26.5%
Mathstral-7B-v0.1IQ3_XXS7.2B2.64 GiB0.14 GiB3.71 GiB0.01 GiB29±26.5%
NVIDIA-Nemotron-3-Nano-4B-BF16Q4_14.0B2.60 GiB0.18 GiB3.71 GiB0.01 GiB29±26.5%
Qwen3-4B-BaseQ4_14.0B2.64 GiB0.16 GiB3.71 GiB0.01 GiB29±26.5%
Miril-Drone-2B-1Q2_K5.1B2.80 GiB0.02 GiB3.71 GiB0.01 GiB28±26.5%
granite-speech-4.1-2bQ4_K2.3B2.74 GiB0.09 GiB3.71 GiB0.01 GiB28±26.5%
SciPhi-Self-RAG-Mistral-7B-32kKV unresolvedI1-IQ3_XXS7.2B2.63 GiB0.14 GiB3.71 GiB0.01 GiB29±26.5%
dolphin-2.2.1-mistral-7bKV unresolvedI1-IQ3_XXS7.2B2.63 GiB0.14 GiB3.71 GiB0.01 GiB29±26.5%
OpenChat-3.5-7B-Qwen-v2.0KV unresolvedI1-IQ3_XXS7.2B2.63 GiB0.14 GiB3.71 GiB0.01 GiB29±26.5%
openchat-3.5-0106KV unresolvedI1-IQ3_XXS7.2B2.63 GiB0.14 GiB3.71 GiB0.01 GiB29±26.5%
Mistral-7B-Instruct-v0.1KV unresolvedI1-IQ3_XXS7.2B2.63 GiB0.14 GiB3.71 GiB0.01 GiB29±26.5%
Mistral-7B-Instruct-v0.2I1-IQ3_XXS7.2B2.63 GiB0.14 GiB3.71 GiB0.01 GiB29±26.5%
ContextualKunoichi_KTO-7BI1-IQ3_XXS7.2B2.63 GiB0.14 GiB3.71 GiB0.01 GiB29±26.5%
xLAM-7b-rI1-IQ3_XXS7.2B2.63 GiB0.14 GiB3.71 GiB0.01 GiB29±26.5%
Ninja-v1-RP-WIPKV unresolvedI1-IQ3_XXS7.2B2.63 GiB0.14 GiB3.71 GiB0.01 GiB29±26.5%
Kunoichi-DPO-v2-7BKV unresolvedIQ3_XXS7.2B2.63 GiB0.14 GiB3.71 GiB0.01 GiB29±26.5%
Gemma-The-Writer-N-Restless-Quill-10B-UncensoredI1-IQ1_S10.0B2.37 GiB0.40 GiB3.71 GiB0.01 GiB29±26.5%
Holo-3.1-4BI1-IQ4_NL5.2B2.76 GiB0.04 GiB3.71 GiB0.01 GiB29±26.5%
AfriqueQwen3.5-4BI1-IQ4_NL5.2B2.76 GiB0.04 GiB3.71 GiB0.01 GiB29±26.5%
TimeOmni-1-4BI1-IQ4_NL5.2B2.76 GiB0.04 GiB3.71 GiB0.01 GiB29±26.5%
EVA-Yi-1.5-9B-32K-V1I1-IQ2_S8.8B2.68 GiB0.11 GiB3.71 GiB0.01 GiB29±26.5%
OvisOCR2F32853M2.81 GiB0.01 GiB3.71 GiB0.01 GiB28±26.5%
legitus-instruct-v1I1-IQ2_S8.1B2.60 GiB0.14 GiB3.70 GiB0.02 GiB29±26.5%
Apertus-8B-Instruct-2509I1-IQ2_S8.1B2.60 GiB0.14 GiB3.70 GiB0.02 GiB29±26.5%
granite-3.1-8b-instructIQ2_S8.2B2.60 GiB0.18 GiB3.70 GiB0.02 GiB29±26.5%
Phi-4-mini-instruct-abliteratedQ5_K_M3.8B2.65 GiB0.14 GiB3.70 GiB0.02 GiB29±26.5%
Phi-4-mini-reasoningQ5_K_M3.8B2.65 GiB0.14 GiB3.70 GiB0.02 GiB29±26.5%
Phi-4-mini-instructQ5_K_M3.8B2.65 GiB0.14 GiB3.70 GiB0.02 GiB29±26.5%
MiniCPM-V-4Q6_K4.1B2.76 GiB0.04 GiB3.70 GiB0.02 GiB29±26.5%
Hunyuan-7B-InstructQ2_K_S7.5B2.62 GiB0.14 GiB3.70 GiB0.02 GiB29±26.5%
dolphin-2_6-phi-2Q8_02.8B2.75 GiB0.00 GiB3.70 GiB0.02 GiB29±26.5%
Qwen3-VL-4B-Instruct-Unredacted-MAXI1-Q5_K_S4.4B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Qwen3-VL-4B-ThinkingQ5_K_S4.4B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Qwen3-VL-4B-Thinking-Unredacted-MAXI1-Q5_K_S4.4B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Zubr1.0-VL-4BI1-Q5_K_S4.4B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Qwen3-VL-4B-Instruct-Uncensored-abliteratedQ5_K_S4.4B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
PopiT-Qwen3-4B-Medical-SFT-1128Q5_K_S4.0B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Huihui-Qwen3-VL-4B-Instruct-abliteratedI1-Q5_K_S4.4B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Qwen3-VL-4B-Instruct-UncensoredI1-Q5_K_S4.4B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Qwen3-VL-4B-InstructQ5_K_S4.4B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
OpenCaption-4B-VL-SFT-v1.0I1-Q5_K_S4.4B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Parable-Qwen3-4B-Claude-Fable-5I1-Q5_K_S4.0B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Logics-Parsing-v2Q5_K_S4.4B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Jan-v1-4BQ5_K_S4.0B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Qwen3-4b-Z-Image-Turbo-AbliteratedV1I1-Q5_K_S4.0B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Z-Image-Engineer-V6Q5_K_S4.0B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Darwin-4B-ChimeraI1-Q5_K_S4.0B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Qwen3-4BQ5_K_S4.0B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Huihui-Qwen3-4B-Instruct-2507-abliteratedQ5_K_S4.0B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Josiefied-Qwen3-4B-abliterated-v2Q5_K_S4.0B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Qwen3-4B-Thinking-2507Q5_K_S4.0B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
Jan-nano-128kQ5_K_S4.0B2.63 GiB0.16 GiB3.70 GiB0.02 GiB29±26.5%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Radeon RX 6400 run?
846 of 2118 indexed open-weight models fit a Radeon RX 6400 at 4,096 context with q4_0 KV cache, the largest being orpheus-3b-0.1-pretrained at Q5_1. That covers text, vision-language, image, video and speech models.
How much usable memory does a Radeon RX 6400 actually have?
Its nameplate is 4 GB, but about 3.72 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Radeon RX 6400 fast for local AI?
Its memory bandwidth is 128 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.