NVIDIA · workstation
RTX A2000
RTX A2000 has 6 GB of VRAM at 288 GB/s — about 5.58 GiB usable after driver and compositor overhead. 925 of 2118 indexed models fit at 64K context with q4_0 KV.
Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
6 GB
GDDR6
Bandwidth
288 GB/s
192-bit bus
Tensor FP16
32 TF
dense
TDP
70 W
$449 MSRP
text 762audio asr 38vision language 79audio tts 19embedding 25video 2
What fits at 64K context
largest quantization that fits, per model · 925 of 2118 indexed
| Model | Best quant | Params | Weights● | KV● | Total in memory◐ | Headroom◐ | tok/s◐ |
|---|---|---|---|---|---|---|---|
| SmolLM2-1.7B-Instruct-Uncensored | Q5_K_M | 1.8B | 1.21 GiB | 3.38 GiB | 5.58 GiB | 0.00 GiB | 36±22% |
| Yi-6B-Chat | I1-Q4_K_M | 6.1B | 3.42 GiB | 1.13 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| Yi-1.5-6B-Chat | Q4_K_M | 6.1B | 3.42 GiB | 1.13 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| legitus-instruct-v1 | I1-IQ2_XXS | 8.1B | 2.25 GiB | 2.25 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| Apertus-8B-Instruct-2509 | I1-IQ2_XXS | 8.1B | 2.25 GiB | 2.25 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| Jan-v3-4B-base-instruct | Q2_K_L | 4.4B | 2.03 GiB | 2.53 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| Jan-code-4b | Q2_K_L | 4.4B | 2.03 GiB | 2.53 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| granite-speech-4.1-2b-nar | Q4_K | 2.3B | 3.18 GiB | 1.41 GiB | 5.57 GiB | 0.01 GiB | 35±22% |
| Crow-9B-HERETIC-4.6 | I1-IQ3_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| Qwen3.5-9B-Claude-4.6-OS-Auto-Variable-HERETIC-UNCENSORED-THINKING | I1-IQ3_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| Qwen3.5-9B-Claude-4.6-HighIQ-INSTRUCT-HERETIC-UNCENSORED | I1-IQ3_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| Qwen3.5-9B-Claude-4.6-OS-HERETIC-UNCENSORED-INSTRUCT | I1-IQ3_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| Qwen3.5-9B-Claude-4.6-HighIQ-THINKING-HERETIC-UNCENSORED | I1-IQ3_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| NaNovel-9B | I1-IQ3_S | 9.7B | 3.97 GiB | 0.56 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| Qwen3.5-9B-Unredacted-MAX | I1-IQ3_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| Qwen3.5-9B-abliterated | I1-IQ3_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| Ken3.5-9B | I1-IQ3_S | 9.7B | 3.97 GiB | 0.56 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| Qwen3.5-9B-Base | IQ3_S | 9.7B | 3.97 GiB | 0.56 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| Qwen3.5-9B-gemini-3.1-opus-4.6-reasoning | I1-IQ3_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| Darwin-4B-Chimera | Q8_0 | 4.0B | 3.99 GiB | 0.57 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| granite-3.1-8b-instruct | TQ1_0 | 8.2B | 1.72 GiB | 2.81 GiB | 5.57 GiB | 0.01 GiB | 36±22% |
| Vero-Qwen35-9B-Base | I1-Q3_K_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Vero-Qwen35-9B | I1-Q3_K_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Qwen3.5-9B-Claude-4.6-Opus-Deckard-V4.2-Uncensored-Heretic-Thinking | I1-Q3_K_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Morphos-9B | I1-Q3_K_S | 9.0B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Qwable-9B-Claude-Fable-5-heretic | I1-Q3_K_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Holo-3.1-9B | I1-Q3_K_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Qwable-9B-Claude-Fable-5 | I1-Q3_K_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Qwen3.5-9B-imabari-v2 | I1-Q3_K_S | 9.7B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Qwen3.5-9B-abliterated-v2-MAX | I1-Q3_K_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| OmniCoder-9B-Claude-Opus-High-Reasoning-Distill | I1-Q3_K_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Qwable-9B-Claude-Fable-5-StraTA | I1-Q3_K_S | 9.0B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Qwable-9B-Claude-Fable-5-OBLITERATED | I1-Q3_K_S | 9.0B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Qwen3.5-9B-RpRMax-v1 | I1-Q3_K_S | 9.7B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| AdQWENistrator-9B | I1-Q3_K_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| cajal-9b-v2-full | I1-Q3_K_S | 9.0B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Qwen3.5-9B-ultra-uncensored-heretic | Q3_K_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Holo-3.1-9B-Coder | I1-Q3_K_S | 9.0B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Pluto | I1-Q3_K_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Holo-3.1-9B-abliterated-rdo | I1-Q3_K_S | 9.0B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Qwen3.5-9B-Uncensored-cyber-v3 | Q3_K_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Miss_MARTHA-9B-Qwen3.5-Omni | I1-Q3_K_S | 9.0B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Huihui-Qwen3.5-9B-abliterated | Q3_K_S | 9.7B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| qwen3.5-9b-nsfw-captioning-v5 | I1-Q3_K_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Qwen3.5-9B-DS-v4-Flash-v3.0 | Q3_K_S | 9.4B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Qwen3.5-9B-DeepSeek-V4-Flash | I1-Q3_K_S | 9.7B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Huihui-Qwen3.5-9B-Claude-4.6-Opus-abliterated | I1-Q3_K_S | 9.7B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Qwopus3.5-9B-v3.5 | Q3_K_S | 9.7B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Katarau-9B-ru-RP-nsfw | I1-Q3_K_S | 9.0B | 3.97 GiB | 0.56 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| internlm3-8b-instruct | Q2_K_L | 8.8B | 3.69 GiB | 0.84 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Olmo-3-7B-Instruct | UD-IQ1_S | 7.3B | 1.81 GiB | 2.72 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Olmo-3-7B-Think | UD-IQ1_S | 7.3B | 1.81 GiB | 2.72 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Ministral-3-3B-Instruct-2512-BF16 | Q6_K_L | 4.3B | 2.72 GiB | 1.83 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Nemotron-Mini-4B-Instruct | IQ4_XS | 4.2B | 2.29 GiB | 2.25 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Hubble-4B-v1 | Q3_K_L | 4.5B | 2.30 GiB | 2.25 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Aura-4B | I1-Q3_K_L | 4.5B | 2.30 GiB | 2.25 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| magnum-v2-4b | I1-Q3_K_L | 4.5B | 2.30 GiB | 2.25 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Impish_LLAMA_4B | Q3_K_L | 4.5B | 2.30 GiB | 2.25 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| Llama-3.1-Minitron-4B-Width-Base | Q3_K_L | 4.5B | 2.30 GiB | 2.25 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
| AfriqueGemma-12B | I1-IQ1_M | 12.2B | 3.26 GiB | 1.26 GiB | 5.56 GiB | 0.02 GiB | 36±22% |
Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.
Questions people ask
- What AI models can a RTX A2000 run?
- 925 of 2118 indexed open-weight models fit a RTX A2000 at 65,536 context with q4_0 KV cache, the largest being SmolLM2-1.7B-Instruct-Uncensored at Q5_K_M. That covers text, vision-language, image, video and speech models.
- How much usable memory does a RTX A2000 actually have?
- Its nameplate is 6 GB, but about 5.58 GiB is available to a model once driver and compositor overhead is accounted for.
- Is a RTX A2000 fast for local AI?
- Its memory bandwidth is 288 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.