NVIDIA · workstation

RTX A2000

RTX A2000 has 6 GB of VRAM at 288 GB/s — about 5.58 GiB usable after driver and compositor overhead. 1222 of 2118 indexed models fit at 4K context with q4_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
6 GB
GDDR6
Bandwidth
288 GB/s
192-bit bus
Tensor FP16
32 TF
dense
TDP
70 W
$449 MSRP
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1046vision language 90embedding 26audio asr 38image 1audio tts 19video 2

What fits at 4K context

largest quantization that fits, per model · 1222 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
legitus-instruct-v1I1-IQ4_NL8.1B4.37 GiB0.14 GiB5.58 GiB0.00 GiB36±22%
Apertus-8B-Instruct-2509I1-IQ4_NL8.1B4.37 GiB0.14 GiB5.58 GiB0.00 GiB36±22%
Ministral-3-8B-Instruct-2512IQ4_XS8.9B4.39 GiB0.15 GiB5.58 GiB0.00 GiB36±22%
Ministral-3-8B-Reasoning-2512IQ4_XS8.9B4.39 GiB0.15 GiB5.58 GiB0.00 GiB36±22%
Mistral-7B-v0.3Q4_K_L7.2B4.40 GiB0.14 GiB5.58 GiB0.00 GiB36±22%
L3.2-Rogue-Creative-Instruct-Uncensored-Abliterated-7BQ4_K_M7.5B4.27 GiB0.29 GiB5.58 GiB0.00 GiB36±22%
Qwen3.5-9BQ3_K_M9.7B4.50 GiB0.04 GiB5.57 GiB0.01 GiB36±22%
Rocinante-XL-16B-v1I1-IQ2_XXS16.1B4.29 GiB0.24 GiB5.57 GiB0.01 GiB36±22%
granite-3.3-8b-instructQ4_K_S8.2B4.36 GiB0.18 GiB5.57 GiB0.01 GiB36±22%
granite-3.2-8b-instructQ4_K_S8.2B4.36 GiB0.18 GiB5.57 GiB0.01 GiB36±22%
MARTHA-LXVII.8B_QWEN-3.5-3.6_prune_9b-3.6_baseI1-Q4_08.1B4.50 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
gemma-4-12B-itUD-IQ3_XXS12.0B4.32 GiB0.20 GiB5.57 GiB0.01 GiB36±22%
gemma-4-12B-it-hereticIQ3_XXS12.0B4.32 GiB0.20 GiB5.57 GiB0.01 GiB36±22%
Gemma-4-E4B-it-Minecraft-MT-en-zh-v0.1I1-Q3_K_M8.0B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
gemma-4-E4B-Queen-it-qat-q4_0-unquantizedI1-Q3_K_M8.0B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
Gemma-4-E4B-Luchador-RudoI1-Q3_K_M8.0B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
supergemma4-e4b-abliteratedI1-Q3_K_M7.5B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
Gemma-4-E4B-AbliteratedI1-Q3_K_M8.0B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
gemma-4-E4B-it-The-DECKARD-Claude-Opus-Expresso-Universe-HERETIC-UNCENSORED-ThinkingI1-Q3_K_M8.0B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
gemma-4-E4B-it-The-DECKARD-Expresso-Universe-HERETIC-UNCENSORED-ThinkingI1-Q3_K_M8.0B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
gemma-4-E4B-it-hereticI1-Q3_K_M8.0B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
gemma-4-E4B-it-Claude-Opus-4.5-HERETIC-UNCENSORED-ThinkingI1-Q3_K_M8.0B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
Huihui-gemma-4-E4B-it-abliteratedI1-Q3_K_M8.0B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
gemma-4-E4B-it-Uncensored-MAXI1-Q3_K_M8.0B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
Darkidol-Gemma-4-E4B-itI1-Q3_K_M8.0B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
gemma-4-E4B-it-abliteratedI1-Q3_K_M8.0B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
gemma-4-E4B-it-ultra-uncensored-hereticQ3_K_M8.0B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
gemma-4-E4B-itQ3_K_M8.0B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
OpenMedResearch-Gemma-4E4NI1-Q3_K_M8.0B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
Reasoning-Medical0.1-E4B-sftI1-Q3_K_M8.0B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
gemma-4-E4BQ3_K_M8.0B4.52 GiB0.03 GiB5.57 GiB0.01 GiB36±22%
MiniCPM-Llama3-V-2_5IQ4_NL8.5B4.38 GiB0.14 GiB5.56 GiB0.02 GiB36±22%
Llama3-ChatQA-1.5-8BIQ4_NL8.0B4.38 GiB0.14 GiB5.56 GiB0.02 GiB36±22%
grok-oss-Apollyon-8BIQ4_NL8.0B4.38 GiB0.14 GiB5.56 GiB0.02 GiB36±22%
Turkish-Llama-8b-Instruct-v0.1IQ4_NL8.0B4.38 GiB0.14 GiB5.56 GiB0.02 GiB36±22%
Crow-9B-HERETIC-4.6I1-Q3_K_L9.4B4.49 GiB0.04 GiB5.56 GiB0.02 GiB36±22%
Qwen3.5-9B-Claude-4.6-OS-Auto-Variable-HERETIC-UNCENSORED-THINKINGI1-Q3_K_L9.4B4.49 GiB0.04 GiB5.56 GiB0.02 GiB36±22%
Qwen3.5-9B-Claude-4.6-HighIQ-INSTRUCT-HERETIC-UNCENSOREDI1-Q3_K_L9.4B4.49 GiB0.04 GiB5.56 GiB0.02 GiB36±22%
Qwen3.5-9B-Claude-4.6-OS-HERETIC-UNCENSORED-INSTRUCTI1-Q3_K_L9.4B4.49 GiB0.04 GiB5.56 GiB0.02 GiB36±22%
Qwen3.5-9B-Claude-4.6-HighIQ-THINKING-HERETIC-UNCENSOREDI1-Q3_K_L9.4B4.49 GiB0.04 GiB5.56 GiB0.02 GiB36±22%
NaNovel-9BI1-Q3_K_L9.7B4.49 GiB0.04 GiB5.56 GiB0.02 GiB36±22%
Qwen3.5-9B-Unredacted-MAXI1-Q3_K_L9.4B4.49 GiB0.04 GiB5.56 GiB0.02 GiB36±22%
Qwen3.5-9B-abliteratedI1-Q3_K_L9.4B4.49 GiB0.04 GiB5.56 GiB0.02 GiB36±22%
Ken3.5-9BI1-Q3_K_L9.7B4.49 GiB0.04 GiB5.56 GiB0.02 GiB36±22%
Huihui-Qwen3.5-9B-abliteratedQ3_K_L9.7B4.49 GiB0.04 GiB5.56 GiB0.02 GiB36±22%
Qwen3.5-9B-abliteratedQ3_K_L9.0B4.49 GiB0.04 GiB5.56 GiB0.02 GiB36±22%
Qwen3.5-9B-BaseQ3_K_L9.7B4.49 GiB0.04 GiB5.56 GiB0.02 GiB36±22%
Qwen3.5-9B-gemini-3.1-opus-4.6-reasoningI1-Q3_K_L9.4B4.49 GiB0.04 GiB5.56 GiB0.02 GiB36±22%
LFM2-8B-A1BMoEQ4_K_S8.3B4.56 GiB0.01 GiB5.56 GiB0.02 GiB108±37%
OLMoE-1B-7B-0924-InstructMoEI1-Q5_K_S6.9B4.45 GiB0.14 GiB5.56 GiB0.02 GiB96±37%
Ministral-3-8B-Instruct-2512-BF16-abliteratedI1-IQ4_XS8.9B4.37 GiB0.15 GiB5.56 GiB0.02 GiB36±22%
Ministral-3-8B-Instruct-2512-BF16IQ4_XS8.9B4.37 GiB0.15 GiB5.56 GiB0.02 GiB36±22%
Amaretto-8BI1-IQ4_XS8.9B4.37 GiB0.15 GiB5.56 GiB0.02 GiB36±22%
gemma-4-E4B-itQ4_K_S8.0B4.51 GiB0.03 GiB5.56 GiB0.02 GiB36±22%
GLM-4.7-Flash-REAP-23B-A3B-absolute-heresyMoEI1-IQ1_S23.0B4.49 GiB0.06 GiB5.56 GiB0.02 GiB129±37%
granite-3.1-8b-instructIQ4_NL8.2B4.35 GiB0.18 GiB5.56 GiB0.02 GiB36±22%
Kuwutu-7B-CYOA-v2Q4_K_M7.6B4.37 GiB0.16 GiB5.56 GiB0.02 GiB36±22%
Assistant_Pepe_8BQ4_K_S4.37 GiB0.14 GiB5.55 GiB0.03 GiB36±22%
Ministral-8B-Instruct-2410Q4_K_S8.0B4.36 GiB0.16 GiB5.55 GiB0.03 GiB36±22%
Foundation-Sec-8B-InstructI1-Q4_K_S8.0B4.37 GiB0.14 GiB5.55 GiB0.03 GiB36±22%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a RTX A2000 run?
1222 of 2118 indexed open-weight models fit a RTX A2000 at 4,096 context with q4_0 KV cache, the largest being legitus-instruct-v1 at I1-IQ4_NL. That covers text, vision-language, image, video and speech models.
How much usable memory does a RTX A2000 actually have?
Its nameplate is 6 GB, but about 5.58 GiB is available to a model once driver and compositor overhead is accounted for.
Is a RTX A2000 fast for local AI?
Its memory bandwidth is 288 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.