Best local AI models for 8GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 8GB card gives you about 7.44 GiB to work with after driver overhead. 88 indexed models fit at 32K context — the largest being InternVL3_5-14B at 15.1B parameters in IQ3_M.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 8GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
Qwen3.5-9Bvision + languageQ4_K_M9.7B7.30 GiB0.14 GiB
gemma-4-12B-itvision + languageUD-IQ2_M12.0B7.24 GiB0.20 GiB
Qwen3.5-4Bvision + languageQ8_04.7B6.12 GiB1.32 GiB
Qwythos-9B-Claude-Mythos-5-1Mvision + languageQ4_K9.4B7.22 GiB0.22 GiB
Qwen3.5-0.8Bvision + languageBF16873M2.60 GiB4.84 GiB
gemma-4-E2B-itvision + languageQ8_05.1B5.74 GiB1.70 GiB
gemma-4-E4B-it-qat-q4_0-unquantizedvision + languageQ4_07.9B6.12 GiB1.32 GiB
Qwythos-9B-v2vision + languageI1-Q4_19.7B7.39 GiB0.05 GiB
Qwen3-VL-4B-Instructvision + languageIQ4_XS4.4B7.43 GiB0.01 GiB
Qwen2.5-VL-7B-Instructvision + languageQ4_K_L8.3B7.34 GiB0.10 GiB
Qwen3-VL-2B-Instructvision + languageQ8_02.1B6.00 GiB1.44 GiB
gemma-3-12b-itvision + languageUD-IQ2_M12.2B7.38 GiB0.06 GiB
Qwen3.5-2Bvision + languageBF162.3B4.80 GiB2.64 GiB
Qwen3.5-9Bvision + languageQ4_K_M9.7B7.22 GiB0.22 GiB
LFM2.5-VL-1.6Bvision + languageBF161.6B3.37 GiB4.07 GiB
gemma-4-E4B-it-ultra-uncensored-hereticvision + languageQ6_K8.0B7.11 GiB0.33 GiB
Unlimited-OCRMoEvision + languageQ8_03.3B5.58 GiB1.86 GiB
Qwopus3.5-9B-v3.5vision + languageQ4_K_M9.7B7.22 GiB0.22 GiB
Qwen3.5-9B-GLM5.1-Distill-v1vision + languageQ3_K_M9.7B6.14 GiB1.30 GiB
Qwable-9B-Claude-Fable-5vision + languageI1-Q4_19.4B7.25 GiB0.19 GiB
Qwen3.5-9B-Claude-4.6-OS-Auto-Variable-HERETIC-UNCENSORED-THINKINGvision + languageI1-Q4_19.4B7.25 GiB0.19 GiB
gemma-4-12b-it-uncensoredvision + languageI1-IQ2_M12.0B7.39 GiB0.05 GiB
Holo-3.1-9Bvision + languageI1-Q4_19.4B7.25 GiB0.19 GiB
MiniCPM-V-4.6vision + languageBF161.3B2.57 GiB4.87 GiB
Qwen3.5-9B-ultra-uncensored-hereticvision + languageQ4_K_M9.4B7.08 GiB0.36 GiB
LocateAnything-3Bvision + languageQ6_K3.8B7.07 GiB0.37 GiB
OvisOCR2vision + languageF32853M3.97 GiB3.47 GiB
gemma-3n-E2B-itvision + languageQ8_05.4B5.69 GiB1.75 GiB
Qwen2-VL-2B-Instructvision + languageF162.2B4.56 GiB2.88 GiB
Gemma4-12B-Uncensoredvision + languageI1-IQ2_M12.0B7.39 GiB0.05 GiB
Qwen3-VL-Embedding-2Bvision + languageQ8_02.1B6.00 GiB1.44 GiB
Huihui-Qwen3-VL-4B-Instruct-abliteratedvision + languageI1-IQ4_XS4.4B7.43 GiB0.01 GiB
medgemma-4b-itvision + languageQ8_04.3B5.46 GiB1.98 GiB
chandra-ocr-2vision + languageQ8_05.3B6.62 GiB0.82 GiB
Qwen3.5-0.8B-Basevision + languageBF16873M2.60 GiB4.84 GiB
LFM2-VL-1.6Bvision + languageBF161.6B3.37 GiB4.07 GiB
Qwen2-VL-7B-Instructvision + languageQ4_K_L8.3B7.34 GiB0.10 GiB
Qwen3-VL-4B-Thinkingvision + languageIQ4_XS4.4B7.43 GiB0.01 GiB
LFM2.5-VL-450Mvision + languageF32449M2.48 GiB4.96 GiB
Tess-4-9Bvision + languageI1-Q4_19.7B7.39 GiB0.05 GiB
Qwen3.6-9B-Heretic-Uncensored-Thinking-Sweet-Madnessvision + languageQ4_K_M9.1B6.45 GiB0.99 GiB
gemma-3n-E4B-itvision + languageQ6_K_L7.8B7.29 GiB0.15 GiB
Qwen3-VL-2B-Thinkingvision + languageQ8_02.1B6.00 GiB1.44 GiB
Huihui-Qwen3-VL-8B-Instruct-abliteratedvision + languageI1-IQ1_M8.8B7.43 GiB0.01 GiB
Qwen3.5-2B-Basevision + languageF162.3B4.69 GiB2.75 GiB
Qwen3.5-4Bvision + languageQ8_04.7B5.99 GiB1.45 GiB
Qwen3.5-9B-Basevision + languageI1-Q4_19.7B7.25 GiB0.19 GiB
InternVL3_5-14Bvision + languageIQ3_M15.1B7.26 GiB0.18 GiB
gemma-4-E2B-it-qat-q4_0-unquantized-hereticvision + languageI1-Q4_15.1B4.27 GiB3.17 GiB
LFM2-VL-450Mvision + languageBF16451M1.82 GiB5.62 GiB
medgemma-1.5-4b-itvision + languageQ8_04.3B5.46 GiB1.98 GiB
MiMo-VL-7B-RLvision + languageUD-IQ1_M8.3B7.43 GiB0.01 GiB
Fara-7Bvision + languageQ4_K_L8.3B7.34 GiB0.10 GiB
ToriiGate-0.5vision + languageQ8_05.2B6.62 GiB0.82 GiB
LFM2-VL-3Bvision + languageBF163.0B6.10 GiB1.34 GiB
llava-llama-3-8b-v1_1-transformersvision + languageQ6_K8.4B6.98 GiB0.46 GiB
QwenPaw-Flash-9B-hereticvision + languageQ4_K_M9.4B7.08 GiB0.36 GiB
Jan-v2-VL-medvision + languageI1-IQ1_M8.8B7.43 GiB0.01 GiB
Qwen2-VL-7B-Instruct-abliteratedvision + languageQ4_K_L8.3B7.34 GiB0.10 GiB
Gemma-3-4B-VL-it-Gemini-Pro-Heretic-Uncensored-Thinkingvision + languageQ8_04.3B5.46 GiB1.98 GiB
Spec sheetPredictedwhat these mean

This page models a generic 8GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.