Best local AI models for 8GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 8GB card gives you about 7.44 GiB to work with after driver overhead. 986 indexed models fit at 32K context — the largest being Darwin-36B-Opus at 34.7B parameters in IQ2_M.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 8GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
Qwen3.5-9Bvision + languageQ4_K_M9.7B7.30 GiB0.14 GiB
gemma-4-12B-itvision + languageUD-IQ2_M12.0B7.24 GiB0.20 GiB
nemotron-3.5-asr-streaming-0.6bspeech recognitionF32638M3.22 GiB4.22 GiB
Qwen3.5-4Bvision + languageQ8_04.7B6.12 GiB1.32 GiB
Qwythos-9B-Claude-Mythos-5-1Mvision + languageQ4_K9.4B7.22 GiB0.22 GiB
gemma-4-E4B-ittext generationQ5_K_M8.0B6.69 GiB0.75 GiB
Qwen3-4Btext generationIQ4_XS4.0B7.43 GiB0.01 GiB
Qwen3.5-0.8Bvision + languageBF16873M2.60 GiB4.84 GiB
Llama-3.2-1B-Instructtext generationF161.2B4.11 GiB3.33 GiB
gemma-4-E2B-itvision + languageQ8_05.1B5.74 GiB1.70 GiB
gemma-4-E4B-it-qat-q4_0-unquantizedvision + languageQ4_07.9B6.12 GiB1.32 GiB
parakeet-tdt-0.6b-v3speech recognitionF32627M3.18 GiB4.26 GiB
Llama-3.1-8B-Instructtext generationUD-IQ2_XXS8.0B7.17 GiB0.27 GiB
ced-basetext generationF3286M1.16 GiB6.28 GiB
Ace-Step1.5speech synthesisF32160M2.71 GiB4.73 GiB
Qwen2.5-7B-Instructtext generationQ4_K_L7.6B7.34 GiB0.10 GiB
Qwen3-TTS-12Hz-0.6B-Basespeech synthesisQ4_K_M915M5.57 GiB1.87 GiB
Qwythos-9B-v2vision + languageI1-Q4_19.7B7.39 GiB0.05 GiB
UI-TARS-1.5-7Btext generationQ4_K_M8.3B6.97 GiB0.47 GiB
gemma-3-1b-ittext generationF161000M2.81 GiB4.63 GiB
gemma-4-E2B-it-qat-q4_0-unquantizedtext generationQ4_K5.1B4.22 GiB3.22 GiB
Qwen3-1.7Btext generationQ8_02.0B6.31 GiB1.13 GiB
whisper-mediumspeech recognitionF32764M3.69 GiB3.75 GiB
embeddinggemma-300mtext generationF32303M2.05 GiB5.39 GiB
Llama-3.2-3B-Instructtext generationQ6_K_L3.2B6.86 GiB0.58 GiB
Qwen3-0.6Btext generationBF16752M5.68 GiB1.76 GiB
Voxtral-Mini-4B-Realtime-2602speech recognitionQ5_K_M4.4B7.12 GiB0.32 GiB
Wan2.1-T2V-1.3Btext generationQ4_01.4B7.32 GiB0.12 GiB
LFM2.5-1.2B-Instructtext generationBF161.2B3.37 GiB4.07 GiB
Qwen2.5-Coder-7B-Instructtext generationQ4_K_L7.6B7.34 GiB0.10 GiB
Qwen3-VL-4B-Instructvision + languageIQ4_XS4.4B7.43 GiB0.01 GiB
Qwen2.5-1.5B-Instructtext generationF161.5B4.56 GiB2.88 GiB
Jan-v3-4B-base-instructtext generationQ3_K_M4.4B7.40 GiB0.04 GiB
gemma-3-4b-ittext generationQ8_04.3B5.46 GiB1.98 GiB
whisper-large-v3speech recognitionF161.5B3.74 GiB3.70 GiB
MiniCPM5-1B-Claude-Opus-Fable5-Thinkingtext generationF161.1B3.55 GiB3.89 GiB
Qwen2.5-VL-7B-Instructvision + languageQ4_K_L8.3B7.34 GiB0.10 GiB
Qwen3-VL-2B-Instructvision + languageQ8_02.1B6.00 GiB1.44 GiB
Ornith-1.0-9Btext generationQ4_19.2B7.37 GiB0.07 GiB
jina-embeddings-v5-text-smallembeddingsF16596M5.39 GiB2.05 GiB
whisper-large-v3-turbospeech recognitionF16809M2.36 GiB5.08 GiB
Qwen3-4B-Instruct-2507text generationIQ4_XS4.0B7.43 GiB0.01 GiB
granite-4.1-3btext generationQ8_03.4B6.67 GiB0.77 GiB
gemma-3-12b-itvision + languageUD-IQ2_M12.2B7.38 GiB0.06 GiB
Qwen3.5-2Bvision + languageBF162.3B4.80 GiB2.64 GiB
Qwen2.5-3B-Instructtext generationQ8_03.1B5.30 GiB2.14 GiB
gemma-2-2b-ittext generationQ8_02.6B5.26 GiB2.18 GiB
MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinkingtext generationF161.1B3.55 GiB3.89 GiB
Qwen2.5-0.5B-Instructtext generationF16494M2.08 GiB5.36 GiB
embeddinggemma-300m-qat-q8_0-unquantizedembeddingsQ8_0303M1.22 GiB6.22 GiB
Qwen3-ASR-1.7Bspeech recognitionF162.3B5.23 GiB2.21 GiB
gemma-4-12b-heretic-abliteratedtext generationI1-IQ2_M12.0B7.39 GiB0.05 GiB
TinyLlama-1.1B-Chat-v1.0text generationF161.1B3.53 GiB3.91 GiB
Phi-4-mini-instructtext generationQ5_K_S3.8B7.35 GiB0.09 GiB
Qwen3-ASR-0.6Bspeech recognitionF16938M2.32 GiB5.12 GiB
SmolLM2-135M-Instructtext generationF16135M1.72 GiB5.72 GiB
Wan2.2-Animate-14Bvideo generationQ2_K17.3B7.20 GiB0.24 GiB
Qwen3.5-9Bvision + languageQ4_K_M9.7B7.22 GiB0.22 GiB
FastContext-1.0-4B-SFTtext generationI1-IQ4_XS4.0B7.43 GiB0.01 GiB
DeepSeek-R1-Distill-Qwen-7Btext generationQ4_K_L7.6B7.34 GiB0.10 GiB
Spec sheetPredictedwhat these mean

This page models a generic 8GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.