Best local AI models for 4GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 4GB card gives you about 3.72 GiB to work with after driver overhead. 360 indexed models fit at 32K context — the largest being Qwen2.5-Omni-7B at 10.7B parameters in Q2_K.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 4GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
nemotron-3.5-asr-streaming-0.6bspeech recognitionF32638M3.22 GiB0.50 GiB
Qwen3.5-4Bvision + languageIQ2_M4.7B3.63 GiB0.09 GiB
Qwen3.5-0.8Bvision + languageBF16873M2.60 GiB1.12 GiB
Llama-3.2-1B-Instructtext generationQ8_01.2B3.03 GiB0.69 GiB
gemma-4-E2B-itvision + languageIQ3_XXS5.1B3.51 GiB0.21 GiB
parakeet-tdt-0.6b-v3speech recognitionF32627M3.18 GiB0.54 GiB
ced-basetext generationF3286M1.16 GiB2.56 GiB
Ace-Step1.5speech synthesisF32160M2.71 GiB1.01 GiB
Qwen3-TTS-12Hz-0.6B-Basespeech synthesisQ4_K915M1.34 GiB2.38 GiB
gemma-3-1b-ittext generationF161000M2.81 GiB0.91 GiB
whisper-mediumspeech recognitionF32764M3.69 GiB0.03 GiB
embeddinggemma-300mtext generationF32303M2.05 GiB1.67 GiB
Wan2.1-T2V-1.3Btext generationQ5_K_M1.4B3.44 GiB0.28 GiB
LFM2.5-1.2B-Instructtext generationBF161.2B3.37 GiB0.35 GiB
Qwen2.5-1.5B-Instructtext generationQ8_01.5B3.44 GiB0.28 GiB
gemma-3-4b-ittext generationIQ4_XS4.3B3.72 GiB0.00 GiB
whisper-large-v3speech recognitionQ8_01.5B2.44 GiB1.28 GiB
MiniCPM5-1B-Claude-Opus-Fable5-Thinkingtext generationF161.1B3.55 GiB0.17 GiB
whisper-large-v3-turbospeech recognitionF16809M2.36 GiB1.36 GiB
Qwen3.5-2Bvision + languageQ8_02.3B3.11 GiB0.61 GiB
Qwen2.5-3B-Instructtext generationQ4_K_S3.1B3.65 GiB0.07 GiB
gemma-2-2b-ittext generationIQ2_XS2.6B3.60 GiB0.12 GiB
MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinkingtext generationF161.1B3.55 GiB0.17 GiB
Qwen2.5-0.5B-Instructtext generationF16494M2.08 GiB1.64 GiB
embeddinggemma-300m-qat-q8_0-unquantizedembeddingsQ8_0303M1.22 GiB2.50 GiB
Qwen3-ASR-1.7Bspeech recognitionQ8_02.3B3.18 GiB0.54 GiB
TinyLlama-1.1B-Chat-v1.0text generationF161.1B3.53 GiB0.19 GiB
Qwen3-ASR-0.6Bspeech recognitionF16938M2.32 GiB1.40 GiB
SmolLM2-135M-Instructtext generationF16135M1.72 GiB2.00 GiB
Qwen2.5-Coder-3B-Instructtext generationQ4_K_S3.1B3.65 GiB0.07 GiB
KaLM-embedding-multilingual-mini-instruct-v2.5embeddingsQ8_0494M1.65 GiB2.07 GiB
nomic-embed-text-v1.5embeddingsF32137M2.40 GiB1.32 GiB
Qwen2.5-Coder-1.5B-Instructtext generationQ8_01.5B3.44 GiB0.28 GiB
GigaAM-v3speech recognitionF32223M1.67 GiB2.05 GiB
gemma-3-270m-ittext generationF16268M1.38 GiB2.34 GiB
umt5-xxltext generationQ3_K_M5.7B3.70 GiB0.02 GiB
DeepSeek-R1-Distill-Qwen-1.5Btext generationQ8_01.8B3.44 GiB0.28 GiB
LFM2.5-8B-A1BMoEtext generationUD-IQ2_XXS8.5B3.69 GiB0.03 GiB
jina-embeddings-v5-text-nanoembeddingsF16212M2.30 GiB1.42 GiB
SmolVLM-500M-Instructtext generationF16507M2.78 GiB0.94 GiB
tinygemma3_cifartext generationQ8_039M0.93 GiB2.79 GiB
LFM2.5-VL-1.6Bvision + languageBF161.6B3.37 GiB0.35 GiB
VibeThinker-3Btext generationQ4_K_S3.1B3.65 GiB0.07 GiB
Qwen2.5-VL-3B-Instructtext generationQ4_K_S3.8B3.65 GiB0.07 GiB
t5-v1_1-xxltext generationQ4_04.8B3.66 GiB0.06 GiB
Qwen3.6-27B-DFlashtext generationQ8_01.7B2.75 GiB0.97 GiB
all-MiniLM-L6-v2embeddingsF3223M1.13 GiB2.59 GiB
LFM2.5-230Mtext generationBF16230M1.57 GiB2.15 GiB
OmniVoicespeech synthesisF16613M2.37 GiB1.35 GiB
LFM2.5-350Mtext generationBF16354M1.82 GiB1.90 GiB
parakeet-ctc-0.6bspeech recognitionF32609M3.11 GiB0.61 GiB
whisper-smallspeech recognitionF32242M1.75 GiB1.97 GiB
MiniCPM5-1Btext generationF161.1B3.55 GiB0.17 GiB
TinyLlama-1.1B-Chat-v0.3text generationQ8_01.1B2.57 GiB1.15 GiB
whisper-largespeech recognitionQ8_01.5B2.40 GiB1.32 GiB
VieNeu-TTS-0.3Bspeech synthesisQ8_0244M1.94 GiB1.78 GiB
Wan2.2-TI2V-5Bvideo generationQ4_05.0B3.66 GiB0.06 GiB
neutts-airspeech synthesisQ8_0748M1.90 GiB1.82 GiB
canary-1b-flashspeech recognitionF16811M2.51 GiB1.21 GiB
LFM2.5-Audio-1.5Btext generationF161.5B3.52 GiB0.20 GiB
Spec sheetPredictedwhat these mean

This page models a generic 4GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.