Best local AI models for 16GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 16GB card gives you about 14.88 GiB to work with after driver overhead. 39 indexed models fit at 32K context — the largest being Voxtral-Small-24B-2507 at 24.3B parameters in Q2_K_L.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 16GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
nemotron-3.5-asr-streaming-0.6bspeech recognitionF32638M3.22 GiB11.66 GiB
parakeet-tdt-0.6b-v3speech recognitionF32627M3.18 GiB11.70 GiB
whisper-mediumspeech recognitionF32764M3.69 GiB11.19 GiB
Voxtral-Mini-4B-Realtime-2602speech recognitionF164.4B12.33 GiB2.55 GiB
whisper-large-v3speech recognitionF161.5B3.74 GiB11.14 GiB
whisper-large-v3-turbospeech recognitionF16809M2.36 GiB12.52 GiB
Qwen3-ASR-1.7Bspeech recognitionF162.3B5.23 GiB9.65 GiB
Voxtral-Small-24B-2507speech recognitionQ2_K_L24.3B14.81 GiB0.07 GiB
Qwen3-ASR-0.6Bspeech recognitionF16938M2.32 GiB12.56 GiB
GigaAM-v3speech recognitionF32223M1.67 GiB13.21 GiB
parakeet-ctc-0.6bspeech recognitionQ8_0609M11.23 GiB3.65 GiB
granite-speech-4.1-2b-narspeech recognitionF162.3B8.65 GiB6.23 GiB
whisper-smallspeech recognitionF32242M1.75 GiB13.13 GiB
granite-speech-4.1-2bspeech recognitionF162.3B8.48 GiB6.40 GiB
whisper-largespeech recognitionF321.5B6.60 GiB8.28 GiB
Voxtral-Mini-3B-2507speech recognitionF164.7B13.29 GiB1.59 GiB
canary-1b-flashspeech recognitionF32811M4.16 GiB10.72 GiB
whisper-large-v2speech recognitionF321.5B6.60 GiB8.28 GiB
canary-qwen-2.5bspeech recognitionF162.6B6.15 GiB8.73 GiB
granite-speech-4.1-2b-plusspeech recognitionF162.1B8.50 GiB6.38 GiB
Breeze-ASR-25speech recognitionF161.5B3.74 GiB11.14 GiB
nemotron-speech-streaming-en-0.6bspeech recognitionF32618M3.15 GiB11.73 GiB
granite-4.0-1b-speechspeech recognitionF162.3B7.60 GiB7.28 GiB
parakeet-ctc-1.1bspeech recognitionF321.1B4.80 GiB10.08 GiB
parakeet-rnnt-1.1bspeech recognitionF321.1B4.83 GiB10.05 GiB
whisper-basespeech recognitionF3273M1.12 GiB13.76 GiB
moonshine-streaming-mediumspeech recognitionF32266M2.85 GiB12.03 GiB
whisper-medium.enspeech recognitionF32764M3.69 GiB11.19 GiB
parakeet-rnnt-0.6bspeech recognitionF32617M3.14 GiB11.74 GiB
whisper-small.enspeech recognitionF32242M1.75 GiB13.13 GiB
moonshine-streaming-smallspeech recognitionF32140M1.91 GiB12.97 GiB
whisper-tinyspeech recognitionF3238M0.99 GiB13.89 GiB
MOSS-Transcribe-Diarizespeech recognitionF32909M7.66 GiB7.22 GiB
GLM-ASR-Nano-2512speech recognitionBF162.3B5.51 GiB9.37 GiB
ARK-ASR-3Bspeech recognitionF164.1B8.93 GiB5.95 GiB
whisper-base.enspeech recognitionF3273M1.12 GiB13.76 GiB
moonshine-streaming-tinyspeech recognitionF3244M1.16 GiB13.72 GiB
moonshine-basespeech recognitionF3262M0.99 GiB13.89 GiB
Qwen3-ForcedAligner-0.6Bspeech recognitionF16918M2.56 GiB12.32 GiB
Spec sheetPredictedwhat these mean

This page models a generic 16GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.