Best local AI models for 6GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 6GB card gives you about 5.58 GiB to work with after driver overhead. 36 indexed models fit at 32K context — the largest being ARK-ASR-3B at 4.1B parameters in Q4_K.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 6GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
nemotron-3.5-asr-streaming-0.6bspeech recognitionF32638M3.22 GiB2.36 GiB
parakeet-tdt-0.6b-v3speech recognitionF32627M3.18 GiB2.40 GiB
whisper-mediumspeech recognitionF32764M3.69 GiB1.89 GiB
whisper-large-v3speech recognitionF161.5B3.74 GiB1.84 GiB
whisper-large-v3-turbospeech recognitionF16809M2.36 GiB3.22 GiB
Qwen3-ASR-1.7Bspeech recognitionF162.3B5.23 GiB0.35 GiB
Qwen3-ASR-0.6Bspeech recognitionF16938M2.32 GiB3.26 GiB
GigaAM-v3speech recognitionF32223M1.67 GiB3.91 GiB
parakeet-ctc-0.6bspeech recognitionF32609M3.11 GiB2.47 GiB
granite-speech-4.1-2b-narspeech recognitionQ6_K2.3B5.13 GiB0.45 GiB
whisper-smallspeech recognitionF32242M1.75 GiB3.83 GiB
granite-speech-4.1-2bspeech recognitionQ6_K2.3B5.17 GiB0.41 GiB
whisper-largespeech recognitionF161.5B3.74 GiB1.84 GiB
canary-1b-flashspeech recognitionF32811M4.16 GiB1.42 GiB
whisper-large-v2speech recognitionF161.5B3.74 GiB1.84 GiB
canary-qwen-2.5bspeech recognitionBF162.6B5.57 GiB0.01 GiB
granite-speech-4.1-2b-plusspeech recognitionQ8_02.1B5.47 GiB0.11 GiB
Breeze-ASR-25speech recognitionF161.5B3.74 GiB1.84 GiB
nemotron-speech-streaming-en-0.6bspeech recognitionF32618M3.15 GiB2.43 GiB
granite-4.0-1b-speechspeech recognitionQ6_K2.3B5.17 GiB0.41 GiB
parakeet-ctc-1.1bspeech recognitionF321.1B4.80 GiB0.78 GiB
parakeet-rnnt-1.1bspeech recognitionF321.1B4.83 GiB0.75 GiB
whisper-basespeech recognitionF3273M1.12 GiB4.46 GiB
moonshine-streaming-mediumspeech recognitionF32266M2.85 GiB2.73 GiB
whisper-medium.enspeech recognitionF32764M3.69 GiB1.89 GiB
parakeet-rnnt-0.6bspeech recognitionF32617M3.14 GiB2.44 GiB
whisper-small.enspeech recognitionF32242M1.75 GiB3.83 GiB
moonshine-streaming-smallspeech recognitionF32140M1.91 GiB3.67 GiB
whisper-tinyspeech recognitionF3238M0.99 GiB4.59 GiB
MOSS-Transcribe-Diarizespeech recognitionQ4_K909M5.38 GiB0.20 GiB
GLM-ASR-Nano-2512speech recognitionBF162.3B5.51 GiB0.07 GiB
ARK-ASR-3Bspeech recognitionQ4_K4.1B5.21 GiB0.37 GiB
whisper-base.enspeech recognitionF3273M1.12 GiB4.46 GiB
moonshine-streaming-tinyspeech recognitionF3244M1.16 GiB4.42 GiB
moonshine-basespeech recognitionF3262M0.99 GiB4.59 GiB
Qwen3-ForcedAligner-0.6Bspeech recognitionF16918M2.56 GiB3.02 GiB
Spec sheetPredictedwhat these mean

This page models a generic 6GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.