Best local AI models for 64GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 64GB card gives you about 59.52 GiB to work with after driver overhead. 39 indexed models fit at 32K context — the largest being Voxtral-Small-24B-2507 at 24.3B parameters in F16.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 64GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
nemotron-3.5-asr-streaming-0.6bspeech recognitionF32638M3.22 GiB56.30 GiB
parakeet-tdt-0.6b-v3speech recognitionF32627M3.18 GiB56.34 GiB
whisper-mediumspeech recognitionF32764M3.69 GiB55.83 GiB
Voxtral-Mini-4B-Realtime-2602speech recognitionF164.4B12.33 GiB47.19 GiB
whisper-large-v3speech recognitionF161.5B3.74 GiB55.78 GiB
whisper-large-v3-turbospeech recognitionF16809M2.36 GiB57.16 GiB
Qwen3-ASR-1.7Bspeech recognitionF162.3B5.23 GiB54.29 GiB
Voxtral-Small-24B-2507speech recognitionF1624.3B51.13 GiB8.39 GiB
Qwen3-ASR-0.6Bspeech recognitionF16938M2.32 GiB57.20 GiB
GigaAM-v3speech recognitionF32223M1.67 GiB57.85 GiB
parakeet-ctc-0.6bspeech recognitionF16609M16.97 GiB42.55 GiB
granite-speech-4.1-2b-narspeech recognitionF162.3B8.65 GiB50.87 GiB
whisper-smallspeech recognitionF32242M1.75 GiB57.77 GiB
granite-speech-4.1-2bspeech recognitionF162.3B8.48 GiB51.04 GiB
whisper-largespeech recognitionF321.5B6.60 GiB52.92 GiB
Voxtral-Mini-3B-2507speech recognitionF164.7B13.29 GiB46.23 GiB
canary-1b-flashspeech recognitionF32811M4.16 GiB55.36 GiB
whisper-large-v2speech recognitionF321.5B6.60 GiB52.92 GiB
canary-qwen-2.5bspeech recognitionF162.6B6.15 GiB53.37 GiB
granite-speech-4.1-2b-plusspeech recognitionF162.1B8.50 GiB51.02 GiB
Breeze-ASR-25speech recognitionF161.5B3.74 GiB55.78 GiB
nemotron-speech-streaming-en-0.6bspeech recognitionF32618M3.15 GiB56.37 GiB
granite-4.0-1b-speechspeech recognitionF162.3B7.60 GiB51.92 GiB
parakeet-ctc-1.1bspeech recognitionF321.1B4.80 GiB54.72 GiB
parakeet-rnnt-1.1bspeech recognitionF321.1B4.83 GiB54.69 GiB
whisper-basespeech recognitionF3273M1.12 GiB58.40 GiB
moonshine-streaming-mediumspeech recognitionF32266M2.85 GiB56.67 GiB
whisper-medium.enspeech recognitionF32764M3.69 GiB55.83 GiB
parakeet-rnnt-0.6bspeech recognitionF32617M3.14 GiB56.38 GiB
whisper-small.enspeech recognitionF32242M1.75 GiB57.77 GiB
moonshine-streaming-smallspeech recognitionF32140M1.91 GiB57.61 GiB
whisper-tinyspeech recognitionF3238M0.99 GiB58.53 GiB
MOSS-Transcribe-Diarizespeech recognitionF32909M7.66 GiB51.86 GiB
GLM-ASR-Nano-2512speech recognitionBF162.3B5.51 GiB54.01 GiB
ARK-ASR-3Bspeech recognitionF164.1B8.93 GiB50.59 GiB
whisper-base.enspeech recognitionF3273M1.12 GiB58.40 GiB
moonshine-streaming-tinyspeech recognitionF3244M1.16 GiB58.36 GiB
moonshine-basespeech recognitionF3262M0.99 GiB58.53 GiB
Qwen3-ForcedAligner-0.6Bspeech recognitionF16918M2.56 GiB56.96 GiB
Spec sheetPredictedwhat these mean

This page models a generic 64GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.