Best local AI models for 32GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 32GB card gives you about 29.76 GiB to work with after driver overhead. 26 indexed models fit at 32K context — the largest being Nemotron-3-Embed-8B-BF16 at 8.0B parameters in BF16.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 32GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
jina-embeddings-v5-text-smallembeddingsF16596M5.39 GiB24.37 GiB
embeddinggemma-300m-qat-q8_0-unquantizedembeddingsQ8_0303M1.22 GiB28.54 GiB
KaLM-embedding-multilingual-mini-instruct-v2.5embeddingsQ8_0494M1.65 GiB28.11 GiB
nomic-embed-text-v1.5embeddingsF32137M2.40 GiB27.36 GiB
jina-embeddings-v5-text-nanoembeddingsF16212M2.30 GiB27.46 GiB
all-MiniLM-L6-v2embeddingsF3223M1.13 GiB28.63 GiB
mxbai-embed-xsmall-v1embeddingsF3224M1.13 GiB28.63 GiB
nomic-embed-text-v2-moeMoEembeddingsF32475M2.58 GiB27.18 GiB
bge-m3embeddingsQ8_0567M4.37 GiB25.39 GiB
snowflake-arctic-embed-l-v2.0embeddingsF32568M5.90 GiB23.86 GiB
jina-reranker-v1-tiny-enembeddingsF1633M1.01 GiB28.75 GiB
Qwen3.5-9B-DFlashembeddingsBF161.3B3.47 GiB26.29 GiB
Qwen3-Embedding-0.6BembeddingsF16596M5.39 GiB24.37 GiB
gte-smallembeddingsQ8_033M1.36 GiB28.40 GiB
Qwen3-Embedding-8BembeddingsF167.6B19.43 GiB10.33 GiB
nomic-embed-text-v1embeddingsF32137M2.40 GiB27.36 GiB
LFM2.5-Embedding-350MembeddingsF16354M1.82 GiB27.94 GiB
Qwen3-Embedding-4BembeddingsF164.0B12.81 GiB16.95 GiB
Nemotron-3-Embed-8B-BF16embeddingsBF168.0B19.91 GiB9.85 GiB
nomic-embed-codeembeddingsF327.1B28.95 GiB0.81 GiB
LCO-Embedding-Omni-3B-2605embeddingsQ8_04.7B5.30 GiB24.46 GiB
qwen-indic-v1embeddingsF167.6B19.43 GiB10.33 GiB
Octen-Embedding-4BembeddingsF164.0B12.81 GiB16.95 GiB
bge-reranker-v2-m3embeddingsQ8_0568M4.37 GiB25.39 GiB
LFM2.5-ColBERT-350MembeddingsF16353M1.82 GiB27.94 GiB
gte-largeembeddingsQ8_0335M4.11 GiB25.65 GiB
Spec sheetPredictedwhat these mean

This page models a generic 32GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.