Best local AI models for 48GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 48GB card gives you about 44.64 GiB to work with after driver overhead. 26 indexed models fit at 32K context — the largest being Nemotron-3-Embed-8B-BF16 at 8.0B parameters in BF16.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 48GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
jina-embeddings-v5-text-smallembeddingsF16596M5.39 GiB39.25 GiB
embeddinggemma-300m-qat-q8_0-unquantizedembeddingsQ8_0303M1.22 GiB43.42 GiB
KaLM-embedding-multilingual-mini-instruct-v2.5embeddingsQ8_0494M1.65 GiB42.99 GiB
nomic-embed-text-v1.5embeddingsF32137M2.40 GiB42.24 GiB
jina-embeddings-v5-text-nanoembeddingsF16212M2.30 GiB42.34 GiB
all-MiniLM-L6-v2embeddingsF3223M1.13 GiB43.51 GiB
mxbai-embed-xsmall-v1embeddingsF3224M1.13 GiB43.51 GiB
nomic-embed-text-v2-moeMoEembeddingsF32475M2.58 GiB42.06 GiB
bge-m3embeddingsQ8_0567M4.37 GiB40.27 GiB
snowflake-arctic-embed-l-v2.0embeddingsF32568M5.90 GiB38.74 GiB
jina-reranker-v1-tiny-enembeddingsF1633M1.01 GiB43.63 GiB
Qwen3.5-9B-DFlashembeddingsBF161.3B3.47 GiB41.17 GiB
Qwen3-Embedding-0.6BembeddingsF16596M5.39 GiB39.25 GiB
gte-smallembeddingsQ8_033M1.36 GiB43.28 GiB
Qwen3-Embedding-8BembeddingsF167.6B19.43 GiB25.21 GiB
nomic-embed-text-v1embeddingsF32137M2.40 GiB42.24 GiB
LFM2.5-Embedding-350MembeddingsF16354M1.82 GiB42.82 GiB
Qwen3-Embedding-4BembeddingsF164.0B12.81 GiB31.83 GiB
Nemotron-3-Embed-8B-BF16embeddingsBF168.0B19.91 GiB24.73 GiB
nomic-embed-codeembeddingsF327.1B28.95 GiB15.69 GiB
LCO-Embedding-Omni-3B-2605embeddingsQ8_04.7B5.30 GiB39.34 GiB
qwen-indic-v1embeddingsF167.6B19.43 GiB25.21 GiB
Octen-Embedding-4BembeddingsF164.0B12.81 GiB31.83 GiB
bge-reranker-v2-m3embeddingsQ8_0568M4.37 GiB40.27 GiB
LFM2.5-ColBERT-350MembeddingsF16353M1.82 GiB42.82 GiB
gte-largeembeddingsQ8_0335M4.11 GiB40.53 GiB
Spec sheetPredictedwhat these mean

This page models a generic 48GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.