NVIDIA · datacenter

Tesla P100 16GB

Tesla P100 16GB has 16 GB of VRAM at 732 GB/s — about 14.88 GiB usable after driver and compositor overhead. 1846 of 2118 indexed models fit at 32K context with q4_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
16 GB
HBM2
Bandwidth
732 GB/s
4096-bit bus
Tensor FP16
dense
TDP
250 W
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1581vision language 162embedding 26video 15audio asr 39image 2audio tts 21

What fits at 32K context

largest quantization that fits, per model · 1846 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
GPT-NeoX-20B-ErebusI1-IQ1_M20.6B4.51 GiB9.28 GiB14.88 GiB0.00 GiB30±22%
gemma-4-26B-A4B-it-qat-q4_0-unquantizedMoEQ4_026.5B13.45 GiB0.43 GiB14.87 GiB0.01 GiB30±22%
diffusiongemma-26B-A4B-itMoENVFP425.8B13.45 GiB0.43 GiB14.87 GiB0.01 GiB30±22%
gemma-4-26B-A4BMoEQ4_026.5B13.45 GiB0.43 GiB14.87 GiB0.01 GiB30±22%
gemma-4-26B-A4B-Heretic-StableMoEQ4_025.8B13.45 GiB0.43 GiB14.87 GiB0.01 GiB30±22%
granite-20b-code-instruct-8kQ5_K_M20.1B13.79 GiB0.00 GiB14.87 GiB0.01 GiB30±22%
granite-20b-code-base-8kI1-Q5_K_M20.1B13.79 GiB0.00 GiB14.87 GiB0.01 GiB30±22%
granite-34b-code-base-8kI1-IQ3_S33.7B13.79 GiB0.00 GiB14.87 GiB0.01 GiB30±22%
GLM-4.7-Flash-DerestrictedMoEI1-Q3_K_M31.2B13.39 GiB0.46 GiB14.87 GiB0.01 GiB110±37%
Huihui-GLM-4.7-Flash-abliteratedMoEI1-Q3_K_M31.2B13.39 GiB0.46 GiB14.87 GiB0.01 GiB110±37%
GLM-4.7-Flash-Claude-Opus-4.5-High-Reasoning-DistillMoEQ3_K_M31.2B13.39 GiB0.46 GiB14.87 GiB0.01 GiB110±37%
Qwen3-14B-GPT-5.2-High-Reasoning-DistillQ3_K_S14.8B12.40 GiB1.41 GiB14.87 GiB0.01 GiB30±22%
Skywork-R1V3-38BIQ3_M38.4B13.79 GiB0.00 GiB14.86 GiB0.02 GiB30±22%
OpenAI-gpt-oss-20B-Claude-4.5-Opus-Heretic-UncensoredMoEI1-Q4_K_S20.9B13.65 GiB0.22 GiB14.85 GiB0.03 GiB87±37%
gpt-oss-20b-uncensoredMoEI1-Q4_K_S20.9B13.65 GiB0.22 GiB14.85 GiB0.03 GiB87±37%
gpt-oss-safeguard-20bMoEI1-Q4_K_S21.5B13.65 GiB0.22 GiB14.85 GiB0.03 GiB87±37%
Huihui-gpt-oss-20b-BF16-abliterated-v2MoEI1-Q4_K_S20.9B13.65 GiB0.22 GiB14.85 GiB0.03 GiB87±37%
metatune-gpt20b-R1.09MoEI1-Q4_K_S21.5B13.65 GiB0.22 GiB14.85 GiB0.03 GiB87±37%
gpt-oss-20b-DerestrictedMoEQ4_K_S20.9B13.65 GiB0.22 GiB14.85 GiB0.03 GiB87±37%
NSFW_13B_sftQ3_K_L13.3B6.77 GiB7.03 GiB14.84 GiB0.04 GiB30±22%
OpenBuddy-R1-0528-Distill-Qwen3-32B-Preview0-QATQ2_K32.8B11.50 GiB2.25 GiB14.84 GiB0.04 GiB30±22%
Qwen3-VL-32B-Instruct-ultra-uncensored-hereticI1-Q2_K33.4B11.50 GiB2.25 GiB14.84 GiB0.04 GiB30±22%
Huihui-Qwen3-VL-32B-Instruct-abliteratedI1-Q2_K33.4B11.50 GiB2.25 GiB14.84 GiB0.04 GiB30±22%
KAT-DevQ2_K32.8B11.50 GiB2.25 GiB14.84 GiB0.04 GiB30±22%
ColorGUI-32BI1-Q2_K33.4B11.50 GiB2.25 GiB14.84 GiB0.04 GiB30±22%
Qwen3-VL-32B-InstructQ2_K33.4B11.50 GiB2.25 GiB14.84 GiB0.04 GiB30±22%
Qwen3-VL-32B-ThinkingQ2_K33.4B11.50 GiB2.25 GiB14.84 GiB0.04 GiB30±22%
Qwen3-32B-UncensoredI1-Q2_K32.8B11.50 GiB2.25 GiB14.84 GiB0.04 GiB30±22%
Qwen3-32BQ2_K32.8B11.50 GiB2.25 GiB14.84 GiB0.04 GiB30±22%
Qwen3-32B-abliteratedI1-Q2_K32.8B11.50 GiB2.25 GiB14.84 GiB0.04 GiB30±22%
DeepSWE-PreviewQ2_K32.8B11.50 GiB2.25 GiB14.84 GiB0.04 GiB30±22%
AReaL-boba-2-32BI1-Q2_K32.8B11.50 GiB2.25 GiB14.84 GiB0.04 GiB30±22%
Assistant_Pepe_32BI1-Q2_K32.8B11.50 GiB2.25 GiB14.84 GiB0.04 GiB30±22%
Qwen3.6-14B-A3B-FableVibesMoEQ8_013.8B13.65 GiB0.18 GiB14.83 GiB0.05 GiB106±37%
Qwen3.6-14B-A3B-VibeForged-v2MoEQ8_013.8B13.65 GiB0.18 GiB14.83 GiB0.05 GiB106±37%
v6-Finch-14B-HFQ2_K14.1B5.20 GiB8.58 GiB14.83 GiB0.05 GiB30±22%
Qwen3-VL-8B-Instruct-HereticI1-Q6_K8.8B12.53 GiB1.27 GiB14.83 GiB0.05 GiB30±22%
MiniCPM-V-4_5Q6_K8.7B12.53 GiB1.27 GiB14.82 GiB0.06 GiB30±22%
Trinity-2-Codestral-22B-v0.2Q4_K_S22.2B11.79 GiB1.97 GiB14.82 GiB0.06 GiB30±22%
Cydonia-v1.3-Magnum-v4-22BI1-Q4_K_S22.2B11.79 GiB1.97 GiB14.82 GiB0.06 GiB30±22%
Mistral-Small-22B-ArliAI-RPMax-v1.1I1-Q4_K_S22.2B11.79 GiB1.97 GiB14.82 GiB0.06 GiB30±22%
Mistral-Small-Drummer-22BQ4_K_S22.2B11.79 GiB1.97 GiB14.82 GiB0.06 GiB30±22%
magnum-v4-22bI1-Q4_K_S22.2B11.79 GiB1.97 GiB14.82 GiB0.06 GiB30±22%
Codestral-22B-v0.1Q4_K_S22.2B11.79 GiB1.97 GiB14.82 GiB0.06 GiB30±22%
Codestral-22B-v0.1-hfQ4_K_S22.2B11.79 GiB1.97 GiB14.82 GiB0.06 GiB30±22%
CallerQ2_K32.8B11.47 GiB2.25 GiB14.82 GiB0.06 GiB30±22%
Dumpling-Qwen2.5-32BQ2_K32.8B11.47 GiB2.25 GiB14.82 GiB0.06 GiB30±22%
OREAL-32BQ2_K32.8B11.47 GiB2.25 GiB14.82 GiB0.06 GiB30±22%
Baichuan-M2-32B-abliteratedQ2_K32.8B11.47 GiB2.25 GiB14.82 GiB0.06 GiB30±22%
QwQ-32B-Preview-abliterated-linear25I1-Q2_K32.8B11.47 GiB2.25 GiB14.82 GiB0.06 GiB30±22%
openhands-lm-32b-v0.1I1-Q2_K32.8B11.47 GiB2.25 GiB14.82 GiB0.06 GiB30±22%
Qwen2.5-Coder-32B-abliteratedI1-Q2_K32.8B11.47 GiB2.25 GiB14.82 GiB0.06 GiB30±22%
INTELLECT-2Q2_K32.8B11.47 GiB2.25 GiB14.82 GiB0.06 GiB30±22%
LongWriter-Zero-32BQ2_K32.8B11.47 GiB2.25 GiB14.82 GiB0.06 GiB30±22%
m1-32bI1-Q2_K32.8B11.47 GiB2.25 GiB14.82 GiB0.06 GiB30±22%
XMainframe-v2-Instruct-32bI1-Q2_K32.8B11.47 GiB2.25 GiB14.82 GiB0.06 GiB30±22%
Qwen2.5-Coder-32B-Python-SpecialistI1-Q2_K32.8B11.47 GiB2.25 GiB14.82 GiB0.06 GiB30±22%
Qwen2.5-32b-RP-InkI1-Q2_K32.8B11.47 GiB2.25 GiB14.82 GiB0.06 GiB30±22%
OpenCodeReasoning-Nemotron-32B-IOIQ2_K32.8B11.47 GiB2.25 GiB14.82 GiB0.06 GiB30±22%
Qwen2.5-Coder-32B-Instruct-abliteratedQ2_K32.8B11.47 GiB2.25 GiB14.82 GiB0.06 GiB30±22%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Tesla P100 16GB run?
1846 of 2118 indexed open-weight models fit a Tesla P100 16GB at 32,768 context with q4_0 KV cache, the largest being GPT-NeoX-20B-Erebus at I1-IQ1_M. That covers text, vision-language, image, video and speech models.
How much usable memory does a Tesla P100 16GB actually have?
Its nameplate is 16 GB, but about 14.88 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Tesla P100 16GB fast for local AI?
Its memory bandwidth is 732 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.