NVIDIA · datacenter

Tesla P100 16GB

Tesla P100 16GB has 16 GB of VRAM at 732 GB/s — about 14.88 GiB usable after driver and compositor overhead. 1811 of 2118 indexed models fit at 64K context with q4_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
16 GB
HBM2
Bandwidth
732 GB/s
4096-bit bus
Tensor FP16
dense
TDP
250 W
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1549vision language 159image 2video 15audio asr 39embedding 26audio tts 21

What fits at 64K context

largest quantization that fits, per model · 1811 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
diffusiongemma-26B-A4B-it-HERETIC-UncensoredMoEIQ4_XS25.8B13.11 GiB0.79 GiB14.88 GiB0.00 GiB30±22%
OLMo-2-1124-7B-InstructQ5_K_M7.3B4.85 GiB9.00 GiB14.88 GiB0.00 GiB30±22%
Gemma-4-31B-Isometry-RPI1-Q2_K_S32.7B10.65 GiB3.14 GiB14.88 GiB0.00 GiB30±22%
Gemma-4-Dark-Gemistry-31BI1-Q2_K_S32.7B10.65 GiB3.14 GiB14.88 GiB0.00 GiB30±22%
Prosopon-31BI1-Q2_K_S32.7B10.65 GiB3.14 GiB14.88 GiB0.00 GiB30±22%
Gemma-4-Novelist-Eclipse-31BI1-Q2_K_S32.7B10.65 GiB3.14 GiB14.88 GiB0.00 GiB30±22%
Giftige-Blume-31B-v1-StyleSwapI1-Q2_K_S32.7B10.65 GiB3.14 GiB14.88 GiB0.00 GiB30±22%
G4-MeroMero-31B-StyleSwapI1-Q2_K_S32.7B10.65 GiB3.14 GiB14.88 GiB0.00 GiB30±22%
Gemma-4-31B-StyleTune-heretic-araI1-Q2_K_S32.7B10.65 GiB3.14 GiB14.88 GiB0.00 GiB30±22%
Pantheon-Reasoning-31B-1.1I1-Q2_K_S32.7B10.65 GiB3.14 GiB14.88 GiB0.00 GiB30±22%
Gemma-4-31B-StyleTuneI1-Q2_K_S32.7B10.65 GiB3.14 GiB14.88 GiB0.00 GiB30±22%
Barcenas-StyleTune-31B-FableI1-Q2_K_S32.1B10.65 GiB3.14 GiB14.88 GiB0.00 GiB30±22%
Phi-3.5-mini-instructBF163.8B7.12 GiB6.75 GiB14.87 GiB0.01 GiB30±22%
Phi-3.5-mini-instruct_UncensoredF163.8B7.12 GiB6.75 GiB14.87 GiB0.01 GiB30±22%
NuExtract-1.5F163.8B7.12 GiB6.75 GiB14.87 GiB0.01 GiB30±22%
Phi-3-mini-128k-instructBF163.8B7.12 GiB6.75 GiB14.87 GiB0.01 GiB30±22%
Phi-3-mini-4k-instructBF163.8B7.12 GiB6.75 GiB14.87 GiB0.01 GiB30±22%
octo-netF163.8B7.12 GiB6.75 GiB14.87 GiB0.01 GiB30±22%
CallerIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
Dumpling-Qwen2.5-32BIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
OREAL-32BIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
QwQ-32B-Preview-abliterated-linear25I1-IQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
openhands-lm-32b-v0.1I1-IQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
Qwen2.5-Coder-32B-abliteratedI1-IQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
m1-32bI1-IQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
XMainframe-v2-Instruct-32bI1-IQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
Qwen2.5-Coder-32B-Python-SpecialistI1-IQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
Qwen2.5-32b-RP-InkI1-IQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
LongWriter-Zero-32BIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
OpenCodeReasoning-Nemotron-32B-IOIIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
Qwen2.5-Coder-32B-Instruct-abliteratedIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
OlympicCoder-32BIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
OpenCodeReasoning-Nemotron-32BIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
OpenThinker-32BIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
QwQ-32B-ArliAI-RpR-v4IQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
Qwen2.5-Coder-32B-InstructIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
Qwen2.5-Coder-32BIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
QwQ-32B-abliteratedIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
DeepSeek-R1-Distill-Qwen-32B-hereticI1-IQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
InnoSpark-HPC-RM-32BI1-IQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
OpenThinker2-32BIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
INTELLECT-2IQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
Qwen2.5-32B-InstructIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
Qwen2.5-Coder-32B-Instruct-UncensoredI1-IQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
QwQ-32B-PreviewIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
TinyR1-32B-PreviewIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
deepseek-r1-qwen-2.5-32B-ablatedIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
Rombos-LLM-V2.5-Qwen-32bIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
DeepSeek-R1-Distill-Qwen-32B-abliteratedIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
Qwen2.5-32B-ArliAI-RPMax-v1.3IQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
DeepSeek-R1-Distill-Qwen-32BIQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
Qwen2.5-VL-32B-InstructIQ2_XS33.5B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
EVA-Qwen2.5-32B-v0.2IQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
EVA-Qwen2.5-32B-v0.1IQ2_XS32.8B9.27 GiB4.50 GiB14.87 GiB0.01 GiB30±22%
Snowpiercer-15B-v4Q5_K_L15.0B10.31 GiB3.52 GiB14.87 GiB0.01 GiB30±22%
Goetia-26B-A4B-v1.3-Absolute-Heretic-ARAMoEIQ4_XS25.8B13.10 GiB0.79 GiB14.87 GiB0.01 GiB30±22%
G4-MeroMero-26B-A4B-it-uncensored-hereticMoEIQ4_XS25.8B13.10 GiB0.79 GiB14.87 GiB0.01 GiB30±22%
EVE-26b-XENO-HATMoEIQ4_XS25.8B13.10 GiB0.79 GiB14.87 GiB0.01 GiB30±22%
Gemma-4-26B-A4B-Animus-V14.1-FFT-hereticMoEIQ4_XS25.8B13.10 GiB0.79 GiB14.87 GiB0.01 GiB30±22%
G4-MeroMero-26B-A4BMoEIQ4_XS25.8B13.10 GiB0.79 GiB14.87 GiB0.01 GiB30±22%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Tesla P100 16GB run?
1811 of 2118 indexed open-weight models fit a Tesla P100 16GB at 65,536 context with q4_0 KV cache, the largest being diffusiongemma-26B-A4B-it-HERETIC-Uncensored at IQ4_XS. That covers text, vision-language, image, video and speech models.
How much usable memory does a Tesla P100 16GB actually have?
Its nameplate is 16 GB, but about 14.88 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Tesla P100 16GB fast for local AI?
Its memory bandwidth is 732 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.