NVIDIA · datacenter

Tesla V100 16GB

Tesla V100 16GB has 16 GB of VRAM at 900 GB/s — about 14.88 GiB usable after driver and compositor overhead. 1856 of 2118 indexed models fit at 8K context with q8_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
16 GB
HBM2
Bandwidth
900 GB/s
4096-bit bus
Tensor FP16
125 TF
dense
TDP
300 W
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1591vision language 162video 15embedding 26audio asr 39audio tts 21image 2

What fits at 8K context

largest quantization that fits, per model · 1856 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
MN-GRAND-23.5B-Gutenberg-UNCENSORED-V2-GLM4.7-ThinkingI1-Q4_023.4B12.49 GiB1.34 GiB14.88 GiB0.00 GiB37±22%
deepseek-coder-33b-instructIQ3_XS33.3B12.76 GiB1.03 GiB14.87 GiB0.01 GiB37±22%
granite-20b-code-instruct-8kQ5_K_M20.1B13.79 GiB0.00 GiB14.87 GiB0.01 GiB37±22%
granite-20b-code-base-8kI1-Q5_K_M20.1B13.79 GiB0.00 GiB14.87 GiB0.01 GiB37±22%
granite-34b-code-base-8kI1-IQ3_S33.7B13.79 GiB0.00 GiB14.87 GiB0.01 GiB37±22%
Qwen3.6-28BMoEI1-Q3_K_L28.2B13.77 GiB0.08 GiB14.86 GiB0.02 GiB186±37%
Qwen3.5-28BMoEI1-Q3_K_L28.7B13.77 GiB0.08 GiB14.86 GiB0.02 GiB186±37%
Skywork-R1V3-38BIQ3_M38.4B13.79 GiB0.00 GiB14.86 GiB0.02 GiB37±22%
c4ai-command-r-08-2024IQ3_XS32.3B13.08 GiB0.66 GiB14.86 GiB0.02 GiB37±22%
OLMo-2-1124-13B-InstructQ6_K13.7B10.48 GiB3.32 GiB14.85 GiB0.03 GiB37±22%
Skyfall-31B-v4.2-hereticI1-IQ3_S31.4B12.84 GiB0.90 GiB14.85 GiB0.03 GiB37±22%
Skyfall-31B-v4.2I1-IQ3_S31.4B12.84 GiB0.90 GiB14.85 GiB0.03 GiB37±22%
GLM-4.7-Flash-REAP-23B-A3BMoEQ4_123.0B13.62 GiB0.22 GiB14.85 GiB0.03 GiB130±37%
Hy-MT2-30B-A3BMoEQ3_K_M30.1B13.45 GiB0.40 GiB14.85 GiB0.03 GiB136±37%
v6-Finch-14B-HFQ5_K_M14.1B9.75 GiB4.05 GiB14.84 GiB0.04 GiB37±22%
GLM-4.7-FlashMoEQ3_K_M31.2B13.61 GiB0.22 GiB14.84 GiB0.04 GiB147±37%
GLM-4.7-Flash-hereticMoEIQ3_M29.9B13.60 GiB0.22 GiB14.83 GiB0.05 GiB147±37%
Seed-OSS-36B-Instruct-biprojected-norm-preserving-abliteratedI1-Q2_K36.2B12.67 GiB1.06 GiB14.83 GiB0.05 GiB37±22%
Seed-OSS-36B-InstructQ2_K36.2B12.67 GiB1.06 GiB14.83 GiB0.05 GiB37±22%
Hermes-4.3-36B-hereticI1-Q2_K36.2B12.67 GiB1.06 GiB14.83 GiB0.05 GiB37±22%
Hermes-4.3-36BQ2_K36.2B12.67 GiB1.06 GiB14.83 GiB0.05 GiB37±22%
magnum-v2-32bIQ3_XS32.5B12.67 GiB1.06 GiB14.83 GiB0.05 GiB37±22%
gemma-2-27b-itQ3_K27.2B12.50 GiB1.19 GiB14.83 GiB0.05 GiB37±22%
magnum-v4-27bQ3_K_M27.2B12.50 GiB1.19 GiB14.83 GiB0.05 GiB37±22%
WizardCoder-Python-34B-V1.0I1-IQ3_XS33.7B12.93 GiB0.80 GiB14.82 GiB0.06 GiB37±22%
Phind-CodeLlama-34B-Python-v1I1-IQ3_XS33.7B12.93 GiB0.80 GiB14.82 GiB0.06 GiB37±22%
Phind-CodeLlama-34B-v2I1-IQ3_XS33.7B12.93 GiB0.80 GiB14.82 GiB0.06 GiB37±22%
EXAONE-4.0-32BQ3_K_S32.0B13.00 GiB0.71 GiB14.81 GiB0.07 GiB37±22%
Gemma-3-27B-MeditronFOI1-Q3_K_M28.8B13.08 GiB0.66 GiB14.81 GiB0.07 GiB37±22%
Goetia-26B-A4B-v1.3-Absolute-Heretic-ARAMoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
Frank-26B-A4BMoEI1-Q4_026.5B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
G4-MeroMero-26B-A4B-it-uncensored-hereticMoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
EVE-26b-XENO-HATMoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
Gemma-4-26B-A4B-Animus-V14.1-FFT-hereticMoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
gemma-4-26B-A4B-it-qat-q4_0-unquantized-hereticMoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
Huihui-gemma-4-26B-A4B-it-qat-q4_0-unquantized-abliteratedMoEI1-Q4_026.5B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
G4-MeroMero-26B-A4BMoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
G4-Dark-Soul-26B-A4BMoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
gemma-4-26B-A4B-it-local-abliterated-sota-internal-t34MoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
gemma-4-26B-A4B-it-SOMPOA-heresyMoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
gemma-4-26B-A4B-it-hereticMoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
gemma-4-26B-A4B-it-abliterixMoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
gemma-4-26B-A4B-it-heretic-ara-v2MoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
Gemma-4-26B-A4B-it-heretic-antislopMoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
gemma-4-26B-A4B-it-Claude-Opus-Distill-v2MoEI1-Q4_026.5B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
gemma-4-26B-A4B-Heretic-StableMoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
gemma-4-26B-A4B-it-Uncensored-MAXMoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
gemma-4-26B-A4B-it-ultra-uncensored-hereticMoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
gemma-4-26B-A4B-it-ara-abliteratedMoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
Huihui-gemma-4-26B-A4B-it-abliteratedMoEI1-Q4_026.5B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
Gemma-4-26B-A4B-AbliteratedMoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
gemma4-26b-fiction-bf16MoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
gemma-4-26B-A4B-it-heretic-araMoEI1-Q4_025.8B13.49 GiB0.32 GiB14.80 GiB0.08 GiB37±22%
Qwen3-53B-A3B-2507-THINKING-TOTAL-RECALL-v2-MASTER-CODERMoEI1-IQ2_XXS53.0B13.10 GiB0.70 GiB14.79 GiB0.09 GiB113±37%
Llama3.2-30B-A3B-II-Dark-Champion-INSTRUCT-Heretic-Abliterated-UncensoredMoEI1-IQ3_M30.0B13.00 GiB0.78 GiB14.79 GiB0.09 GiB91±37%
Aurora-Code-1MoEI1-Q3_K_M34.7B13.70 GiB0.08 GiB14.79 GiB0.09 GiB199±37%
solar-pro-preview-instructKV unresolvedQ4_K_M22.1B12.40 GiB1.33 GiB14.78 GiB0.10 GiB37±22%
Qwen3-Coder-REAP-25B-A3BMoEQ4_024.9B13.39 GiB0.40 GiB14.78 GiB0.10 GiB126±37%
Goetia-26B-A4B-v1.4MoEIQ4_XS26.0B13.46 GiB0.32 GiB14.77 GiB0.11 GiB37±22%
G4-Moonlight-Dusk-26B-A4B-hereticMoEIQ4_XS26.5B13.46 GiB0.32 GiB14.77 GiB0.11 GiB37±22%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Tesla V100 16GB run?
1856 of 2118 indexed open-weight models fit a Tesla V100 16GB at 8,192 context with q8_0 KV cache, the largest being MN-GRAND-23.5B-Gutenberg-UNCENSORED-V2-GLM4.7-Thinking at I1-Q4_0. That covers text, vision-language, image, video and speech models.
How much usable memory does a Tesla V100 16GB actually have?
Its nameplate is 16 GB, but about 14.88 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Tesla V100 16GB fast for local AI?
Its memory bandwidth is 900 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.