NVIDIA · consumer

GeForce RTX 3080 Ti

GeForce RTX 3080 Ti has 20 GB of VRAM at 760 GB/s — about 18.60 GiB usable after driver and compositor overhead. 1868 of 2118 indexed models fit at 64K context with q4_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
20 GB
GDDR6X
Bandwidth
760 GB/s
320-bit bus
Tensor FP16
136 TF
dense
TDP
350 W
$1199 MSRP
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1593vision language 171video 16embedding 26audio tts 21audio asr 39image 2

What fits at 64K context

largest quantization that fits, per model · 1868 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
Carnice-Qwen3.6-MoE-35B-A3BMoEI1-IQ4_XS36.0B17.44 GiB0.35 GiB18.60 GiB0.00 GiB148±37%
Qwen35B-Agent-R2-AbliteratedMoEI1-IQ4_XS34.7B17.44 GiB0.35 GiB18.60 GiB0.00 GiB148±37%
Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-DistilledMoEI1-IQ4_XS36.0B17.44 GiB0.35 GiB18.60 GiB0.00 GiB148±37%
Darwin-35B-A3B-OpusMoEI1-IQ4_XS36.0B17.44 GiB0.35 GiB18.60 GiB0.00 GiB148±37%
Qwen35B-Agent-R2MoEI1-IQ4_XS34.7B17.44 GiB0.35 GiB18.60 GiB0.00 GiB148±37%
Carnice-MoE-35B-A3BMoEI1-IQ4_XS36.0B17.44 GiB0.35 GiB18.60 GiB0.00 GiB148±37%
spoomplesmaxx-flash-35B-A3MoEI1-IQ4_XS35.1B17.44 GiB0.35 GiB18.60 GiB0.00 GiB148±37%
Huihui-Qwen3.6-35B-A3B-Claude-4.7-Opus-abliteratedMoEI1-IQ4_XS36.0B17.44 GiB0.35 GiB18.60 GiB0.00 GiB148±37%
Qwen3.6-35B-A3B-Uncensored-AggressiveMoEI1-IQ4_XS35.1B17.44 GiB0.35 GiB18.60 GiB0.00 GiB148±37%
WorldSim-Opus-3.6-35B-A3BMoEI1-IQ4_XS35.1B17.44 GiB0.35 GiB18.60 GiB0.00 GiB148±37%
Qwen3.6-35B-A3B-abliterated-MAXMoEI1-IQ4_XS35.1B17.44 GiB0.35 GiB18.60 GiB0.00 GiB148±37%
Huihui-Qwen3.6-35B-A3B-abliteratedMoEI1-IQ4_XS36.0B17.44 GiB0.35 GiB18.60 GiB0.00 GiB148±37%
Qwopus3.6-35B-A3B-v1MoEI1-IQ4_XS36.0B17.44 GiB0.35 GiB18.60 GiB0.00 GiB148±37%
Qwen3.6-35B-A3B-StyleTuneMoEI1-IQ4_XS35.1B17.44 GiB0.35 GiB18.60 GiB0.00 GiB148±37%
Qwen3.6-35B-A3B-abliteratedMoEI1-IQ4_XS35.1B17.44 GiB0.35 GiB18.60 GiB0.00 GiB148±37%
Qwen3.6-35B-A3B-abliterated-v4MoEIQ4_XS34.7B17.44 GiB0.35 GiB18.60 GiB0.00 GiB148±37%
0GM-1.0-35B-A3B-0427MoEI1-IQ4_XS36.0B17.44 GiB0.35 GiB18.60 GiB0.00 GiB148±37%
Qwen3.6-27B-A3B-CoderMoEI1-Q5_K_M26.7B17.44 GiB0.35 GiB18.60 GiB0.00 GiB126±37%
NVIDIA-Nemotron-3-Nano-30B-A3B-BF16MoEUD-IQ3_XXS31.6B16.90 GiB0.91 GiB18.59 GiB0.01 GiB109±37%
Qwen3-Coder-NextMoEIQ1_M79.7B16.11 GiB1.69 GiB18.59 GiB0.01 GiB100±37%
Qwen3-Next-80B-A3B-ThinkingMoEIQ1_M81.3B16.11 GiB1.69 GiB18.59 GiB0.01 GiB100±37%
Qwen3-Next-80B-A3B-InstructMoEIQ1_M81.3B16.11 GiB1.69 GiB18.59 GiB0.01 GiB100±37%
GRM-2.6-Plus-0628Q4_127.8B16.60 GiB1.13 GiB18.59 GiB0.01 GiB31±12.9%
ThinkingCap-Qwen3.6-27BQ4_127.4B16.60 GiB1.13 GiB18.59 GiB0.01 GiB31±12.9%
Tess-4-27BQ4_127.8B16.60 GiB1.13 GiB18.59 GiB0.01 GiB31±12.9%
L3-Dark-Planet-8BIQ4_XS8.0B15.50 GiB2.25 GiB18.59 GiB0.01 GiB31±12.9%
t5-v1_1-xxlF324.8B17.74 GiB0.00 GiB18.59 GiB0.01 GiB31±12.9%
rnj-1-instructBF168.3B15.49 GiB2.25 GiB18.59 GiB0.01 GiB31±12.9%
granite-4.0-h-smallMoEQ4_032.2B17.51 GiB0.28 GiB18.58 GiB0.02 GiB83±37%
Huihui-GLM-4.7-Flash-abliterated-57BMoEI1-IQ2_XS57.3B15.38 GiB2.35 GiB18.57 GiB0.03 GiB72±37%
Nemotron-Cascade-2-30B-A3B-heretic-ara-uncensoredMoEI1-IQ3_M31.6B16.86 GiB0.91 GiB18.56 GiB0.04 GiB110±37%
Nemotron-Cascade-2-30B-A3BMoEI1-IQ3_M31.6B16.86 GiB0.91 GiB18.56 GiB0.04 GiB110±37%
Seed-OSS-36B-Instruct-biprojected-norm-preserving-abliteratedI1-IQ3_XXS36.2B13.15 GiB4.50 GiB18.55 GiB0.05 GiB31±12.9%
Seed-OSS-36B-InstructIQ3_XXS36.2B13.15 GiB4.50 GiB18.55 GiB0.05 GiB31±12.9%
Hermes-4.3-36B-hereticI1-IQ3_XXS36.2B13.15 GiB4.50 GiB18.55 GiB0.05 GiB31±12.9%
Hermes-4.3-36BIQ3_XXS36.2B13.15 GiB4.50 GiB18.55 GiB0.05 GiB31±12.9%
Crow-9B-HERETIC-4.6BF169.4B17.14 GiB0.56 GiB18.54 GiB0.06 GiB31±12.9%
Qwen3.5-9B-CoderF169.7B17.14 GiB0.56 GiB18.54 GiB0.06 GiB31±12.9%
Qwythos-9B-Claude-Mythos-5-1M-MTPF169.7B17.14 GiB0.56 GiB18.54 GiB0.06 GiB31±12.9%
Qwen3.5-9B-Fable-5-v1F169.7B17.14 GiB0.56 GiB18.54 GiB0.06 GiB31±12.9%
Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliteratedF169.7B17.14 GiB0.56 GiB18.54 GiB0.06 GiB31±12.9%
PINQWEN-3.5-9B-1M-BF16F169.7B17.14 GiB0.56 GiB18.54 GiB0.06 GiB31±12.9%
Openprose-2-FlashF169.7B17.14 GiB0.56 GiB18.54 GiB0.06 GiB31±12.9%
Qwen3.5-9B-Nikusui-v1F169.7B17.14 GiB0.56 GiB18.54 GiB0.06 GiB31±12.9%
Ornith-1.0-9B-heretic-MTPF169.4B17.14 GiB0.56 GiB18.54 GiB0.06 GiB31±12.9%
Qwen3.5-9BBF169.7B17.14 GiB0.56 GiB18.54 GiB0.06 GiB31±12.9%
Tess-4-9BBF169.7B17.14 GiB0.56 GiB18.54 GiB0.06 GiB31±12.9%
dotwebs-1F169.7B17.14 GiB0.56 GiB18.54 GiB0.06 GiB31±12.9%
liftBF169.7B17.14 GiB0.56 GiB18.54 GiB0.06 GiB31±12.9%
Ornith-1.0-9BBF169.2B17.14 GiB0.56 GiB18.54 GiB0.06 GiB31±12.9%
MN-GRAND-23.5B-Gutenberg-UNCENSORED-V2-GLM4.7-ThinkingIQ4_XS23.4B11.99 GiB5.70 GiB18.54 GiB0.06 GiB31±12.9%
Qwen3-Coder-REAP-25B-A3BMoEQ5_024.9B16.05 GiB1.69 GiB18.53 GiB0.07 GiB78±37%
Orca-2-13b-Alpaca-UncensoredI1-IQ2_XS13.0B3.62 GiB14.06 GiB18.53 GiB0.07 GiB31±12.9%
WizardLM-13B-UncensoredI1-IQ2_XS13.0B3.62 GiB14.06 GiB18.53 GiB0.07 GiB31±12.9%
WizardCoder-Python-13B-V1.0I1-IQ2_XS13.0B3.62 GiB14.06 GiB18.53 GiB0.07 GiB31±12.9%
Guanaco-13B-UncensoredI1-IQ2_XS13.0B3.62 GiB14.06 GiB18.53 GiB0.07 GiB31±12.9%
Qwen3.6-35B-A3B-uncensored-heretic-Native-MTP-PreservedMoEQ3_K_L35.1B17.37 GiB0.35 GiB18.53 GiB0.07 GiB149±37%
Qwen3.5-35B-A3B-uncensored-heretic-v2-Native-MTP-PreservedMoEQ3_K_L35.1B17.37 GiB0.35 GiB18.53 GiB0.07 GiB149±37%
Huihui-Qwen3.5-35B-A3B-abliteratedMoEI1-IQ4_XS36.0B17.37 GiB0.35 GiB18.53 GiB0.07 GiB149±37%
Qwen3.5-35B-A3B-BaseMoEI1-IQ4_XS36.0B17.37 GiB0.35 GiB18.53 GiB0.07 GiB149±37%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a GeForce RTX 3080 Ti run?
1868 of 2118 indexed open-weight models fit a GeForce RTX 3080 Ti at 65,536 context with q4_0 KV cache, the largest being Carnice-Qwen3.6-MoE-35B-A3B at I1-IQ4_XS. That covers text, vision-language, image, video and speech models.
How much usable memory does a GeForce RTX 3080 Ti actually have?
Its nameplate is 20 GB, but about 18.60 GiB is available to a model once driver and compositor overhead is accounted for.
Is a GeForce RTX 3080 Ti fast for local AI?
Its memory bandwidth is 760 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.