NVIDIA · workstation
RTX PRO 5000 Blackwell
RTX PRO 5000 Blackwell has 72 GB of VRAM at 1344 GB/s — about 66.96 GiB usable after driver and compositor overhead. 2046 of 2118 indexed models fit at 128K context with q8_0 KV.
Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
72 GB
GDDR7
Bandwidth
1344 GB/s
384-bit bus
Tensor FP16
295 TF
dense
TDP
300 W
$4569 MSRP
text 1757vision language 185image 2audio asr 39audio tts 21video 16embedding 26
What fits at 128K context
largest quantization that fits, per model · 2046 of 2118 indexed
| Model | Best quant | Params | Weights● | KV● | Total in memory◐ | Headroom◐ | tok/s◐ |
|---|---|---|---|---|---|---|---|
| NVIDIA-Nemotron-3-Super-120B-A12B-BF16MoE | IQ3_XS | 124B | 60.11 GiB | 5.84 GiB | 66.95 GiB | 0.01 GiB | 36±37% |
| Qwen3.6-35B-A3B-uncensored-hereticMoE | BF16 | 35.1B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| Darwin-35B-A3B-OpusMoE | BF16 | 36.0B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| Carnice-MoE-35B-A3BMoE | F16 | 36.0B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| Qwen3.6-35B-A3B-hereticMoE | BF16 | 35.1B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| Aurora-Code-1MoE | BF16 | 34.7B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| grug-35b-v2MoE | BF16 | 35.1B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| grug-35bMoE | BF16 | 35.1B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| WorldSim-Opus-3.6-35B-A3BMoE | BF16 | 35.1B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| Qwen3.6-35B-A3B-abliterated-MAXMoE | BF16 | 35.1B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| Huihui-Nex-N2-mini-abliteratedMoE | BF16 | 35.1B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| Qwen3.6-35B-A3B-AnkoMoE | BF16 | 35.1B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| KAT-Coder-V2.5-DevMoE | BF16 | 34.7B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| Ornith-1.0-35B-uncensored-hereticMoE | BF16 | 35.1B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| Qwen3.6-35B-A3B-abliterated-v4MoE | BF16 | 34.7B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| Qwen3.5-35B-A3B-ultra-uncensored-hereticMoE | BF16 | 35.1B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| Nex-N2-mini-ultra-uncensored-hereticMoE | BF16 | 35.1B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| Agents-A1MoE | F16 | 35.1B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| Qwen3.6-35B-A3B-java-v1MoE | BF16 | 34.7B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| Nex-N2-miniMoE | BF16 | 35.1B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| Qwen3.5-35B-A3B-BaseMoE | BF16 | 36.0B | 64.61 GiB | 1.33 GiB | 66.94 GiB | 0.02 GiB | 60±37% |
| GLM-4.5VMoE | I1-Q3_K_L | 108B | 53.68 GiB | 12.22 GiB | 66.93 GiB | 0.03 GiB | 23±37% |
| Laguna-S-2.1MoE | Q4_0 | 118B | 62.44 GiB | 3.26 GiB | 66.72 GiB | 0.24 GiB | 46±37% |
| Qwen3-14B-GPT-5.2-High-Reasoning-Distill | BF16 | 14.8B | 55.03 GiB | 10.63 GiB | 66.71 GiB | 0.25 GiB | 12±22% |
| Behemoth-X-123B-v2 | Q2_K | 123B | 42.09 GiB | 23.38 GiB | 66.62 GiB | 0.34 GiB | 12±22% |
| Mistral-Large-Instruct-2411 | Q2_K | 123B | 42.09 GiB | 23.38 GiB | 66.62 GiB | 0.34 GiB | 12±22% |
| CodeLlama-70b-Instruct-hf | I1-Q5_K_S | 69.0B | 44.20 GiB | 21.25 GiB | 66.57 GiB | 0.39 GiB | 12±22% |
| CodeLlama-70b-Python-hf | I1-Q5_K_S | 69.0B | 44.20 GiB | 21.25 GiB | 66.57 GiB | 0.39 GiB | 12±22% |
| Nous-Hermes-Llama2-70b | I1-Q5_K_S | 69.0B | 44.20 GiB | 21.25 GiB | 66.57 GiB | 0.39 GiB | 12±22% |
| Midnight-Miqu-70B-v1.5 | I1-Q5_K_S | 69.0B | 44.20 GiB | 21.25 GiB | 66.57 GiB | 0.39 GiB | 12±22% |
| KafkaLM-70B-German-V0.1 | Q5_0 | 69.0B | 44.20 GiB | 21.25 GiB | 66.57 GiB | 0.39 GiB | 12±22% |
| llama2_70b_chat_uncensored | Q5_0 | 69.0B | 44.20 GiB | 21.25 GiB | 66.57 GiB | 0.39 GiB | 12±22% |
| Xwin-LM-70b-V0.1 | Q5_0 | 69.0B | 44.20 GiB | 21.25 GiB | 66.57 GiB | 0.39 GiB | 12±22% |
| Llama-2-70b-chat-hf | Q5_0 | 69.0B | 44.20 GiB | 21.25 GiB | 66.57 GiB | 0.39 GiB | 12±22% |
| Rombo-LLM-V3.0-Qwen-72b | I1-Q4_K_M | 72.7B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| Qwen2.5-72B-Instruct-abliterated | I1-Q4_K_M | 72.7B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| Qwen2.5-72B-Instruct-abliterated-v2 | I1-Q4_K_M | 72.7B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| HuatuoGPT-o1-72B | Q4_K_M | 72.7B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| MiroThinker-v1.0-72B | I1-Q4_K_M | 72.7B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| EVA-Qwen2.5-72B-v0.2 | Q4_K_M | 72.7B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| Qwen2.5-Math-72B-Instruct | Q4_K_M | 72.7B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| Qwen2.5-72B-Instruct | Q4_K_M | 72.7B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| Malaysian-Qwen2.5-72B-Instruct | I1-Q4_K_M | 72.7B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| Qwen2.5-72B | I1-Q4_K_M | 72.7B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| magnum-v4-72b | I1-Q4_K_M | 72.7B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| KAT-Dev-72B-Exp | Q4_K_M | 72.7B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| Homer-v1.0-Qwen2.5-72B | Q4_K_M | 72.7B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| Chuluun-Qwen2.5-72B-v0.01 | Q4_K_M | 72.7B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| Qwen2.5-VL-72B-Instruct | Q4_K_M | 73.4B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| Tower-Plus-72B-ultra-uncensored-heretic | I1-Q4_K_M | 72.7B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| Chronos-Platinum-72B | Q4_K_M | 72.7B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| UI-TARS-72B-DPO | Q4_K_M | 73.4B | 44.16 GiB | 21.25 GiB | 66.54 GiB | 0.42 GiB | 12±22% |
| GLM-4.5-AirMoE | Q3_K_M | 110B | 53.28 GiB | 12.22 GiB | 66.52 GiB | 0.44 GiB | 24±37% |
| Qwen3-72B-Synthesis | Q4_K_M | 72.7B | 44.12 GiB | 21.25 GiB | 66.50 GiB | 0.46 GiB | 12±22% |
| Qwen3.5-122B-A10BMoE | IQ4_XS | 125B | 63.77 GiB | 1.59 GiB | 66.39 GiB | 0.57 GiB | 59±37% |
| Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-MTP | IQ4_XS | 27.8B | 61.06 GiB | 4.25 GiB | 66.37 GiB | 0.59 GiB | 12±22% |
| GLM-4.5-Air-REAP-82B-A12BMoE | Q4_K_L | 81.9B | 53.11 GiB | 12.22 GiB | 66.36 GiB | 0.60 GiB | 22±37% |
| Phi-3-medium-128k-instruct | F32 | 14.0B | 52.01 GiB | 13.28 GiB | 66.35 GiB | 0.61 GiB | 12±22% |
| Phi-3-medium-4k-instruct | F32 | 14.0B | 52.01 GiB | 13.28 GiB | 66.35 GiB | 0.61 GiB | 12±22% |
| UncensoredLM-DeepSeek-R1-Distill-Qwen-14B | F32 | 14.2B | 52.98 GiB | 12.22 GiB | 66.24 GiB | 0.72 GiB | 12±22% |
Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.
Questions people ask
- What AI models can a RTX PRO 5000 Blackwell run?
- 2046 of 2118 indexed open-weight models fit a RTX PRO 5000 Blackwell at 131,072 context with q8_0 KV cache, the largest being NVIDIA-Nemotron-3-Super-120B-A12B-BF16 at IQ3_XS. That covers text, vision-language, image, video and speech models.
- How much usable memory does a RTX PRO 5000 Blackwell actually have?
- Its nameplate is 72 GB, but about 66.96 GiB is available to a model once driver and compositor overhead is accounted for.
- Is a RTX PRO 5000 Blackwell fast for local AI?
- Its memory bandwidth is 1344 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.