NVIDIA · workstation
RTX PRO 5000 Blackwell
RTX PRO 5000 Blackwell has 72 GB of VRAM at 1344 GB/s — about 66.96 GiB usable after driver and compositor overhead. 2061 of 2118 indexed models fit at 128K context with q4_0 KV.
Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
72 GB
GDDR7
Bandwidth
1344 GB/s
384-bit bus
Tensor FP16
295 TF
dense
TDP
300 W
$4569 MSRP
text 1771vision language 186image 2audio asr 39audio tts 21video 16embedding 26
What fits at 128K context
largest quantization that fits, per model · 2061 of 2118 indexed
| Model | Best quant | Params | Weights● | KV● | Total in memory◐ | Headroom◐ | tok/s◐ |
|---|---|---|---|---|---|---|---|
| Mistral-Small-4-119B-2603MoE | Q4_K_S | 119B | 65.08 GiB | 0.79 GiB | 66.91 GiB | 0.05 GiB | 64±37% |
| c4ai-command-r-08-2024 | F16 | 32.3B | 60.17 GiB | 5.63 GiB | 66.91 GiB | 0.05 GiB | 12±22% |
| GLM-4.5-Air-DerestrictedMoE | Q4_0 | 110B | 59.38 GiB | 6.47 GiB | 66.88 GiB | 0.08 GiB | 32±37% |
| GLM-4.5-AirMoE | Q4_0 | 110B | 59.38 GiB | 6.47 GiB | 66.88 GiB | 0.08 GiB | 32±37% |
| Qwen3.5-REAP-212B-A17BMoE | IQ2_M | 212B | 64.76 GiB | 1.05 GiB | 66.87 GiB | 0.09 GiB | 59±37% |
| command-r-35b-writer-v2 | I1-Q4_1 | 35.0B | 20.75 GiB | 45.00 GiB | 66.86 GiB | 0.10 GiB | 12±22% |
| Gemma-4-Novelist-Eclipse-31B | BF16 | 32.7B | 59.82 GiB | 5.95 GiB | 66.86 GiB | 0.10 GiB | 12±22% |
| Gemma-4-31B-StyleTune | BF16 | 32.7B | 59.82 GiB | 5.95 GiB | 66.86 GiB | 0.10 GiB | 12±22% |
| Llama-3.3-70B-Instruct | Q6_K_L | 70.6B | 54.39 GiB | 11.25 GiB | 66.76 GiB | 0.20 GiB | 12±22% |
| Anubis-70B-v1.2 | Q6_K_L | 70.6B | 54.39 GiB | 11.25 GiB | 66.76 GiB | 0.20 GiB | 12±22% |
| Tess-R1-Limerick-Llama-3.1-70B | Q6_K_L | 70.6B | 54.39 GiB | 11.25 GiB | 66.76 GiB | 0.20 GiB | 12±22% |
| Infinity-Instruct-7M-Gen-Llama3_1-70B | Q6_K_L | 70.6B | 54.39 GiB | 11.25 GiB | 66.76 GiB | 0.20 GiB | 12±22% |
| Athene-70B | Q6_K_L | 70.6B | 54.39 GiB | 11.25 GiB | 66.76 GiB | 0.20 GiB | 12±22% |
| Qwen3.5-122B-A10B-hereticMoE | I1-Q4_K_S | 123B | 64.86 GiB | 0.84 GiB | 66.73 GiB | 0.23 GiB | 64±37% |
| NVIDIA-Nemotron-3-Super-120B-A12B-BF16MoE | IQ4_XS | 124B | 62.59 GiB | 3.09 GiB | 66.68 GiB | 0.28 GiB | 46±37% |
| Laguna-S-2.1MoE | UD-Q4_K_S | 118B | 63.88 GiB | 1.73 GiB | 66.63 GiB | 0.33 GiB | 54±37% |
| Qwen3.5-REAP-262B-A17BMoE | IQ2_XXS | 262B | 64.50 GiB | 1.05 GiB | 66.61 GiB | 0.35 GiB | 63±37% |
| Mistral-Medium-3.5-128B | Q3_K_S | 128B | 53.05 GiB | 12.38 GiB | 66.58 GiB | 0.38 GiB | 12±22% |
| MiMo-V2-FlashMoEKV unresolved | IQ1_M | 310B | 61.31 GiB | 4.22 GiB | 66.57 GiB | 0.39 GiB | 44±37% |
| step-3.5-flash | IQ2_S | 199B | 51.70 GiB | 13.79 GiB | 66.52 GiB | 0.44 GiB | 12±22% |
| MiniMax-M2.1-REAP-139B-A10BMoE | I1-IQ3_M | 139B | 56.81 GiB | 8.72 GiB | 66.52 GiB | 0.44 GiB | 29±37% |
| m51Lab-MiniMax-M2.7-REAP-139B-A10BMoE | I1-IQ3_M | 139B | 56.81 GiB | 8.72 GiB | 66.52 GiB | 0.44 GiB | 29±37% |
| Phi-3-mini-4k-instructKV unresolved | F32 | 3.8B | 52.01 GiB | 13.50 GiB | 66.51 GiB | 0.45 GiB | 12±22% |
| Llama-4-Scout-17B-16E-InstructMoEKV unresolved | Q4_0 | 109B | 58.72 GiB | 6.75 GiB | 66.50 GiB | 0.46 GiB | 32±37% |
| Devstral-2-123B-Instruct-2512 | IQ3_M | 125B | 52.89 GiB | 12.38 GiB | 66.43 GiB | 0.53 GiB | 12±22% |
| XORTRON-NXTXPRTXXL | I1-IQ3_M | 128B | 52.89 GiB | 12.38 GiB | 66.43 GiB | 0.53 GiB | 12±22% |
| Apertus-70B-Instruct-2509 | Q6_K | 70.6B | 53.95 GiB | 11.25 GiB | 66.38 GiB | 0.58 GiB | 12±22% |
| MiniMax-M2.7MoE | IQ2_XXS | 229B | 56.67 GiB | 8.72 GiB | 66.37 GiB | 0.59 GiB | 31±37% |
| Wizard-Vicuna-30B-Uncensored | I1-IQ2_M | 32.5B | 10.43 GiB | 54.84 GiB | 66.34 GiB | 0.62 GiB | 12±22% |
| archangel_sft-kto_llama30b | I1-IQ2_M | 32.5B | 10.43 GiB | 54.84 GiB | 66.34 GiB | 0.62 GiB | 12±22% |
| Qwen3.6-35B-A3B-uncensored-hereticMoE | BF16 | 35.1B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| Darwin-35B-A3B-OpusMoE | BF16 | 36.0B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| Carnice-MoE-35B-A3BMoE | F16 | 36.0B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| Qwen3.6-35B-A3B-hereticMoE | BF16 | 35.1B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| Aurora-Code-1MoE | BF16 | 34.7B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| grug-35b-v2MoE | BF16 | 35.1B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| grug-35bMoE | BF16 | 35.1B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| WorldSim-Opus-3.6-35B-A3BMoE | BF16 | 35.1B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| Qwen3.6-35B-A3B-abliterated-MAXMoE | BF16 | 35.1B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| Huihui-Nex-N2-mini-abliteratedMoE | BF16 | 35.1B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| Qwen3.6-35B-A3B-AnkoMoE | BF16 | 35.1B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| KAT-Coder-V2.5-DevMoE | BF16 | 34.7B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| Ornith-1.0-35B-uncensored-hereticMoE | BF16 | 35.1B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| Qwen3.6-35B-A3B-abliterated-v4MoE | BF16 | 34.7B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| Qwen3.5-35B-A3B-ultra-uncensored-hereticMoE | BF16 | 35.1B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| Nex-N2-mini-ultra-uncensored-hereticMoE | BF16 | 35.1B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| Agents-A1MoE | F16 | 35.1B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| Qwen3.6-35B-A3B-java-v1MoE | BF16 | 34.7B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| Nex-N2-miniMoE | BF16 | 35.1B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| Qwen3.5-35B-A3B-BaseMoE | BF16 | 36.0B | 64.61 GiB | 0.70 GiB | 66.32 GiB | 0.64 GiB | 66±37% |
| Meta-Llama-3-70B-Instruct | Q6_K | 70.6B | 53.92 GiB | 11.25 GiB | 66.30 GiB | 0.66 GiB | 12±22% |
| Qwen3-VL-235B-A22B-ThinkingMoE | UD-IQ1_S | 236B | 58.65 GiB | 6.61 GiB | 66.29 GiB | 0.67 GiB | 32±37% |
| calme-2.4-llama3-70b | Q6_K | 70.6B | 53.91 GiB | 11.25 GiB | 66.29 GiB | 0.67 GiB | 12±22% |
| calme-2.2-llama3-70b | Q6_K | 70.6B | 53.91 GiB | 11.25 GiB | 66.29 GiB | 0.67 GiB | 12±22% |
| L3.3-70B-Magnum-v4-SE | Q6_K | 70.6B | 53.91 GiB | 11.25 GiB | 66.29 GiB | 0.67 GiB | 12±22% |
| L3.3-Electra-R1-70b | Q6_K | 70.6B | 53.91 GiB | 11.25 GiB | 66.29 GiB | 0.67 GiB | 12±22% |
| Latxa-Llama-3.1-70B-Instruct-v2 | I1-Q6_K | 70.6B | 53.91 GiB | 11.25 GiB | 66.29 GiB | 0.67 GiB | 12±22% |
| Llama-3.3_70_b_uncensored_continued | I1-Q6_K | 70.6B | 53.91 GiB | 11.25 GiB | 66.29 GiB | 0.67 GiB | 12±22% |
| grok-oss-Revenant-70B | I1-Q6_K | 70.6B | 53.91 GiB | 11.25 GiB | 66.29 GiB | 0.67 GiB | 12±22% |
| Hermes-4-70B | Q6_K | 70.6B | 53.91 GiB | 11.25 GiB | 66.29 GiB | 0.67 GiB | 12±22% |
Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.
Questions people ask
- What AI models can a RTX PRO 5000 Blackwell run?
- 2061 of 2118 indexed open-weight models fit a RTX PRO 5000 Blackwell at 131,072 context with q4_0 KV cache, the largest being Mistral-Small-4-119B-2603 at Q4_K_S. That covers text, vision-language, image, video and speech models.
- How much usable memory does a RTX PRO 5000 Blackwell actually have?
- Its nameplate is 72 GB, but about 66.96 GiB is available to a model once driver and compositor overhead is accounted for.
- Is a RTX PRO 5000 Blackwell fast for local AI?
- Its memory bandwidth is 1344 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.