Intel · consumer

Arc B580 12GB

Arc B580 12GB has 12 GB of VRAM at 456 GB/s — about 11.16 GiB usable after driver and compositor overhead. 1617 of 2118 indexed models fit at 32K context with q8_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
12 GB
GDDR6
Bandwidth
456 GB/s
192-bit bus
Tensor FP16
dense
TDP
190 W
$249 MSRP
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1379vision language 136video 14image 2audio asr 39embedding 26audio tts 21

What fits at 32K context

largest quantization that fits, per model · 1617 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
EVA-Yi-1.5-9B-32K-V1Q8_08.8B8.74 GiB1.59 GiB11.16 GiB0.00 GiB24±30%
Yi-Coder-9B-ChatQ8_08.8B8.74 GiB1.59 GiB11.16 GiB0.00 GiB24±30%
Yi-1.5-9B-ChatQ8_08.8B8.74 GiB1.59 GiB11.16 GiB0.00 GiB24±30%
Muse-Glimmer-30BUD-IQ2_XXS29.8B10.01 GiB0.27 GiB11.16 GiB0.00 GiB24±30%
Wan2.1-FLF2V-14B-720PQ4_116.4B10.32 GiB0.00 GiB11.16 GiB0.00 GiB24±30%
Phi-3-medium-128k-instructQ3_K_L14.0B6.98 GiB3.32 GiB11.15 GiB0.01 GiB24±30%
Phi-3-medium-4k-instructI1-Q3_K_L14.0B6.98 GiB3.32 GiB11.15 GiB0.01 GiB24±30%
gemma-3-12b-it-vl-Gemini-3-Pro-Preview-Heretic-Uncensored-ThinkingI1-Q6_K12.2B9.00 GiB1.31 GiB11.15 GiB0.01 GiB24±30%
gemma-3-12b-it-vl-Deepseek-v3.1-Heretic-Uncensored-ThinkingI1-Q6_K12.2B9.00 GiB1.31 GiB11.15 GiB0.01 GiB24±30%
gemma-3-12b-it-ultra-uncensored-hereticQ6_K12.2B9.00 GiB1.31 GiB11.15 GiB0.01 GiB24±30%
gemma-3-12b-it-vl-GLM-4.7-Flash-Heretic-Uncensored-ThinkingI1-Q6_K12.2B9.00 GiB1.31 GiB11.15 GiB0.01 GiB24±30%
Floppa-12B-Gemma3-UncensoredI1-Q6_K12.2B9.00 GiB1.31 GiB11.15 GiB0.01 GiB24±30%
gemma-3-12b-it-hereticI1-Q6_K12.2B9.00 GiB1.31 GiB11.15 GiB0.01 GiB24±30%
gemma-3-12b-it-abliteratedQ6_K12.2B9.00 GiB1.31 GiB11.15 GiB0.01 GiB24±30%
gemma-3-12b-it-abliterated-v2Q6_K11.8B9.00 GiB1.31 GiB11.15 GiB0.01 GiB24±30%
gemma-3-12b-itQ6_K12.2B9.00 GiB1.31 GiB11.15 GiB0.01 GiB24±30%
Wan2.1-I2V-14B-480PQ4_116.4B10.32 GiB0.00 GiB11.15 GiB0.01 GiB24±30%
Wan2.1-I2V-14B-720PQ4_116.4B10.32 GiB0.00 GiB11.15 GiB0.01 GiB24±30%
SambaLingo-Japanese-ChatI1-IQ2_XXS6.9B1.83 GiB8.50 GiB11.15 GiB0.01 GiB24±30%
NVIDIA-Nemotron-Nano-9B-v2Q5_K_M8.9B6.58 GiB3.72 GiB11.15 GiB0.01 GiB24±30%
openNemo-9B-abliteratedQ5_K_M8.9B6.58 GiB3.72 GiB11.15 GiB0.01 GiB24±30%
Rocinante-XL-16B-v1I1-IQ3_S16.1B6.72 GiB3.59 GiB11.15 GiB0.01 GiB24±30%
HomunculusQ4_K_L12.5B7.63 GiB2.66 GiB11.14 GiB0.02 GiB24±30%
gemma-4-19B-A4B-it-INSTRUCT-Heretic-UncensoredMoEI1-IQ4_XS19.0B9.53 GiB0.82 GiB11.14 GiB0.02 GiB23±30%
gemma-4-19B-A4B-it-The-DECKARD-Heretic-Uncensored-ThinkingMoEI1-IQ4_XS19.0B9.53 GiB0.82 GiB11.14 GiB0.02 GiB23±30%
gemma-4-19b-a4b-it-REAP-hereticMoEI1-IQ4_XS19.0B9.53 GiB0.82 GiB11.14 GiB0.02 GiB23±30%
Gemma-4-19BMoEI1-IQ4_XS19.0B9.53 GiB0.82 GiB11.14 GiB0.02 GiB23±30%
zeta-2.1Q8_08.3B8.17 GiB2.13 GiB11.14 GiB0.02 GiB24±30%
zeta-2Q8_08.3B8.17 GiB2.13 GiB11.14 GiB0.02 GiB24±30%
gemma-4-26B-A4B-itMoEIQ2_S26.5B9.53 GiB0.82 GiB11.13 GiB0.03 GiB23±30%
spoomplesmaxx-mini-14BIQ4_XS14.8B7.62 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
qwen3-14b-code-reasoning-conversationalIQ4_XS14.8B7.62 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
Claria-14bIQ4_XS14.8B7.62 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
NTX-2.1-ProIQ4_XS14.8B7.62 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
Qwen3-14B-UncensoredIQ4_XS14.8B7.62 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
FrogMini-14B-2510IQ4_XS7.62 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
Qwen3-14B-abliteratedIQ4_XS14.8B7.62 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
Slava-Qwen3-14B-SerbianIQ4_XS14.8B7.62 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
Huihui-Qwen3-14B-abliterated-v2IQ4_XS14.8B7.62 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
Kimi-VL-A3B-InstructMoEI1-Q4_K_M16.4B9.82 GiB0.50 GiB11.13 GiB0.03 GiB65±37%
Kimi-VL-A3B-Thinking-2506MoEQ4_K_M16.4B9.82 GiB0.50 GiB11.13 GiB0.03 GiB65±37%
Moonlight-16B-A3B-InstructMoEQ4_K_M16.0B9.82 GiB0.50 GiB11.13 GiB0.03 GiB65±37%
Qwen3.5-9B-Star-Trek-TNG-DS9-Heretic-Uncensored-ThinkingQ8_09.4B9.77 GiB0.53 GiB11.13 GiB0.03 GiB24±30%
Qwen3.5-9B-Claude-4.6-OS-Auto-Variable-HERETIC-UNCENSORED-THINKINGQ8_09.4B9.77 GiB0.53 GiB11.13 GiB0.03 GiB24±30%
Janus-Pro-7BI1-Q2_K_S7.4B2.34 GiB7.97 GiB11.13 GiB0.03 GiB24±30%
Nemotron-Mini-4B-InstructQ4_K_S4.2B8.19 GiB2.13 GiB11.13 GiB0.03 GiB24±30%
Voxtral-Small-24B-2507IQ2_M24.3B7.56 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
Devstral-Small-2-24B-Instruct-2512IQ2_M24.0B7.56 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
Cydonia-v1.3-Magnum-v4-22BI1-IQ2_S22.2B6.55 GiB3.72 GiB11.13 GiB0.03 GiB24±30%
Mistral-Small-22B-ArliAI-RPMax-v1.1I1-IQ2_S22.2B6.55 GiB3.72 GiB11.13 GiB0.03 GiB24±30%
Mistral-Small-Drummer-22BIQ2_S22.2B6.55 GiB3.72 GiB11.13 GiB0.03 GiB24±30%
magnum-v4-22bI1-IQ2_S22.2B6.55 GiB3.72 GiB11.13 GiB0.03 GiB24±30%
Codestral-22B-v0.1IQ2_S22.2B6.55 GiB3.72 GiB11.13 GiB0.03 GiB24±30%
Transformed-Journey-24BI1-IQ2_M23.6B7.56 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
Magistry-24B-v1.1I1-IQ2_M23.6B7.56 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
Mergedonia-AETHER-24B-v1aI1-IQ2_M23.6B7.56 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
Mergedonia-AETHER-24B-v1bI1-IQ2_M23.6B7.56 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
Slimaki-Tavern-24B-v1.3I1-IQ2_M23.6B7.56 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
Maginum-Cydoms-24BI1-IQ2_M23.6B7.56 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
Maginum-Cydoms-24B-absolute-heresyI1-IQ2_M23.6B7.56 GiB2.66 GiB11.13 GiB0.03 GiB24±30%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Arc B580 12GB run?
1617 of 2118 indexed open-weight models fit a Arc B580 12GB at 32,768 context with q8_0 KV cache, the largest being EVA-Yi-1.5-9B-32K-V1 at Q8_0. That covers text, vision-language, image, video and speech models.
How much usable memory does a Arc B580 12GB actually have?
Its nameplate is 12 GB, but about 11.16 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Arc B580 12GB fast for local AI?
Its memory bandwidth is 456 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.