Intel · consumer

Arc B570 10GB

Arc B570 10GB has 10 GB of VRAM at 380 GB/s — about 9.30 GiB usable after driver and compositor overhead. 1688 of 2118 indexed models fit at 4K context with q4_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
10 GB
GDDR6
Bandwidth
380 GB/s
160-bit bus
Tensor FP16
dense
TDP
150 W
$219 MSRP
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1462vision language 126image 2video 12audio asr 39audio tts 21embedding 26

What fits at 4K context

largest quantization that fits, per model · 1688 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
HomunculusQ5_K_M12.5B8.27 GiB0.18 GiB9.30 GiB0.00 GiB24±30%
OmniAtlas-Qwen3-30B-A3BI1-IQ2_XS31.7B8.45 GiB0.00 GiB9.30 GiB0.00 GiB24±30%
Qwen3-Omni-30B-A3B-CaptionerI1-IQ2_XS31.7B8.45 GiB0.00 GiB9.30 GiB0.00 GiB24±30%
v6-Finch-7B-HFQ8_07.6B7.88 GiB0.56 GiB9.29 GiB0.01 GiB24±30%
rwkv-6-world-7bQ8_07.6B7.88 GiB0.56 GiB9.29 GiB0.01 GiB24±30%
gemma-4-19B-A4B-it-INSTRUCT-Heretic-UncensoredMoEI1-IQ3_S19.0B8.38 GiB0.13 GiB9.29 GiB0.01 GiB24±30%
gemma-4-19B-A4B-it-The-DECKARD-Heretic-Uncensored-ThinkingMoEI1-IQ3_S19.0B8.38 GiB0.13 GiB9.29 GiB0.01 GiB24±30%
gemma-4-19b-a4b-it-REAP-hereticMoEI1-IQ3_S19.0B8.38 GiB0.13 GiB9.29 GiB0.01 GiB24±30%
Gemma-4-19BMoEI1-IQ3_S19.0B8.38 GiB0.13 GiB9.29 GiB0.01 GiB24±30%
Magistry-24B-v1.1IQ2_M23.6B8.19 GiB0.18 GiB9.29 GiB0.01 GiB24±30%
Aurora-Code-1MoEI1-IQ2_XS34.7B8.45 GiB0.02 GiB9.28 GiB0.02 GiB119±37%
GPT-NeoX-20B-ErebusI1-Q2_K20.6B7.22 GiB1.16 GiB9.27 GiB0.03 GiB24±30%
Skywork-R1V3-38BIQ2_XXS38.4B8.41 GiB0.00 GiB9.27 GiB0.03 GiB24±30%
Noromaid-20b-v0.1.1I1-IQ3_XXS20.0B7.07 GiB1.36 GiB9.27 GiB0.03 GiB24±30%
internlm2-math-plus-20bI1-IQ3_S19.9B8.20 GiB0.21 GiB9.27 GiB0.03 GiB24±30%
HunyuanImage-2.1Q3_K_S17.5B8.42 GiB0.00 GiB9.27 GiB0.03 GiB24±30%
DeepSeek-R1-Distill-Llama-8B-AbliteratedI1-IQ4_XS8.0B8.28 GiB0.14 GiB9.26 GiB0.04 GiB24±30%
Rocinante-XL-16B-v1I1-IQ4_XS16.1B8.18 GiB0.24 GiB9.26 GiB0.04 GiB24±30%
GLM-4.7-Flash-DerestrictedMoEI1-IQ2_S31.2B8.40 GiB0.06 GiB9.26 GiB0.04 GiB93±37%
Huihui-GLM-4.7-Flash-abliteratedMoEI1-IQ2_S31.2B8.40 GiB0.06 GiB9.26 GiB0.04 GiB93±37%
Marco-Mini-InstructMoEI1-Q3_K_L17.3B8.36 GiB0.12 GiB9.26 GiB0.04 GiB109±37%
ERNIE-4.5-21B-A3B-ThinkingIQ3_XXS21.8B8.38 GiB0.06 GiB9.26 GiB0.04 GiB24±30%
ERNIE-4.5-21B-A3B-PTIQ3_XXS21.9B8.38 GiB0.06 GiB9.26 GiB0.04 GiB24±30%
SOLAR-10.7B-Instruct-v1.0-uncensoredQ6_K10.7B8.20 GiB0.21 GiB9.25 GiB0.05 GiB24±30%
Nous-Hermes-2-SOLAR-10.7BQ6_K10.7B8.20 GiB0.21 GiB9.25 GiB0.05 GiB24±30%
SOLAR-10.7B-Instruct-v1.0I1-Q6_K10.7B8.20 GiB0.21 GiB9.25 GiB0.05 GiB24±30%
ERNIE-21B-A3B-Thinking-Gemini-3-Pro-High-Reasoning-V2I1-IQ3_XS21.8B8.37 GiB0.06 GiB9.25 GiB0.05 GiB24±30%
ERNIE-21B-A3B-Claude-4.5-High-OPUS-ThinkingI1-IQ3_XS21.8B8.37 GiB0.06 GiB9.25 GiB0.05 GiB24±30%
codegeex4-all-9bQ6_K9.4B7.69 GiB0.70 GiB9.25 GiB0.05 GiB24±30%
Wan2.1-T2V-14BQ4_014.3B8.41 GiB0.00 GiB9.25 GiB0.05 GiB24±30%
gemma-4-A4B-98e-v6-coder-itMoEIQ3_XXS20.5B8.33 GiB0.13 GiB9.25 GiB0.05 GiB24±30%
Qwen3-VL-8B-Instruct-HereticI1-Q3_K_L8.8B8.25 GiB0.16 GiB9.24 GiB0.06 GiB24±30%
glm-4-9b-chat-abliteratedQ6_K9.4B7.69 GiB0.70 GiB9.24 GiB0.06 GiB24±30%
glm-4-9b-chatQ6_K9.4B7.69 GiB0.70 GiB9.24 GiB0.06 GiB24±30%
Qwen3-Coder-30B-A3B-InstructMoEUD-IQ1_S30.5B8.34 GiB0.11 GiB9.24 GiB0.06 GiB90±37%
Apriel-1.6-15b-ThinkerI1-Q4_K_M14.9B8.18 GiB0.21 GiB9.24 GiB0.06 GiB24±30%
Muse-Glimmer-30BIQ2_XXS29.8B8.31 GiB0.04 GiB9.23 GiB0.07 GiB24±30%
GLM-4.7-Flash-REAP-23B-A3B-absolute-heresyMoEI1-IQ3_XXS23.0B8.36 GiB0.06 GiB9.23 GiB0.07 GiB83±37%
InternVL3_5-14BQ4_K_M15.1B8.38 GiB0.00 GiB9.23 GiB0.07 GiB24±30%
MythoMax-L2-Kimiko-v2-13bQ4_K_M13.0B7.51 GiB0.88 GiB9.23 GiB0.07 GiB24±30%
MythoMax-L2-13bI1-Q4_K_M13.0B7.51 GiB0.88 GiB9.23 GiB0.07 GiB24±30%
spoomplesmaxx-v2.1-30BI1-IQ2_XS28.9B8.04 GiB0.28 GiB9.23 GiB0.07 GiB24±30%
Huihui-granite-4.1-30b-abliteratedI1-IQ2_XS28.9B8.04 GiB0.28 GiB9.23 GiB0.07 GiB24±30%
granite-4.1-30b-hereticI1-IQ2_XS28.9B8.04 GiB0.28 GiB9.23 GiB0.07 GiB24±30%
HunyuanVideo-1.5Q8_08.3B8.38 GiB0.00 GiB9.22 GiB0.08 GiB24±30%
rnj-1-instructQ8_08.3B8.23 GiB0.14 GiB9.22 GiB0.08 GiB24±30%
Grug-12BQ5_K_M12.0B8.17 GiB0.20 GiB9.22 GiB0.08 GiB24±30%
gemma-4-12B-it-Esper4Q5_K_M12.0B8.17 GiB0.20 GiB9.22 GiB0.08 GiB24±30%
gemma-4-12B-itQ5_K_M12.0B8.17 GiB0.20 GiB9.22 GiB0.08 GiB24±30%
Wizard-Vicuna-30B-UncensoredI1-IQ1_S32.5B6.63 GiB1.71 GiB9.22 GiB0.08 GiB24±30%
archangel_sft-kto_llama30bI1-IQ1_S32.5B6.63 GiB1.71 GiB9.22 GiB0.08 GiB24±30%
Goetia-26B-A4B-v1.4MoEI1-IQ1_M26.0B8.30 GiB0.13 GiB9.21 GiB0.09 GiB24±30%
G4-Moonlight-Dusk-26B-A4B-hereticMoEI1-IQ1_M26.5B8.30 GiB0.13 GiB9.21 GiB0.09 GiB24±30%
Pantheon-Reasoning-26B-A4B-1.1-hereticMoEI1-IQ1_M26.5B8.30 GiB0.13 GiB9.21 GiB0.09 GiB24±30%
G4-Moonlight-Dusk-26B-A4BMoEI1-IQ1_M26.5B8.30 GiB0.13 GiB9.21 GiB0.09 GiB24±30%
Chimera-X-26B-A4BMoEI1-IQ1_M26.5B8.30 GiB0.13 GiB9.21 GiB0.09 GiB24±30%
Pantheon-Reasoning-26B-A4B-1.1MoEI1-IQ1_M26.5B8.30 GiB0.13 GiB9.21 GiB0.09 GiB24±30%
Gemma-4-26B-A4B-StyleTune-V2MoEI1-IQ1_M26.5B8.30 GiB0.13 GiB9.21 GiB0.09 GiB24±30%
Gemma-4-26B-A4B-StyleTuneMoEI1-IQ1_M26.5B8.30 GiB0.13 GiB9.21 GiB0.09 GiB24±30%
gemma-4-26b-a4b-heretic-styletune-v2-headMoEI1-IQ1_M25.8B8.30 GiB0.13 GiB9.21 GiB0.09 GiB24±30%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Arc B570 10GB run?
1688 of 2118 indexed open-weight models fit a Arc B570 10GB at 4,096 context with q4_0 KV cache, the largest being Homunculus at Q5_K_M. That covers text, vision-language, image, video and speech models.
How much usable memory does a Arc B570 10GB actually have?
Its nameplate is 10 GB, but about 9.30 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Arc B570 10GB fast for local AI?
Its memory bandwidth is 380 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.