Intel · workstation

Arc Pro A30M 4GB

Arc Pro A30M 4GB has 4 GB of VRAM at 112 GB/s — about 3.72 GiB usable after driver and compositor overhead. 505 of 2118 indexed models fit at 64K context with q4_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
4 GB
GDDR6
Bandwidth
112 GB/s
64-bit bus
Tensor FP16
dense
TDP
50 W
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 386vision language 44embedding 20audio asr 35audio tts 18video 2

What fits at 64K context

largest quantization that fits, per model · 505 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
OpenClaude-1.7B-MergedIQ4_XS1.7B0.96 GiB1.97 GiB3.72 GiB0.00 GiB21±30%
LocateAnything-3BQ5_K_M3.8B2.27 GiB0.63 GiB3.72 GiB0.00 GiB21±30%
Qwen3.5-4B-NSFW-ARA-Heretic-LiteroticaI1-IQ4_XS4.2B2.34 GiB0.56 GiB3.72 GiB0.00 GiB21±30%
Qwen3.5-4B-RpRMax-v1I1-IQ4_XS4.7B2.34 GiB0.56 GiB3.72 GiB0.00 GiB21±30%
Holo-3.1-4B-uncensored-hereticI1-IQ4_XS4.5B2.34 GiB0.56 GiB3.72 GiB0.00 GiB21±30%
GRaPE-2-MiniI1-IQ4_XS4.7B2.34 GiB0.56 GiB3.72 GiB0.00 GiB21±30%
Qwen3.5-DPO-4B-2I1-IQ4_XS4.2B2.34 GiB0.56 GiB3.72 GiB0.00 GiB21±30%
Huihui-Qwen3.5-4B-Claude-4.6-Opus-abliteratedI1-IQ4_XS4.7B2.34 GiB0.56 GiB3.72 GiB0.00 GiB21±30%
Qwopus3.5-4B-v3-hereticI1-IQ4_XS4.5B2.34 GiB0.56 GiB3.72 GiB0.00 GiB21±30%
Aureth-4B-Qwen3.5I1-IQ4_XS4.5B2.34 GiB0.56 GiB3.72 GiB0.00 GiB21±30%
Qwen2.5-3BQ5_K_M3.1B2.27 GiB0.63 GiB3.72 GiB0.00 GiB21±30%
GRM-Kerlin-3bI1-Q5_K_M3.4B2.27 GiB0.63 GiB3.72 GiB0.00 GiB21±30%
Qwen2.5-Coder-3B-InstructQ5_K_M3.1B2.27 GiB0.63 GiB3.72 GiB0.00 GiB21±30%
Qwen2.5-3B-InstructQ5_K_M3.1B2.27 GiB0.63 GiB3.72 GiB0.00 GiB21±30%
LCO-Embedding-Omni-3B-2605Q5_K_M4.7B2.27 GiB0.63 GiB3.72 GiB0.00 GiB21±30%
Garnet-OCR-3B-0422I1-Q5_K_M4.1B2.27 GiB0.63 GiB3.72 GiB0.00 GiB21±30%
Yi-6B-ChatI1-IQ2_XS6.1B1.76 GiB1.13 GiB3.71 GiB0.01 GiB21±30%
Vikhr-Gemma-2B-instructQ5_K_L2.6B1.92 GiB0.98 GiB3.71 GiB0.01 GiB21±30%
gemma-2-2b-it-abliteratedQ5_K_L2.6B1.92 GiB0.98 GiB3.71 GiB0.01 GiB21±30%
Gemmasutra-Mini-2B-v1Q5_K_L2.6B1.92 GiB0.98 GiB3.71 GiB0.01 GiB21±30%
Qwen3-VL-Reranker-2BIQ4_XS2.1B0.95 GiB1.97 GiB3.71 GiB0.01 GiB21±30%
Atomight-V2.5-1.7BIQ4_XS1.7B0.95 GiB1.97 GiB3.71 GiB0.01 GiB21±30%
OpenCaption-2B-VL-SFT-v1.0IQ4_XS2.1B0.95 GiB1.97 GiB3.71 GiB0.01 GiB21±30%
gaon-1.7b-v2-instructIQ4_XS1.7B0.95 GiB1.97 GiB3.71 GiB0.01 GiB21±30%
gaon-1.7b-v2-translateIQ4_XS1.7B0.95 GiB1.97 GiB3.71 GiB0.01 GiB21±30%
gemma-4-E2B-it-ultra-uncensored-hereticI1-Q2_K5.1B2.78 GiB0.13 GiB3.71 GiB0.01 GiB21±30%
Barcenas-E2BI1-Q2_K5.1B2.78 GiB0.13 GiB3.71 GiB0.01 GiB21±30%
gemma-4-E2B-it-Uncensored-MAXI1-Q2_K5.1B2.78 GiB0.13 GiB3.71 GiB0.01 GiB21±30%
Firefly-v4I1-Q2_K5.1B2.78 GiB0.13 GiB3.71 GiB0.01 GiB21±30%
gemma-4-E2B-it-abliteratedI1-Q2_K5.1B2.78 GiB0.13 GiB3.71 GiB0.01 GiB21±30%
gemma-4-E2B-it-uncensoredQ2_K5.1B2.78 GiB0.13 GiB3.71 GiB0.01 GiB21±30%
gemma-4-E2B-it-heretic-araQ2_K5.1B2.78 GiB0.13 GiB3.71 GiB0.01 GiB21±30%
rp-model_E2B_v5.1I1-Q2_K5.1B2.78 GiB0.13 GiB3.71 GiB0.01 GiB21±30%
BartaLens-E2BI1-Q2_K5.1B2.78 GiB0.13 GiB3.71 GiB0.01 GiB21±30%
gemma-4-E2BQ2_K5.1B2.78 GiB0.13 GiB3.71 GiB0.01 GiB21±30%
MiniCPM-V-4Q5_04.1B2.33 GiB0.56 GiB3.71 GiB0.01 GiB21±30%
Darwin-4B-ChimeraI1-Q4_K_M4.0B2.33 GiB0.57 GiB3.71 GiB0.01 GiB21±30%
Llama-3.2-3B-Instruct-abliteratedI1-IQ1_S3.6B0.93 GiB1.97 GiB3.71 GiB0.01 GiB21±30%
Gemma-3-4b-it-Uncensored-DBL-XI1-Q4_K_S4.7B2.41 GiB0.47 GiB3.70 GiB0.02 GiB21±30%
Supertron2-Reranker-2BI1-IQ4_XS2.1B0.94 GiB1.97 GiB3.70 GiB0.02 GiB21±30%
Uni-MuMER-Qwen3-VL-2BI1-IQ4_XS2.1B0.94 GiB1.97 GiB3.70 GiB0.02 GiB21±30%
Qwen3-VL-2B-ThinkingIQ4_XS2.1B0.94 GiB1.97 GiB3.70 GiB0.02 GiB21±30%
Qwen3-VL-2B-InstructIQ4_XS2.1B0.94 GiB1.97 GiB3.70 GiB0.02 GiB21±30%
Lightning-1.7BIQ4_XS1.7B0.94 GiB1.97 GiB3.70 GiB0.02 GiB21±30%
DorsetHeatwaveLLM2I1-IQ4_XS1.7B0.94 GiB1.97 GiB3.70 GiB0.02 GiB21±30%
gemma-4-E2B-itIQ4_XS5.1B2.78 GiB0.13 GiB3.70 GiB0.02 GiB21±30%
granite-4.0-h-tinyMoEUD-IQ3_XXS6.9B2.79 GiB0.14 GiB3.70 GiB0.02 GiB57±37%
granite-3.3-2b-instructQ4_12.5B1.50 GiB1.41 GiB3.70 GiB0.02 GiB21±30%
granite-3.2-2b-instructQ4_12.5B1.50 GiB1.41 GiB3.70 GiB0.02 GiB21±30%
granite-vision-3.2-2bQ4_13.0B1.50 GiB1.41 GiB3.70 GiB0.02 GiB21±30%
gemma-4-E2B-it-qat-q4_0-unquantized-hereticI1-Q2_K5.1B2.78 GiB0.13 GiB3.70 GiB0.02 GiB21±30%
Huihui-gemma-4-E2B-it-qat-q4_0-unquantized-abliteratedI1-Q2_K5.1B2.78 GiB0.13 GiB3.70 GiB0.02 GiB21±30%
Gemma4_E2B_Abliterated_Baked_HF_ReadyI1-Q2_K5.1B2.78 GiB0.13 GiB3.70 GiB0.02 GiB21±30%
AMD-OLMo-1B-SFT-DPOQ4_K_S1.2B0.65 GiB2.25 GiB3.70 GiB0.02 GiB21±30%
Qwen3-VL-Embedding-2BQ3_K_L2.1B0.93 GiB1.97 GiB3.70 GiB0.02 GiB21±30%
umt5-xxlQ3_K_M5.7B2.85 GiB0.00 GiB3.70 GiB0.02 GiB21±30%
Hunyuan-1.8B-InstructQ8_01.8B1.78 GiB1.13 GiB3.70 GiB0.02 GiB21±30%
Hy-MT2-1.8BQ8_02.0B1.78 GiB1.13 GiB3.70 GiB0.02 GiB21±30%
Qwen3-1.7BQ3_K_S2.0B0.93 GiB1.97 GiB3.69 GiB0.03 GiB21±30%
deepseek-coder-5.7bmqa-baseQ3_K_M5.7B2.59 GiB0.28 GiB3.69 GiB0.03 GiB21±30%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Arc Pro A30M 4GB run?
505 of 2118 indexed open-weight models fit a Arc Pro A30M 4GB at 65,536 context with q4_0 KV cache, the largest being OpenClaude-1.7B-Merged at IQ4_XS. That covers text, vision-language, image, video and speech models.
How much usable memory does a Arc Pro A30M 4GB actually have?
Its nameplate is 4 GB, but about 3.72 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Arc Pro A30M 4GB fast for local AI?
Its memory bandwidth is 112 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.