Apple · apple

Apple M3

Apple M3 has 8 GB of unified memory at 102 GB/s — about 5.58 GiB usable after driver and compositor overhead. 732 of 2118 indexed models fit at 32K context with f16 KV. Note only 6 GB of its 8 GB is allocatable to the GPU.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
8 GB
LPDDR5-6400
Bandwidth
102 GB/s
128-bit bus
Tensor FP16
dense
TDP
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 572vision language 78audio tts 19embedding 21audio asr 37video 5

What fits at 32K context

largest quantization that fits, per model · 732 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
Qwen3.5-9B-CoderI1-Q3_K_M9.7B4.41 GiB1.00 GiB6.00 GiB0.00 GiB15±8.3%
Qwopus3.5-9B-v3.5Q3_K_M9.7B4.41 GiB1.00 GiB6.00 GiB0.00 GiB15±8.3%
Qwythos-9B-Claude-Mythos-5-1M-MTPI1-Q3_K_M9.7B4.41 GiB1.00 GiB6.00 GiB0.00 GiB15±8.3%
Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliteratedI1-Q3_K_M9.7B4.41 GiB1.00 GiB6.00 GiB0.00 GiB15±8.3%
Qwen3.5-9B-Fable-5-v1I1-Q3_K_M9.7B4.41 GiB1.00 GiB6.00 GiB0.00 GiB15±8.3%
Qwythos-9B-v2I1-Q3_K_M9.7B4.41 GiB1.00 GiB6.00 GiB0.00 GiB15±8.3%
PINQWEN-3.5-9B-1M-BF16I1-Q3_K_M9.7B4.41 GiB1.00 GiB6.00 GiB0.00 GiB15±8.3%
Openprose-2-FlashI1-Q3_K_M9.7B4.41 GiB1.00 GiB6.00 GiB0.00 GiB15±8.3%
Qwen3.5-9B-Nikusui-v1I1-Q3_K_M9.7B4.41 GiB1.00 GiB6.00 GiB0.00 GiB15±8.3%
Ornstein-3.5-9B-V1.5I1-Q3_K_M9.7B4.41 GiB1.00 GiB6.00 GiB0.00 GiB15±8.3%
Ornith-1.0-9B-heretic-MTPI1-Q3_K_M9.4B4.41 GiB1.00 GiB6.00 GiB0.00 GiB15±8.3%
Tess-4-9BI1-Q3_K_M9.7B4.41 GiB1.00 GiB6.00 GiB0.00 GiB15±8.3%
dotwebs-1I1-Q3_K_M9.7B4.41 GiB1.00 GiB6.00 GiB0.00 GiB15±8.3%
liftQ3_K_M9.7B4.41 GiB1.00 GiB6.00 GiB0.00 GiB15±8.3%
Hemlock-Qwopus3.5-9B-CoderI1-Q3_K_M9.7B4.41 GiB1.00 GiB6.00 GiB0.00 GiB15±8.3%
Qwen3.5-9B-DeepSeek-V4-FlashQ3_K_M9.7B4.41 GiB1.00 GiB6.00 GiB0.00 GiB15±8.3%
Yi-6B-ChatI1-Q4_K_M6.1B3.42 GiB2.00 GiB6.00 GiB0.00 GiB15±8.3%
Yi-1.5-6B-ChatQ4_K_M6.1B3.42 GiB2.00 GiB6.00 GiB0.00 GiB15±8.3%
Qwen3.6-9B-Heretic-Uncensored-Thinking-Sweet-MadnessQ4_K_S9.1B4.88 GiB0.50 GiB5.99 GiB0.01 GiB15±8.3%
Phi-4-mini-reasoningUD-IQ2_M3.8B1.43 GiB4.00 GiB5.99 GiB0.01 GiB15±8.3%
MARTHA-LXVII.8B_QWEN-3.5-3.6_prune_9b-3.6_baseI1-Q4_K_S8.1B4.52 GiB0.88 GiB5.99 GiB0.01 GiB15±8.3%
Fara1.5-9BIQ3_M9.4B4.40 GiB1.00 GiB5.98 GiB0.02 GiB15±8.3%
QwenPaw-Flash-9BIQ3_M9.4B4.40 GiB1.00 GiB5.98 GiB0.02 GiB15±8.3%
grug-9bIQ3_M9.4B4.40 GiB1.00 GiB5.98 GiB0.02 GiB15±8.3%
OmniCoder-9BIQ3_M9.4B4.40 GiB1.00 GiB5.98 GiB0.02 GiB15±8.3%
Ornith-1.0-9BIQ3_M9.2B4.40 GiB1.00 GiB5.98 GiB0.02 GiB15±8.3%
Qwen3.5-9B-NeoIQ3_M9.7B4.40 GiB1.00 GiB5.98 GiB0.02 GiB15±8.3%
Aura-4BI1-IQ2_XS4.5B1.41 GiB4.00 GiB5.98 GiB0.02 GiB15±8.3%
magnum-v2-4bI1-IQ2_XS4.5B1.41 GiB4.00 GiB5.98 GiB0.02 GiB15±8.3%
orpheus-3b-0.1-pretrainedQ2_K_L3.8B1.92 GiB3.50 GiB5.97 GiB0.03 GiB15±8.3%
Llama-3.2-3B-Instruct-uncensoredIQ4_XS3.6B1.91 GiB3.50 GiB5.97 GiB0.03 GiB15±8.3%
Teuken-7B-instruct-research-v0.4I1-Q4_K_S7.5B4.38 GiB1.00 GiB5.97 GiB0.03 GiB15±8.3%
Phi-4-mini-instructIQ2_M3.8B1.40 GiB4.00 GiB5.96 GiB0.04 GiB15±8.3%
Qwen3.6-12B-IQ-Ultra-Heretic-Uncensored-Thinking-V2-HightopQ2_K12.1B4.60 GiB0.75 GiB5.96 GiB0.04 GiB15±8.3%
glm-4v-9bQ4_K_S13.9B5.36 GiB0.00 GiB5.96 GiB0.04 GiB15±8.3%
Llama-3.2-3B-Instruct-abliteratedI1-IQ4_XS3.6B1.90 GiB3.50 GiB5.96 GiB0.04 GiB15±8.3%
starcoder2-7bKV unresolvedQ3_K_M7.2B3.35 GiB2.00 GiB5.95 GiB0.05 GiB15±8.3%
InternVL3_5-14BQ2_K15.1B5.36 GiB0.00 GiB5.95 GiB0.05 GiB15±8.3%
Gemma-4-E4B-LuchadorQ4_K_S8.0B4.88 GiB0.51 GiB5.95 GiB0.05 GiB15±8.3%
nomic-embed-codeQ3_K_L7.1B3.59 GiB1.75 GiB5.94 GiB0.06 GiB15±8.3%
ACE-Step-v1-3.5BQ3_K_L3.3B5.35 GiB0.00 GiB5.94 GiB0.06 GiB15±8.3%
GLM-4.6V-FlashIQ3_XS10.3B4.10 GiB1.25 GiB5.94 GiB0.06 GiB15±8.3%
glm4.1v-9b-base-sftI1-IQ3_XS10.3B4.10 GiB1.25 GiB5.94 GiB0.06 GiB15±8.3%
GLM-Z1-9B-0414IQ3_XS9.4B4.10 GiB1.25 GiB5.94 GiB0.06 GiB15±8.3%
GLM-4-9B-0414IQ3_XS9.4B4.10 GiB1.25 GiB5.94 GiB0.06 GiB15±8.3%
Dolphin3.0-Llama3.2-3BQ4_K_M3.2B1.88 GiB3.50 GiB5.94 GiB0.06 GiB15±8.3%
Llama-Doctor-3.2-3B-InstructI1-Q4_K_M3.2B1.88 GiB3.50 GiB5.94 GiB0.06 GiB15±8.3%
Llama-Song-Stream-3B-InstructQ4_K_M3.2B1.88 GiB3.50 GiB5.94 GiB0.06 GiB15±8.3%
Llama-3.2-3B-Instruct-roleplay-tunedI1-Q4_K_M3.2B1.88 GiB3.50 GiB5.94 GiB0.06 GiB15±8.3%
Llama-3.2-3B-Instruct-heretic-ablitered-uncensoredI1-Q4_K_M3.2B1.88 GiB3.50 GiB5.94 GiB0.06 GiB15±8.3%
llama-3.2-Korean-Bllossom-3BQ4_K_M3.2B1.88 GiB3.50 GiB5.94 GiB0.06 GiB15±8.3%
Llama-3.2-3B-Instruct-uncensoredQ4_K_M3.2B1.88 GiB3.50 GiB5.94 GiB0.06 GiB15±8.3%
llama-3.2-3b-instruct-bnb-4bitQ4_K_M3.3B1.88 GiB3.50 GiB5.94 GiB0.06 GiB15±8.3%
Llama-3.2-3B-InstructQ4_K_M3.2B1.88 GiB3.50 GiB5.94 GiB0.06 GiB15±8.3%
Llama-3.2-3BQ4_K_M3.2B1.88 GiB3.50 GiB5.94 GiB0.06 GiB15±8.3%
OneLLM-Doey-ChatQA-V1-Llama-3.2-3BQ4_K_M3.2B1.88 GiB3.50 GiB5.94 GiB0.06 GiB15±8.3%
Llama3.2-3B-creative-writer-v0.1I1-Q4_K_M3.2B1.88 GiB3.50 GiB5.94 GiB0.06 GiB15±8.3%
Firefly-V3.2I1-Q4_K_M3.2B1.88 GiB3.50 GiB5.94 GiB0.06 GiB15±8.3%
Firefly-V3I1-Q4_K_M3.2B1.88 GiB3.50 GiB5.94 GiB0.06 GiB15±8.3%
Hermes-3-Llama-3.2-3BQ4_K_M3.2B1.88 GiB3.50 GiB5.94 GiB0.06 GiB15±8.3%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Apple M3 run?
732 of 2118 indexed open-weight models fit a Apple M3 at 32,768 context with f16 KV cache, the largest being Qwen3.5-9B-Coder at I1-Q3_K_M. That covers text, vision-language, image, video and speech models.
How much usable memory does a Apple M3 actually have?
Its nameplate is 8 GB, but about 5.58 GiB is available to a model once driver and compositor overhead is accounted for, and only 6 GB of the pool can be allocated to the GPU at all.
Is a Apple M3 fast for local AI?
Its memory bandwidth is 102 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.