Apple · apple
Apple M4
Apple M4 has 12 GB of unified memory at 120 GB/s — about 8.37 GiB usable after driver and compositor overhead. 784 of 2118 indexed models fit at 128K context with q8_0 KV. Note only 9 GB of its 12 GB is allocatable to the GPU.
Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
12 GB
LPDDR5X-7500
Bandwidth
120 GB/s
128-bit bus
Tensor FP16
—
dense
TDP
—
text 609video 12vision language 86audio tts 19embedding 21audio asr 36image 1
What fits at 128K context
largest quantization that fits, per model · 784 of 2118 indexed
| Model | Best quant | Params | Weights● | KV● | Total in memory◐ | Headroom◐ | tok/s◐ |
|---|---|---|---|---|---|---|---|
| granite-vision-3.3-2b | Q8_0 | 3.0B | 3.14 GiB | 5.31 GiB | 9.00 GiB | 0.00 GiB | 11±8.3% |
| Wan2.1-T2V-14B | Q4_0 | 14.3B | 8.41 GiB | 0.00 GiB | 9.00 GiB | 0.00 GiB | 11±8.3% |
| Felldude-Uncensored-Ministral3-3B-bf16 | I1-Q3_K_S | 3.8B | 1.53 GiB | 6.91 GiB | 9.00 GiB | 0.00 GiB | 11±8.3% |
| Ministral-3-3B-Instruct-2512-BF16 | Q3_K_S | 4.3B | 1.53 GiB | 6.91 GiB | 9.00 GiB | 0.00 GiB | 11±8.3% |
| Amaretto-3B | I1-Q3_K_S | 4.3B | 1.53 GiB | 6.91 GiB | 9.00 GiB | 0.00 GiB | 11±8.3% |
| Ministral-3-3B-Instruct-2512 | Q3_K_S | 3.8B | 1.53 GiB | 6.91 GiB | 9.00 GiB | 0.00 GiB | 11±8.3% |
| Ministral-3-3B-Reasoning-2512 | Q3_K_S | 4.3B | 1.53 GiB | 6.91 GiB | 9.00 GiB | 0.00 GiB | 11±8.3% |
| gemma-4-E4B-it-Uncensored-MAX | Q8_0 | 8.0B | 7.46 GiB | 0.97 GiB | 8.99 GiB | 0.01 GiB | 11±8.3% |
| GLM-4.6V-Flash | Q4_K_M | 10.3B | 5.74 GiB | 2.66 GiB | 8.99 GiB | 0.01 GiB | 11±8.3% |
| GLM-Z1-9B-0414 | Q4_K_M | 9.4B | 5.74 GiB | 2.66 GiB | 8.99 GiB | 0.01 GiB | 11±8.3% |
| glm4.1v-9b-base-sft | I1-Q4_K_M | 10.3B | 5.74 GiB | 2.66 GiB | 8.99 GiB | 0.01 GiB | 11±8.3% |
| GLM-4-9B-0414 | Q4_K_M | 9.4B | 5.74 GiB | 2.66 GiB | 8.99 GiB | 0.01 GiB | 11±8.3% |
| GLM-4.1V-9B-Thinking | Q4_K_M | 10.3B | 5.74 GiB | 2.66 GiB | 8.99 GiB | 0.01 GiB | 11±8.3% |
| internlm3-8b-instruct | Q4_1 | 8.8B | 5.22 GiB | 3.19 GiB | 8.99 GiB | 0.01 GiB | 11±8.3% |
| OpenClaude-1.7B-Merged | Q4_K_S | 1.7B | 1.00 GiB | 7.44 GiB | 8.99 GiB | 0.01 GiB | 11±8.3% |
| EVA-Yi-1.5-9B-32K-V1 | I1-IQ1_M | 8.8B | 2.03 GiB | 6.38 GiB | 8.98 GiB | 0.02 GiB | 11±8.3% |
| Yi-Coder-9B-Chat | IQ1_M | 8.8B | 2.03 GiB | 6.38 GiB | 8.98 GiB | 0.02 GiB | 11±8.3% |
| Llama-3.2-3B | TQ2_0 | 3.2B | 0.99 GiB | 7.44 GiB | 8.98 GiB | 0.02 GiB | 11±8.3% |
| Qwen3-1.7B | Q3_K_M | 2.0B | 1.00 GiB | 7.44 GiB | 8.98 GiB | 0.02 GiB | 11±8.3% |
| AfriqueGemma-12B | I1-IQ2_XS | 12.2B | 3.88 GiB | 4.50 GiB | 8.98 GiB | 0.02 GiB | 11±8.3% |
| InternVL3_5-14B | Q4_K_M | 15.1B | 8.38 GiB | 0.00 GiB | 8.98 GiB | 0.02 GiB | 11±8.3% |
| Qwen3.5-9B | Q5_K_M | 9.7B | 6.27 GiB | 2.13 GiB | 8.98 GiB | 0.02 GiB | 11±8.3% |
| Llama-3.2-3B-Instruct-abliterated | I1-IQ1_M | 3.6B | 0.98 GiB | 7.44 GiB | 8.98 GiB | 0.02 GiB | 11±8.3% |
| HunyuanVideo-1.5 | Q8_0 | 8.3B | 8.38 GiB | 0.00 GiB | 8.97 GiB | 0.03 GiB | 12±8.3% |
| Llama-3.2-3B-Instruct | UD-IQ2_XXS | 3.2B | 0.97 GiB | 7.44 GiB | 8.97 GiB | 0.03 GiB | 11±8.3% |
| Supertron2-Reranker-2B | I1-Q4_K_S | 2.1B | 0.99 GiB | 7.44 GiB | 8.97 GiB | 0.03 GiB | 11±8.3% |
| Uni-MuMER-Qwen3-VL-2B | I1-Q4_K_S | 2.1B | 0.99 GiB | 7.44 GiB | 8.97 GiB | 0.03 GiB | 11±8.3% |
| Qwen3-VL-2B-Thinking | Q4_K_S | 2.1B | 0.99 GiB | 7.44 GiB | 8.97 GiB | 0.03 GiB | 11±8.3% |
| Qwen3-VL-Reranker-2B | I1-Q4_K_S | 2.1B | 0.99 GiB | 7.44 GiB | 8.97 GiB | 0.03 GiB | 11±8.3% |
| Qwen3-VL-2B-Instruct | Q4_K_S | 2.1B | 0.99 GiB | 7.44 GiB | 8.97 GiB | 0.03 GiB | 11±8.3% |
| Qwen3-VL-Embedding-2B | Q4_K_S | 2.1B | 0.99 GiB | 7.44 GiB | 8.97 GiB | 0.03 GiB | 11±8.3% |
| OpenCaption-2B-VL-SFT-v1.0 | I1-Q4_K_S | 2.1B | 0.99 GiB | 7.44 GiB | 8.97 GiB | 0.03 GiB | 11±8.3% |
| Atomight-V2.5-1.7B | I1-Q4_K_S | 1.7B | 0.99 GiB | 7.44 GiB | 8.97 GiB | 0.03 GiB | 11±8.3% |
| gaon-1.7b-v2-translate | I1-Q4_K_S | 1.7B | 0.99 GiB | 7.44 GiB | 8.97 GiB | 0.03 GiB | 11±8.3% |
| gaon-1.7b-v2-instruct | I1-Q4_K_S | 1.7B | 0.99 GiB | 7.44 GiB | 8.97 GiB | 0.03 GiB | 11±8.3% |
| Lightning-1.7B | Q4_K_S | 1.7B | 0.99 GiB | 7.44 GiB | 8.97 GiB | 0.03 GiB | 11±8.3% |
| DorsetHeatwaveLLM2 | I1-Q4_K_S | 1.7B | 0.99 GiB | 7.44 GiB | 8.97 GiB | 0.03 GiB | 11±8.3% |
| granite-3.1-2b-instruct | Q4_K | 2.5B | 3.10 GiB | 5.31 GiB | 8.96 GiB | 0.04 GiB | 11±8.3% |
| gemma-4-E4B-uncensored | Q8_0 | 7.9B | 7.43 GiB | 0.97 GiB | 8.96 GiB | 0.04 GiB | 11±8.3% |
| gemma-4-E4B-it-qat-heretic_decensored | Q8_0 | 7.9B | 7.43 GiB | 0.97 GiB | 8.96 GiB | 0.04 GiB | 11±8.3% |
| gemma-4-E4B-it-QAT-SOMPOA-heresy | Q8_0 | 7.9B | 7.43 GiB | 0.97 GiB | 8.96 GiB | 0.04 GiB | 11±8.3% |
| Tinman-gemma4-companion-merged | Q8_0 | 7.9B | 7.43 GiB | 0.97 GiB | 8.96 GiB | 0.04 GiB | 11±8.3% |
| starcoder2-7bKV unresolved | Q4_K_M | 7.2B | 4.10 GiB | 4.25 GiB | 8.96 GiB | 0.04 GiB | 12±8.3% |
| orpheus-3b-0.1-ft | UD-IQ1_M | 3.8B | 0.95 GiB | 7.44 GiB | 8.95 GiB | 0.05 GiB | 11±8.3% |
| granite-20b-code-instruct-8k | IQ3_S | 20.1B | 8.32 GiB | 0.00 GiB | 8.95 GiB | 0.05 GiB | 12±8.3% |
| granite-20b-code-base-8k | I1-IQ3_S | 20.1B | 8.32 GiB | 0.00 GiB | 8.95 GiB | 0.05 GiB | 12±8.3% |
| Llama-Doctor-3.2-3B-Instruct | I1-IQ2_XXS | 3.2B | 0.95 GiB | 7.44 GiB | 8.94 GiB | 0.06 GiB | 11±8.3% |
| Llama-3.2-3B-Instruct-roleplay-tuned | I1-IQ2_XXS | 3.2B | 0.95 GiB | 7.44 GiB | 8.94 GiB | 0.06 GiB | 11±8.3% |
| Llama-3.2-3B-Instruct-heretic-ablitered-uncensored | I1-IQ2_XXS | 3.2B | 0.95 GiB | 7.44 GiB | 8.94 GiB | 0.06 GiB | 11±8.3% |
| Llama3.2-3B-creative-writer-v0.1 | I1-IQ2_XXS | 3.2B | 0.95 GiB | 7.44 GiB | 8.94 GiB | 0.06 GiB | 11±8.3% |
| Firefly-V3.2 | I1-IQ2_XXS | 3.2B | 0.95 GiB | 7.44 GiB | 8.94 GiB | 0.06 GiB | 11±8.3% |
| Firefly-V3 | I1-IQ2_XXS | 3.2B | 0.95 GiB | 7.44 GiB | 8.94 GiB | 0.06 GiB | 11±8.3% |
| Ministral-8B-Instruct-2410 | IQ4_XS | 8.0B | 4.14 GiB | 4.21 GiB | 8.94 GiB | 0.06 GiB | 12±8.3% |
| Ling-mini-2.0MoE | Q2_K_L | 16.3B | 5.74 GiB | 2.66 GiB | 8.93 GiB | 0.07 GiB | 17±37% |
| nomic-embed-code | Q5_K_S | 7.1B | 4.60 GiB | 3.72 GiB | 8.92 GiB | 0.08 GiB | 12±8.3% |
| Fara1.5-9B | Q4_K_L | 9.4B | 6.21 GiB | 2.13 GiB | 8.92 GiB | 0.08 GiB | 12±8.3% |
| QwenPaw-Flash-9B | Q4_K_L | 9.4B | 6.21 GiB | 2.13 GiB | 8.92 GiB | 0.08 GiB | 12±8.3% |
| grug-9b | Q4_K_L | 9.4B | 6.21 GiB | 2.13 GiB | 8.92 GiB | 0.08 GiB | 12±8.3% |
| OmniCoder-9B | Q4_K_L | 9.4B | 6.21 GiB | 2.13 GiB | 8.92 GiB | 0.08 GiB | 12±8.3% |
| Ornith-1.0-9B | Q4_K_L | 9.2B | 6.21 GiB | 2.13 GiB | 8.92 GiB | 0.08 GiB | 12±8.3% |
Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.
Questions people ask
- What AI models can a Apple M4 run?
- 784 of 2118 indexed open-weight models fit a Apple M4 at 131,072 context with q8_0 KV cache, the largest being granite-vision-3.3-2b at Q8_0. That covers text, vision-language, image, video and speech models.
- How much usable memory does a Apple M4 actually have?
- Its nameplate is 12 GB, but about 8.37 GiB is available to a model once driver and compositor overhead is accounted for, and only 9 GB of the pool can be allocated to the GPU at all.
- Is a Apple M4 fast for local AI?
- Its memory bandwidth is 120 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.