Apple · apple

Apple M4

Apple M4 has 16 GB of unified memory at 120 GB/s — about 11.16 GiB usable after driver and compositor overhead. 1813 of 2118 indexed models fit at 16K context with q4_0 KV. Note only 12 GB of its 16 GB is allocatable to the GPU.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
16 GB
LPDDR5X-7500
Bandwidth
120 GB/s
128-bit bus
Tensor FP16
dense
TDP
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1559video 15vision language 151audio asr 39audio tts 21image 2embedding 26

What fits at 16K context

largest quantization that fits, per model · 1813 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
Huihui-Qwen3-Coder-30B-A3B-Instruct-abliteratedMoEI1-IQ3_XXS30.5B11.04 GiB0.42 GiB12.00 GiB0.00 GiB28±37%
Qwen3-Coder-30B-A3B-Instruct-RTPurboMoEI1-IQ3_XXS30.5B11.04 GiB0.42 GiB12.00 GiB0.00 GiB28±37%
Wan2.1-VACE-14BQ5_K_S17.3B11.41 GiB0.00 GiB12.00 GiB0.00 GiB9±8.3%
Rocinante-XL-16B-v1Q5_K_S16.1B10.45 GiB0.95 GiB11.99 GiB0.01 GiB9±8.3%
Qwen3.8-27BUD-IQ3_XXS27.8B11.10 GiB0.28 GiB11.99 GiB0.01 GiB9±8.3%
Kimi-Linear-48B-A3B-InstructMoEIQ2_XXS49.1B11.30 GiB0.13 GiB11.99 GiB0.01 GiB9±8.3%
Llama3.2-30B-A3B-II-Dark-Champion-INSTRUCT-Heretic-Abliterated-UncensoredMoEI1-Q2_K30.0B10.60 GiB0.83 GiB11.98 GiB0.02 GiB19±37%
Mistral-MOE-4X7B-Dark-MultiVerse-Uncensored-Enhanced32-24BMoEQ3_K_M24.2B10.83 GiB0.56 GiB11.98 GiB0.02 GiB5±37%
InternVL3_5-30B-A3BIQ3_XXS30.8B11.38 GiB0.00 GiB11.97 GiB0.03 GiB9±8.3%
GLM-4.7-Flash-REAP-23B-A3B-absolute-heresyMoEI1-Q3_K_L23.0B11.18 GiB0.23 GiB11.97 GiB0.03 GiB28±37%
gpt-oss-20b-hereticMoEIQ3_XS20.9B11.32 GiB0.11 GiB11.97 GiB0.03 GiB24±37%
Seed-OSS-36B-Instruct-biprojected-norm-preserving-abliteratedI1-IQ2_XS36.2B10.19 GiB1.13 GiB11.97 GiB0.03 GiB9±8.3%
Seed-OSS-36B-InstructIQ2_XS36.2B10.19 GiB1.13 GiB11.97 GiB0.03 GiB9±8.3%
Hermes-4.3-36B-hereticI1-IQ2_XS36.2B10.19 GiB1.13 GiB11.97 GiB0.03 GiB9±8.3%
Hermes-4.3-36BIQ2_XS36.2B10.19 GiB1.13 GiB11.97 GiB0.03 GiB9±8.3%
solar-pro-preview-instructKV unresolvedQ3_K_M22.1B9.95 GiB1.41 GiB11.97 GiB0.03 GiB9±8.3%
Huihui-GLM-4.7-Flash-abliterated-57BMoEI1-IQ1_S57.3B10.79 GiB0.59 GiB11.97 GiB0.03 GiB26±37%
OpenAI-gpt-oss-20B-Claude-4.5-Opus-Heretic-UncensoredMoEI1-Q4_020.9B11.31 GiB0.11 GiB11.96 GiB0.04 GiB24±37%
gpt-oss-20b-uncensoredMoEI1-Q4_020.9B11.31 GiB0.11 GiB11.96 GiB0.04 GiB24±37%
gpt-oss-safeguard-20bMoEI1-Q4_021.5B11.31 GiB0.11 GiB11.96 GiB0.04 GiB24±37%
Huihui-gpt-oss-20b-BF16-abliterated-v2MoEI1-Q4_020.9B11.31 GiB0.11 GiB11.96 GiB0.04 GiB24±37%
metatune-gpt20b-R1.09MoEI1-Q4_021.5B11.31 GiB0.11 GiB11.96 GiB0.04 GiB24±37%
Carnice-Qwen3.6-MoE-35B-A3BMoEI1-Q2_K_S36.0B11.32 GiB0.09 GiB11.96 GiB0.04 GiB40±37%
Qwen35B-Agent-R2-AbliteratedMoEI1-Q2_K_S34.7B11.32 GiB0.09 GiB11.96 GiB0.04 GiB40±37%
Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-DistilledMoEI1-Q2_K_S36.0B11.32 GiB0.09 GiB11.96 GiB0.04 GiB40±37%
Darwin-35B-A3B-OpusMoEI1-Q2_K_S36.0B11.32 GiB0.09 GiB11.96 GiB0.04 GiB40±37%
Qwen35B-Agent-R2MoEI1-Q2_K_S34.7B11.32 GiB0.09 GiB11.96 GiB0.04 GiB40±37%
Carnice-MoE-35B-A3BMoEI1-Q2_K_S36.0B11.32 GiB0.09 GiB11.96 GiB0.04 GiB40±37%
spoomplesmaxx-flash-35B-A3MoEI1-Q2_K_S35.1B11.32 GiB0.09 GiB11.96 GiB0.04 GiB40±37%
Huihui-Qwen3.6-35B-A3B-Claude-4.7-Opus-abliteratedMoEI1-Q2_K_S36.0B11.32 GiB0.09 GiB11.96 GiB0.04 GiB40±37%
Qwen3.6-35B-A3B-Uncensored-AggressiveMoEI1-Q2_K_S35.1B11.32 GiB0.09 GiB11.96 GiB0.04 GiB40±37%
WorldSim-Opus-3.6-35B-A3BMoEI1-Q2_K_S35.1B11.32 GiB0.09 GiB11.96 GiB0.04 GiB40±37%
Qwen3.6-35B-A3B-abliterated-MAXMoEI1-Q2_K_S35.1B11.32 GiB0.09 GiB11.96 GiB0.04 GiB40±37%
Huihui-Qwen3.6-35B-A3B-abliteratedMoEI1-Q2_K_S36.0B11.32 GiB0.09 GiB11.96 GiB0.04 GiB40±37%
Qwopus3.6-35B-A3B-v1MoEI1-Q2_K_S36.0B11.32 GiB0.09 GiB11.96 GiB0.04 GiB40±37%
Qwen3.6-35B-A3B-StyleTuneMoEI1-Q2_K_S35.1B11.32 GiB0.09 GiB11.96 GiB0.04 GiB40±37%
Qwen3.6-35B-A3B-abliteratedMoEI1-Q2_K_S35.1B11.32 GiB0.09 GiB11.96 GiB0.04 GiB40±37%
0GM-1.0-35B-A3B-0427MoEI1-Q2_K_S36.0B11.32 GiB0.09 GiB11.96 GiB0.04 GiB40±37%
ERNIE-4.5-21B-A3B-ThinkingIQ4_XS21.8B11.14 GiB0.25 GiB11.95 GiB0.05 GiB9±8.3%
ERNIE-4.5-21B-A3B-PTIQ4_XS21.9B11.14 GiB0.25 GiB11.95 GiB0.05 GiB9±8.3%
Ministral-3-14B-Instruct-2512-BF16Q6_K_L13.9B10.63 GiB0.70 GiB11.94 GiB0.06 GiB9±8.3%
Qwen3-48B-A4B-Savant-Commander-Distill-12X-Closed-Open-Heretic-UncensoredMoEI1-Q2_K_S33.6B10.74 GiB0.63 GiB11.93 GiB0.07 GiB18±37%
Wan2.1-T2V-1.3BQ8_01.4B11.37 GiB0.00 GiB11.93 GiB0.07 GiB9±8.3%
Goetia-26B-A4B-v1.4MoEI1-IQ3_XS26.0B11.13 GiB0.26 GiB11.93 GiB0.07 GiB9±8.3%
G4-Moonlight-Dusk-26B-A4B-hereticMoEI1-IQ3_XS26.5B11.13 GiB0.26 GiB11.93 GiB0.07 GiB9±8.3%
Pantheon-Reasoning-26B-A4B-1.1-hereticMoEI1-IQ3_XS26.5B11.13 GiB0.26 GiB11.93 GiB0.07 GiB9±8.3%
G4-Moonlight-Dusk-26B-A4BMoEI1-IQ3_XS26.5B11.13 GiB0.26 GiB11.93 GiB0.07 GiB9±8.3%
Chimera-X-26B-A4BMoEI1-IQ3_XS26.5B11.13 GiB0.26 GiB11.93 GiB0.07 GiB9±8.3%
Pantheon-Reasoning-26B-A4B-1.1MoEI1-IQ3_XS26.5B11.13 GiB0.26 GiB11.93 GiB0.07 GiB9±8.3%
Gemma-4-26B-A4B-StyleTune-V2MoEI1-IQ3_XS26.5B11.13 GiB0.26 GiB11.93 GiB0.07 GiB9±8.3%
Gemma-4-26B-A4B-StyleTuneMoEI1-IQ3_XS26.5B11.13 GiB0.26 GiB11.93 GiB0.07 GiB9±8.3%
gemma-4-26b-a4b-heretic-styletune-v2-headMoEI1-IQ3_XS25.8B11.13 GiB0.26 GiB11.93 GiB0.07 GiB9±8.3%
gpt-oss-20bMoEQ8_021.5B11.28 GiB0.11 GiB11.93 GiB0.07 GiB24±37%
medgemma-27b-itI1-IQ3_XS28.8B10.77 GiB0.52 GiB11.92 GiB0.08 GiB9±8.3%
gemma-3-27b-it-abliterated-refined-visionI1-IQ3_XS27.4B10.77 GiB0.52 GiB11.92 GiB0.08 GiB9±8.3%
Nidum-Gemma-3-27B-it-UncensoredI1-IQ3_XS27.4B10.77 GiB0.52 GiB11.92 GiB0.08 GiB9±8.3%
gemma-3-27b-it-abliteratedIQ3_XS27.4B10.77 GiB0.52 GiB11.92 GiB0.08 GiB9±8.3%
AtomicGPT-gemma3-27bI1-IQ3_XS27.4B10.77 GiB0.52 GiB11.92 GiB0.08 GiB9±8.3%
Unbound-v1.12.0-27BI1-IQ3_XS27.4B10.77 GiB0.52 GiB11.92 GiB0.08 GiB9±8.3%
Mira-v1.12-Ties-27BI1-IQ3_XS27.4B10.77 GiB0.52 GiB11.92 GiB0.08 GiB9±8.3%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Apple M4 run?
1813 of 2118 indexed open-weight models fit a Apple M4 at 16,384 context with q4_0 KV cache, the largest being Huihui-Qwen3-Coder-30B-A3B-Instruct-abliterated at I1-IQ3_XXS. That covers text, vision-language, image, video and speech models.
How much usable memory does a Apple M4 actually have?
Its nameplate is 16 GB, but about 11.16 GiB is available to a model once driver and compositor overhead is accounted for, and only 12 GB of the pool can be allocated to the GPU at all.
Is a Apple M4 fast for local AI?
Its memory bandwidth is 120 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.