Intel · workstation

Arc Pro A60 12GB

Arc Pro A60 12GB has 12 GB of VRAM at 384 GB/s — about 11.16 GiB usable after driver and compositor overhead. 1390 of 2118 indexed models fit at 128K context with q4_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
12 GB
GDDR6
Bandwidth
384 GB/s
192-bit bus
Tensor FP16
dense
TDP
130 W
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
video 14text 1172vision language 118embedding 26audio tts 21image 1audio asr 38

What fits at 128K context

largest quantization that fits, per model · 1390 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
Wan2.1-FLF2V-14B-720PQ4_116.4B10.32 GiB0.00 GiB11.16 GiB0.00 GiB20±30%
Qwen3-16B-A3BMoEIQ3_M16.0B6.99 GiB3.38 GiB11.16 GiB0.00 GiB25±37%
ERNIE-21B-A3B-Thinking-Gemini-3-Pro-High-Reasoning-V2I1-IQ3_XS21.8B8.37 GiB1.97 GiB11.16 GiB0.00 GiB20±30%
ERNIE-21B-A3B-Claude-4.5-High-OPUS-ThinkingI1-IQ3_XS21.8B8.37 GiB1.97 GiB11.16 GiB0.00 GiB20±30%
ERNIE-4.5-21B-A3B-ThinkingI1-IQ3_XS21.8B8.37 GiB1.97 GiB11.16 GiB0.00 GiB20±30%
Wan2.1-I2V-14B-480PQ4_116.4B10.32 GiB0.00 GiB11.15 GiB0.01 GiB20±30%
Wan2.1-I2V-14B-720PQ4_116.4B10.32 GiB0.00 GiB11.15 GiB0.01 GiB20±30%
LFM2-24B-A2BMoEQ3_K_S23.8B9.64 GiB0.70 GiB11.15 GiB0.01 GiB58±37%
AceReason-Nemotron-14BUD-IQ1_S14.8B3.55 GiB6.75 GiB11.15 GiB0.01 GiB20±30%
OpenCaption-2B-VL-SFT-v1.0F322.1B6.42 GiB3.94 GiB11.15 GiB0.01 GiB20±30%
Smilodon-9B-v1I1-IQ3_M10.2B4.19 GiB6.11 GiB11.14 GiB0.02 GiB20±30%
bella-bartender-v2I1-IQ3_M9.2B4.19 GiB6.11 GiB11.14 GiB0.02 GiB20±30%
Gemma-The-Writer-9B-HERETIC-Uncensored-AbliteratedI1-IQ3_M9.2B4.19 GiB6.11 GiB11.14 GiB0.02 GiB20±30%
Dirty-Muse-Writer-v01-Uncensored-Erotica-NSFWI1-IQ3_M9.2B4.19 GiB6.11 GiB11.14 GiB0.02 GiB20±30%
Gemma-2-9B-It-SPPO-Iter3I1-IQ3_M9.2B4.19 GiB6.11 GiB11.14 GiB0.02 GiB20±30%
Gemma-SEA-LION-v3-9B-ITI1-IQ3_M9.2B4.19 GiB6.11 GiB11.14 GiB0.02 GiB20±30%
G2-Darkest-Writer-Dirty-Shirley-9B-v2I1-IQ3_M9.2B4.19 GiB6.11 GiB11.14 GiB0.02 GiB20±30%
G2-Darkest-Writer-9B-v1I1-IQ3_M9.2B4.19 GiB6.11 GiB11.14 GiB0.02 GiB20±30%
Tiger-Gemma-9B-v3I1-IQ3_M9.2B4.19 GiB6.11 GiB11.14 GiB0.02 GiB20±30%
gemma-2-9b-it-abliteratedIQ3_M9.2B4.19 GiB6.11 GiB11.14 GiB0.02 GiB20±30%
gemma-2-9b-itIQ3_M9.2B4.19 GiB6.11 GiB11.14 GiB0.02 GiB20±30%
Tiger-Gemma-9B-v1IQ3_M9.2B4.19 GiB6.11 GiB11.14 GiB0.02 GiB20±30%
magnum-v4-9bIQ3_M9.2B4.19 GiB6.11 GiB11.14 GiB0.02 GiB20±30%
Ling-mini-2.0MoEQ4_K_S16.3B8.94 GiB1.41 GiB11.14 GiB0.02 GiB50±37%
Ministral-3-8B-Instruct-2512-BF16-abliteratedI1-Q5_K_S8.9B5.51 GiB4.78 GiB11.13 GiB0.03 GiB20±30%
Ministral-3-8B-Instruct-2512-BF16Q5_K_S8.9B5.51 GiB4.78 GiB11.13 GiB0.03 GiB20±30%
Amaretto-8BI1-Q5_K_S8.9B5.51 GiB4.78 GiB11.13 GiB0.03 GiB20±30%
Ministral-3-8B-Instruct-2512Q5_K_S8.9B5.51 GiB4.78 GiB11.13 GiB0.03 GiB20±30%
Ministral-3-8B-Reasoning-2512Q5_K_S8.9B5.51 GiB4.78 GiB11.13 GiB0.03 GiB20±30%
Qwen3.5-9B-GLM5.1-Distill-v1Q4_K_M9.7B9.16 GiB1.13 GiB11.12 GiB0.04 GiB20±30%
NousCoder-14BIQ2_S14.8B4.62 GiB5.63 GiB11.11 GiB0.05 GiB20±30%
spoomplesmaxx-mini-14BI1-IQ2_S14.8B4.62 GiB5.63 GiB11.11 GiB0.05 GiB20±30%
vanilla-cn-roleplay-0.2I1-IQ2_S14.8B4.62 GiB5.63 GiB11.11 GiB0.05 GiB20±30%
Claria-14bI1-IQ2_S14.8B4.62 GiB5.63 GiB11.11 GiB0.05 GiB20±30%
NTX-2.1-ProI1-IQ2_S14.8B4.62 GiB5.63 GiB11.11 GiB0.05 GiB20±30%
Qwen3-14B-UncensoredI1-IQ2_S14.8B4.62 GiB5.63 GiB11.11 GiB0.05 GiB20±30%
FrogMini-14B-2510I1-IQ2_S4.62 GiB5.63 GiB11.11 GiB0.05 GiB20±30%
Qwen3-14B-abliteratedIQ2_S14.8B4.62 GiB5.63 GiB11.11 GiB0.05 GiB20±30%
Josiefied-Qwen3-14B-abliterated-v3IQ2_S14.8B4.62 GiB5.63 GiB11.11 GiB0.05 GiB20±30%
Hermes-4-14BIQ2_S14.8B4.62 GiB5.63 GiB11.11 GiB0.05 GiB20±30%
Slava-Qwen3-14B-SerbianI1-IQ2_S14.8B4.62 GiB5.63 GiB11.11 GiB0.05 GiB20±30%
Huihui-Qwen3-14B-abliterated-v2I1-IQ2_S14.8B4.62 GiB5.63 GiB11.11 GiB0.05 GiB20±30%
granite-3.3-8b-instructQ4_K_L8.2B4.65 GiB5.63 GiB11.11 GiB0.05 GiB20±30%
granite-3.2-8b-instructQ4_K_L8.2B4.65 GiB5.63 GiB11.11 GiB0.05 GiB20±30%
granite-3.1-8b-instructQ4_K_L8.2B4.65 GiB5.63 GiB11.11 GiB0.05 GiB20±30%
Wan2.2-Distill-ModelsQ5_114.3B10.27 GiB0.00 GiB11.10 GiB0.06 GiB20±30%
Bernini-RQ5_114.3B10.26 GiB0.00 GiB11.10 GiB0.06 GiB20±30%
SkyReels-V2-DF-14B-540PQ5_114.3B10.27 GiB0.00 GiB11.10 GiB0.06 GiB20±30%
granite-4.0-h-smallMoEIQ2_M32.2B9.75 GiB0.56 GiB11.10 GiB0.06 GiB46±37%
Anubis-Mini-8B-v1Q5_K_L8.0B5.76 GiB4.50 GiB11.10 GiB0.06 GiB20±30%
gemma-3-12b-it-vl-Gemini-3-Pro-Preview-Heretic-Uncensored-ThinkingI1-Q5_K_M12.2B7.87 GiB2.38 GiB11.09 GiB0.07 GiB20±30%
gemma-3-12b-it-vl-Deepseek-v3.1-Heretic-Uncensored-ThinkingI1-Q5_K_M12.2B7.87 GiB2.38 GiB11.09 GiB0.07 GiB20±30%
gemma-3-12b-it-ultra-uncensored-hereticQ5_K_M12.2B7.87 GiB2.38 GiB11.09 GiB0.07 GiB20±30%
gemma-3-12b-it-vl-GLM-4.7-Flash-Heretic-Uncensored-ThinkingI1-Q5_K_M12.2B7.87 GiB2.38 GiB11.09 GiB0.07 GiB20±30%
Floppa-12B-Gemma3-UncensoredI1-Q5_K_M12.2B7.87 GiB2.38 GiB11.09 GiB0.07 GiB20±30%
gemma-3-12b-it-hereticI1-Q5_K_M12.2B7.87 GiB2.38 GiB11.09 GiB0.07 GiB20±30%
gemma-3-12b-it-abliteratedQ5_K_M12.2B7.87 GiB2.38 GiB11.09 GiB0.07 GiB20±30%
gemma-3-12b-it-abliterated-v2Q5_K_M11.8B7.87 GiB2.38 GiB11.09 GiB0.07 GiB20±30%
gemma-3-12b-itQ5_K_M12.2B7.87 GiB2.38 GiB11.09 GiB0.07 GiB20±30%
Tess-4-9BQ8_09.7B9.13 GiB1.13 GiB11.09 GiB0.07 GiB20±30%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Arc Pro A60 12GB run?
1390 of 2118 indexed open-weight models fit a Arc Pro A60 12GB at 131,072 context with q4_0 KV cache, the largest being Wan2.1-FLF2V-14B-720P at Q4_1. That covers text, vision-language, image, video and speech models.
How much usable memory does a Arc Pro A60 12GB actually have?
Its nameplate is 12 GB, but about 11.16 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Arc Pro A60 12GB fast for local AI?
Its memory bandwidth is 384 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.