Best local AI models for 12GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 12GB card gives you about 11.16 GiB to work with after driver overhead. 123 indexed models fit at 32K context — the largest being Skywork-R1V3-38B at 38.4B parameters in IQ2_S.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 12GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
Qwen3.6-35B-A3BMoEvision + languageIQ1_M36.0B10.20 GiB0.96 GiB
Qwen3.5-9Bvision + languageQ8_09.7B10.95 GiB0.21 GiB
gemma-4-12B-itvision + languageQ5_K_S12.0B11.14 GiB0.02 GiB
Qwen3.5-4Bvision + languageBF164.7B9.88 GiB1.28 GiB
Qwythos-9B-Claude-Mythos-5-1Mvision + languageQ5_K9.4B8.02 GiB3.14 GiB
Muse-Glimmer-30Bvision + languageIQ2_S29.8B10.73 GiB0.43 GiB
Qwen3.5-0.8Bvision + languageBF16873M2.60 GiB8.56 GiB
gemma-4-E2B-itvision + languageBF165.1B9.71 GiB1.45 GiB
gemma-4-E4B-it-qat-q4_0-unquantizedvision + languageQ4_07.9B6.12 GiB5.04 GiB
Qwopus3.6-35B-A3B-v1MoEvision + languageI1-IQ2_XXS36.0B10.27 GiB0.89 GiB
Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTPvision + languageIQ2_M9.7B11.04 GiB0.12 GiB
Qwen3.5-35B-A3BMoEvision + languageIQ1_M36.0B10.20 GiB0.96 GiB
Qwythos-9B-v2vision + languageQ6_K_L9.7B9.59 GiB1.57 GiB
Qwen3-VL-4B-Instructvision + languageQ8_04.4B9.30 GiB1.86 GiB
Qwen2.5-VL-7B-Instructvision + languageQ8_08.3B10.15 GiB1.01 GiB
Qwen3-VL-2B-Instructvision + languageBF162.1B7.50 GiB3.66 GiB
gemma-3-12b-itvision + languageQ5_K_S12.2B10.98 GiB0.18 GiB
Qwen3.5-2Bvision + languageBF162.3B4.80 GiB6.36 GiB
Qwen3.5-9Bvision + languageQ8_09.7B10.95 GiB0.21 GiB
Mistral-Small-3.2-24B-Instruct-2506vision + languageUD-IQ1_S24.0B11.09 GiB0.07 GiB
LFM2.5-VL-1.6Bvision + languageBF161.6B3.37 GiB7.79 GiB
gemma-4-E4B-it-ultra-uncensored-hereticvision + languageQ8_08.0B8.80 GiB2.36 GiB
Unlimited-OCRMoEvision + languageBF163.3B8.14 GiB3.02 GiB
Qwopus3.5-9B-v3.5vision + languageQ8_09.7B10.95 GiB0.21 GiB
Qwen3.5-9B-GLM5.1-Distill-v1vision + languageQ4_K_M9.7B11.00 GiB0.16 GiB
Qwable-9B-Claude-Fable-5vision + languageQ8_09.4B10.71 GiB0.45 GiB
Qwen3.5-9B-Claude-4.6-OS-Auto-Variable-HERETIC-UNCENSORED-THINKINGvision + languageI1-Q6_K9.4B8.69 GiB2.47 GiB
gemma-4-12b-it-uncensoredvision + languageI1-Q5_K_S12.0B11.08 GiB0.08 GiB
Holo-3.1-9Bvision + languageQ8_09.4B10.71 GiB0.45 GiB
MiniCPM-V-4_5vision + languageQ5_08.7B10.66 GiB0.50 GiB
MiniCPM-V-4.6vision + languageBF161.3B2.57 GiB8.59 GiB
Qwen3.5-9B-ultra-uncensored-hereticvision + languageQ8_09.4B10.71 GiB0.45 GiB
Qwen3-VL-8B-Thinkingvision + languageQ5_K_M8.8B10.78 GiB0.38 GiB
Jan-v2-VL-highvision + languageQ5_18.8B11.10 GiB0.06 GiB
Huihui-gemma-4-26B-A4B-it-abliteratedMoEvision + languageI1-IQ2_XXS26.5B10.99 GiB0.17 GiB
LocateAnything-3Bvision + languageF163.8B10.46 GiB0.70 GiB
OvisOCR2vision + languageF32853M3.97 GiB7.19 GiB
gemma-3n-E2B-itvision + languageF165.4B9.53 GiB1.63 GiB
Huihui-Qwen3.5-35B-A3B-abliteratedMoEvision + languageI1-IQ2_XS36.0B11.09 GiB0.07 GiB
Qwen2-VL-2B-Instructvision + languageF162.2B4.56 GiB6.60 GiB
Qwen3-VL-30B-A3B-ThinkingMoEvision + languageIQ2_XXS31.1B10.84 GiB0.32 GiB
Gemma4-12B-Uncensoredvision + languageI1-Q5_K_S12.0B11.08 GiB0.08 GiB
Qwen3-VL-Embedding-2Bvision + languageF162.1B7.50 GiB3.66 GiB
Huihui-Qwen3-VL-4B-Instruct-abliteratedvision + languageQ8_04.4B9.30 GiB1.86 GiB
pixtral-12bvision + languageQ3_K_S12.7B11.00 GiB0.16 GiB
medgemma-4b-itvision + languageBF164.3B8.85 GiB2.31 GiB
chandra-ocr-2vision + languageBF165.3B10.84 GiB0.32 GiB
Qwen3.5-0.8B-Basevision + languageBF16873M2.60 GiB8.56 GiB
LFM2-VL-1.6Bvision + languageBF161.6B3.37 GiB7.79 GiB
Mistral-Small-3.1-24B-Instruct-2503vision + languageUD-IQ1_S24.0B11.09 GiB0.07 GiB
Huihui-Qwen3-VL-30B-A3B-Instruct-abliteratedMoEvision + languageI1-IQ1_M31.1B10.39 GiB0.77 GiB
Qwen2-VL-7B-Instructvision + languageQ8_08.3B10.15 GiB1.01 GiB
Mistral-Small-3.2-24B-Instruct-2506-ultra-uncensored-hereticvision + languageI1-IQ1_S24.0B10.83 GiB0.33 GiB
Qwen3-VL-4B-Thinkingvision + languageQ8_04.4B9.30 GiB1.86 GiB
LFM2.5-VL-450Mvision + languageF32449M2.48 GiB8.68 GiB
Tess-4-9Bvision + languageQ8_09.7B10.97 GiB0.19 GiB
Qwen3.6-9B-Heretic-Uncensored-Thinking-Sweet-Madnessvision + languageQ4_K_M9.1B6.45 GiB4.71 GiB
gemma-3n-E4B-itvision + languageQ8_07.8B8.18 GiB2.98 GiB
Qwen3-VL-2B-Thinkingvision + languageBF162.1B7.50 GiB3.66 GiB
Huihui-Qwen3-VL-8B-Instruct-abliteratedvision + languageI1-Q5_K_M8.8B10.78 GiB0.38 GiB
Spec sheetPredictedwhat these mean

This page models a generic 12GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.