Best local AI models for 10GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 10GB card gives you about 9.30 GiB to work with after driver overhead. 100 indexed models fit at 32K context — the largest being Skywork-R1V3-38B at 38.4B parameters in IQ2_XXS.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 10GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
Qwen3.5-9Bvision + languageQ6_K9.7B8.99 GiB0.31 GiB
gemma-4-12B-itvision + languageQ3_K_M12.0B9.18 GiB0.12 GiB
Qwen3.5-4Bvision + languageQ8_04.7B6.12 GiB3.18 GiB
Qwythos-9B-Claude-Mythos-5-1Mvision + languageQ5_K9.4B8.02 GiB1.28 GiB
Qwen3.5-0.8Bvision + languageBF16873M2.60 GiB6.70 GiB
gemma-4-E2B-itvision + languageQ8_05.1B5.74 GiB3.56 GiB
gemma-4-E4B-it-qat-q4_0-unquantizedvision + languageQ4_07.9B6.12 GiB3.18 GiB
Qwopus3.6-35B-A3B-v1MoEvision + languageI1-IQ1_M36.0B9.10 GiB0.20 GiB
Qwythos-9B-v2vision + languageQ5_K_L9.7B8.93 GiB0.37 GiB
Qwen3-VL-4B-Instructvision + languageQ8_04.4B9.30 GiB0.00 GiB
Qwen2.5-VL-7B-Instructvision + languageQ6_K_L8.3B8.67 GiB0.63 GiB
Qwen3-VL-2B-Instructvision + languageBF162.1B7.50 GiB1.80 GiB
gemma-3-12b-itvision + languageQ3_K_M12.2B8.91 GiB0.39 GiB
Qwen3.5-2Bvision + languageBF162.3B4.80 GiB4.50 GiB
Qwen3.5-9Bvision + languageQ6_K9.7B8.88 GiB0.42 GiB
LFM2.5-VL-1.6Bvision + languageBF161.6B3.37 GiB5.93 GiB
gemma-4-E4B-it-ultra-uncensored-hereticvision + languageQ8_08.0B8.80 GiB0.50 GiB
Unlimited-OCRMoEvision + languageBF163.3B8.14 GiB1.16 GiB
Qwopus3.5-9B-v3.5vision + languageQ6_K9.7B8.88 GiB0.42 GiB
Qwen3.5-9B-GLM5.1-Distill-v1vision + languageQ3_K_M9.7B6.14 GiB3.16 GiB
Qwable-9B-Claude-Fable-5vision + languageI1-Q6_K9.4B8.69 GiB0.61 GiB
Qwen3.5-9B-Claude-4.6-OS-Auto-Variable-HERETIC-UNCENSORED-THINKINGvision + languageI1-Q6_K9.4B8.69 GiB0.61 GiB
gemma-4-12b-it-uncensoredvision + languageI1-Q3_K_M12.0B8.98 GiB0.32 GiB
Holo-3.1-9Bvision + languageI1-Q6_K9.4B8.69 GiB0.61 GiB
MiniCPM-V-4_5vision + languageQ3_K_M8.7B9.17 GiB0.13 GiB
MiniCPM-V-4.6vision + languageBF161.3B2.57 GiB6.73 GiB
Qwen3.5-9B-ultra-uncensored-hereticvision + languageQ6_K9.4B8.69 GiB0.61 GiB
Qwen3-VL-8B-Thinkingvision + languageQ3_K_M8.8B9.17 GiB0.13 GiB
Jan-v2-VL-highvision + languageQ3_K_M8.8B9.17 GiB0.13 GiB
LocateAnything-3Bvision + languageBF163.8B8.28 GiB1.02 GiB
OvisOCR2vision + languageF32853M3.97 GiB5.33 GiB
gemma-3n-E2B-itvision + languageQ8_05.4B5.69 GiB3.61 GiB
Huihui-Qwen3.5-35B-A3B-abliteratedMoEvision + languageI1-IQ1_M36.0B8.94 GiB0.36 GiB
Qwen2-VL-2B-Instructvision + languageF162.2B4.56 GiB4.74 GiB
Gemma4-12B-Uncensoredvision + languageI1-Q3_K_M12.0B8.98 GiB0.32 GiB
Qwen3-VL-Embedding-2Bvision + languageF162.1B7.50 GiB1.80 GiB
Huihui-Qwen3-VL-4B-Instruct-abliteratedvision + languageQ8_04.4B9.30 GiB0.00 GiB
medgemma-4b-itvision + languageBF164.3B8.85 GiB0.45 GiB
chandra-ocr-2vision + languageQ8_05.3B6.62 GiB2.68 GiB
Qwen3.5-0.8B-Basevision + languageBF16873M2.60 GiB6.70 GiB
LFM2-VL-1.6Bvision + languageBF161.6B3.37 GiB5.93 GiB
Qwen2-VL-7B-Instructvision + languageQ6_K_L8.3B8.67 GiB0.63 GiB
Qwen3-VL-4B-Thinkingvision + languageQ8_04.4B9.30 GiB0.00 GiB
LFM2.5-VL-450Mvision + languageF32449M2.48 GiB6.82 GiB
Tess-4-9Bvision + languageQ6_K9.7B9.13 GiB0.17 GiB
Qwen3.6-9B-Heretic-Uncensored-Thinking-Sweet-Madnessvision + languageQ4_K_M9.1B6.45 GiB2.85 GiB
gemma-3n-E4B-itvision + languageQ8_07.8B8.18 GiB1.12 GiB
Qwen3-VL-2B-Thinkingvision + languageBF162.1B7.50 GiB1.80 GiB
Huihui-Qwen3-VL-8B-Instruct-abliteratedvision + languageI1-Q3_K_M8.8B9.17 GiB0.13 GiB
Qwen3.5-2B-Basevision + languageF162.3B4.69 GiB4.61 GiB
Qwen3.5-4Bvision + languageQ8_04.7B5.99 GiB3.31 GiB
Qwen3.5-9B-Basevision + languageI1-Q6_K9.7B8.69 GiB0.61 GiB
InternVL3_5-14Bvision + languageQ4_K_M15.1B9.23 GiB0.07 GiB
WorldSim-Opus-3.6-35B-A3BMoEvision + languageI1-IQ1_M35.1B9.10 GiB0.20 GiB
gemma-4-E2B-it-qat-q4_0-unquantized-hereticvision + languageI1-Q4_15.1B4.27 GiB5.03 GiB
LFM2-VL-450Mvision + languageBF16451M1.82 GiB7.48 GiB
medgemma-1.5-4b-itvision + languageBF164.3B8.85 GiB0.45 GiB
MiMo-VL-7B-RLvision + languageI1-IQ4_XS8.3B9.30 GiB0.00 GiB
InternVL3_5-30B-A3Bvision + languageIQ2_S30.8B8.99 GiB0.31 GiB
Fara-7Bvision + languageQ6_K_L8.3B8.67 GiB0.63 GiB
Spec sheetPredictedwhat these mean

This page models a generic 10GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.