Best local AI models for 16GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 16GB card gives you about 14.88 GiB to work with after driver overhead. 151 indexed models fit at 32K context — the largest being Skywork-R1V3-38B at 38.4B parameters in IQ3_M.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 16GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
Qwen3.6-35B-A3BMoEvision + languageUD-IQ3_XXS36.0B14.53 GiB0.35 GiB
Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-MTPvision + languageI1-IQ3_M27.8B14.75 GiB0.13 GiB
Qwen3.5-9Bvision + languageQ8_09.7B10.95 GiB3.93 GiB
gemma-4-26B-A4B-itMoEvision + languageIQ3_M26.5B14.70 GiB0.18 GiB
gemma-4-12B-itvision + languageQ6_K_L12.0B13.08 GiB1.80 GiB
Qwen3.5-4Bvision + languageBF164.7B9.88 GiB5.00 GiB
Qwythos-9B-Claude-Mythos-5-1Mvision + languageQ5_K_M9.4B14.12 GiB0.76 GiB
Muse-Glimmer-30Bvision + languageUD-IQ3_M29.8B14.54 GiB0.34 GiB
Qwen3.5-0.8Bvision + languageBF16873M2.60 GiB12.28 GiB
gemma-4-E2B-itvision + languageBF165.1B9.71 GiB5.17 GiB
gemma-4-E4B-it-qat-q4_0-unquantizedvision + languageQ4_07.9B6.12 GiB8.76 GiB
Qwen3-VL-30B-A3B-InstructMoEvision + languageQ2_K_L31.1B14.35 GiB0.53 GiB
Qwopus3.6-35B-A3B-v1MoEvision + languageI1-IQ3_XXS36.0B14.12 GiB0.76 GiB
Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTPvision + languageQ4_K_M9.7B14.70 GiB0.18 GiB
Qwen3.5-35B-A3BMoEvision + languageQ2_K_L36.0B14.47 GiB0.41 GiB
Qwythos-9B-v2vision + languageQ5_K_M9.7B14.16 GiB0.72 GiB
ThinkingCap-Qwen3.6-27Bvision + languageIQ3_XXS27.4B14.62 GiB0.26 GiB
Qwopus3.6-27B-Codervision + languageIQ2_M27.8B12.60 GiB2.28 GiB
Qwen3-VL-4B-Instructvision + languageBF164.4B12.81 GiB2.07 GiB
Qwen2.5-VL-7B-Instructvision + languageQ8_08.3B10.15 GiB4.73 GiB
Qwen3-VL-2B-Instructvision + languageBF162.1B7.50 GiB7.38 GiB
Qwen3.5-27Bvision + languageIQ3_XXS27.8B14.82 GiB0.06 GiB
gemma-3-12b-itvision + languageQ6_K12.2B12.31 GiB2.57 GiB
Qwen3.5-2Bvision + languageBF162.3B4.80 GiB10.08 GiB
Qwen3.6-27B-Heretic2-Uncensored-Finetune-Thinkingvision + languageIQ3_M27.4B14.87 GiB0.01 GiB
Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-DistilledMoEvision + languageQ2_K36.0B13.77 GiB1.11 GiB
Qwen3.5-9Bvision + languageQ8_09.7B10.95 GiB3.93 GiB
Qwen3.6-27B-uncensored-heretic-v2-Native-MTP-Preservedvision + languageI1-IQ3_M27.4B14.75 GiB0.13 GiB
Mistral-Small-3.2-24B-Instruct-2506vision + languageQ2_K_L24.0B14.81 GiB0.07 GiB
LFM2.5-VL-1.6Bvision + languageBF161.6B3.37 GiB11.51 GiB
gemma-4-E4B-it-ultra-uncensored-hereticvision + languageQ8_08.0B8.80 GiB6.08 GiB
Unlimited-OCRMoEvision + languageBF163.3B8.14 GiB6.74 GiB
diffusiongemma-26B-A4B-itMoEvision + languageQ3_K_M25.8B14.71 GiB0.17 GiB
Qwopus3.5-9B-v3.5vision + languageQ8_09.7B10.95 GiB3.93 GiB
Tess-4-27Bvision + languageIQ3_XXS27.8B14.62 GiB0.26 GiB
Qwen3.5-9B-GLM5.1-Distill-v1vision + languageQ6_K9.7B13.98 GiB0.90 GiB
Qwable-9B-Claude-Fable-5vision + languageQ8_09.4B10.71 GiB4.17 GiB
Qwen3.5-9B-Claude-4.6-OS-Auto-Variable-HERETIC-UNCENSORED-THINKINGvision + languageQ8_09.4B11.60 GiB3.28 GiB
Qwen3.6-35B-A3BMoEvision + languageQ2_K36.0B13.77 GiB1.11 GiB
gemma-4-12b-it-uncensoredvision + languageI1-Q6_K12.0B12.43 GiB2.45 GiB
Holo-3.1-9Bvision + languageQ8_09.4B10.71 GiB4.17 GiB
MiniCPM-V-4_5vision + languageQ4_K_M8.7B14.70 GiB0.18 GiB
MiniCPM-V-4.6vision + languageBF161.3B2.57 GiB12.31 GiB
Qwen3.5-9B-ultra-uncensored-hereticvision + languageQ8_09.4B10.71 GiB4.17 GiB
Qwen3-VL-8B-Thinkingvision + languageQ8_08.8B13.44 GiB1.44 GiB
Jan-v2-VL-highvision + languageQ8_08.8B13.44 GiB1.44 GiB
Huihui-gemma-4-26B-A4B-it-abliteratedMoEvision + languageUD-IQ4_NL26.5B14.83 GiB0.05 GiB
LocateAnything-3Bvision + languageF163.8B10.46 GiB4.42 GiB
OvisOCR2vision + languageF32853M3.97 GiB10.91 GiB
gemma-3n-E2B-itvision + languageF165.4B9.53 GiB5.35 GiB
Huihui-Qwen3.5-35B-A3B-abliteratedMoEvision + languageI1-IQ3_XS36.0B14.86 GiB0.02 GiB
Qwen2-VL-2B-Instructvision + languageF162.2B4.56 GiB10.32 GiB
Qwen3-VL-30B-A3B-ThinkingMoEvision + languageQ2_K_L31.1B14.35 GiB0.53 GiB
Gemma4-12B-Uncensoredvision + languageI1-Q6_K12.0B12.43 GiB2.45 GiB
gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-hereticvision + languageI1-IQ1_M31.3B14.25 GiB0.63 GiB
Fara1.5-27Bvision + languageQ2_K_L27.4B14.82 GiB0.06 GiB
Gemma4-Gutenberg-31B-Hereticvision + languageI1-IQ1_M31.3B14.25 GiB0.63 GiB
Qwen3-VL-Embedding-2Bvision + languageF162.1B7.50 GiB7.38 GiB
Huihui-Qwen3-VL-4B-Instruct-abliteratedvision + languageF164.4B12.81 GiB2.07 GiB
pixtral-12bvision + languageQ5_K_L12.7B14.36 GiB0.52 GiB
Spec sheetPredictedwhat these mean

This page models a generic 16GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.