Best local AI models for 6GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 6GB card gives you about 5.58 GiB to work with after driver overhead. 67 indexed models fit at 32K context — the largest being InternVL3_5-14B at 15.1B parameters in IQ2_S.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 6GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
Qwen3.5-9Bvision + languageUD-IQ2_M9.7B5.53 GiB0.05 GiB
Qwen3.5-4Bvision + languageQ6_K_L4.7B5.50 GiB0.08 GiB
Qwen3.5-0.8Bvision + languageBF16873M2.60 GiB2.98 GiB
gemma-4-E2B-itvision + languageQ6_K_L5.1B5.29 GiB0.29 GiB
Qwythos-9B-v2vision + languageI1-Q2_K9.7B5.48 GiB0.10 GiB
Qwen2.5-VL-7B-Instructvision + languageUD-IQ3_XXS8.3B5.55 GiB0.03 GiB
Qwen3-VL-2B-Instructvision + languageQ5_K_L2.1B5.54 GiB0.04 GiB
Qwen3.5-2Bvision + languageBF162.3B4.80 GiB0.78 GiB
LFM2.5-VL-1.6Bvision + languageBF161.6B3.37 GiB2.21 GiB
gemma-4-E4B-it-ultra-uncensored-hereticvision + languageQ2_K8.0B5.42 GiB0.16 GiB
Unlimited-OCRMoEvision + languageQ8_03.3B5.58 GiB0.00 GiB
Qwopus3.5-9B-v3.5vision + languageQ2_K9.7B5.40 GiB0.18 GiB
Qwable-9B-Claude-Fable-5vision + languageI1-IQ3_XXS9.4B5.50 GiB0.08 GiB
Qwen3.5-9B-Claude-4.6-OS-Auto-Variable-HERETIC-UNCENSORED-THINKINGvision + languageI1-IQ3_XXS9.4B5.37 GiB0.21 GiB
Holo-3.1-9Bvision + languageI1-IQ3_XXS9.4B5.50 GiB0.08 GiB
MiniCPM-V-4.6vision + languageBF161.3B2.57 GiB3.01 GiB
Qwen3.5-9B-ultra-uncensored-hereticvision + languageQ2_K9.4B5.40 GiB0.18 GiB
LocateAnything-3Bvision + languageQ5_K_M3.8B4.21 GiB1.37 GiB
OvisOCR2vision + languageF32853M3.97 GiB1.61 GiB
gemma-3n-E2B-itvision + languageQ6_K_L5.4B5.27 GiB0.31 GiB
Qwen2-VL-2B-Instructvision + languageF162.2B4.56 GiB1.02 GiB
Qwen3-VL-Embedding-2Bvision + languageQ5_K_M2.1B5.47 GiB0.11 GiB
medgemma-4b-itvision + languageQ8_04.3B5.46 GiB0.12 GiB
chandra-ocr-2vision + languageQ6_K5.3B5.52 GiB0.06 GiB
Qwen3.5-0.8B-Basevision + languageBF16873M2.60 GiB2.98 GiB
LFM2-VL-1.6Bvision + languageBF161.6B3.37 GiB2.21 GiB
Qwen2-VL-7B-Instructvision + languageQ2_K8.3B5.41 GiB0.17 GiB
LFM2.5-VL-450Mvision + languageF32449M2.48 GiB3.10 GiB
Tess-4-9Bvision + languageI1-Q2_K9.7B5.48 GiB0.10 GiB
gemma-3n-E4B-itvision + languageQ4_K_M7.8B5.56 GiB0.02 GiB
Qwen3-VL-2B-Thinkingvision + languageQ5_K_M2.1B5.47 GiB0.11 GiB
Qwen3.5-2B-Basevision + languageF162.3B4.69 GiB0.89 GiB
Qwen3.5-4Bvision + languageQ6_K4.7B5.04 GiB0.54 GiB
Qwen3.5-9B-Basevision + languageI1-IQ3_XXS9.7B5.50 GiB0.08 GiB
InternVL3_5-14Bvision + languageIQ2_S15.1B5.47 GiB0.11 GiB
gemma-4-E2B-it-qat-q4_0-unquantized-hereticvision + languageI1-Q4_15.1B4.27 GiB1.31 GiB
LFM2-VL-450Mvision + languageBF16451M1.82 GiB3.76 GiB
medgemma-1.5-4b-itvision + languageQ8_04.3B5.46 GiB0.12 GiB
Fara-7Bvision + languageIQ3_XXS8.3B5.50 GiB0.08 GiB
ToriiGate-0.5vision + languageQ6_K5.2B5.52 GiB0.06 GiB
LFM2-VL-3Bvision + languageQ8_03.0B3.85 GiB1.73 GiB
llava-llama-3-8b-v1_1-transformersvision + languageQ4_K_M8.4B5.42 GiB0.16 GiB
Qwen2-VL-7B-Instruct-abliteratedvision + languageQ2_K8.3B5.41 GiB0.17 GiB
Gemma-3-4B-VL-it-Gemini-Pro-Heretic-Uncensored-Thinkingvision + languageQ8_04.3B5.46 GiB0.12 GiB
GLM-4.1V-9B-Thinkingvision + languageUD-IQ2_XXS10.3B5.36 GiB0.22 GiB
Fara1.5-9Bvision + languageIQ2_M9.4B5.35 GiB0.23 GiB
Qwen3.5-0.8B-hereticvision + languageQ8_0853M2.17 GiB3.41 GiB
Qwen3.5-4B-hereticvision + languageQ5_K_M4.5B4.68 GiB0.90 GiB
NuExtract3vision + languageQ6_K4.5B5.04 GiB0.54 GiB
Qwen3.5-2B-hereticvision + languageQ8_02.2B3.56 GiB2.02 GiB
InternVL3_5-8Bvision + languageQ4_K_M8.5B5.53 GiB0.05 GiB
glm-4v-9bvision + languageQ3_K_M13.9B5.48 GiB0.10 GiB
grug-9bvision + languageIQ2_M9.4B5.35 GiB0.23 GiB
Nanonets-OCR-svision + languageQ8_03.8B5.00 GiB0.58 GiB
gemma-3-4b-it-abliteratedvision + languageQ8_04.3B5.46 GiB0.12 GiB
UI-TARS-7B-DPOvision + languageQ2_K8.3B5.41 GiB0.17 GiB
liftvision + languageQ2_K9.7B5.48 GiB0.10 GiB
MiniCPM-V-4.6-Thinkingvision + languageF161.3B2.57 GiB3.01 GiB
AfriqueQwen3.5-4Bvision + languageI1-Q6_K5.2B5.52 GiB0.06 GiB
MiniCPM-V-4vision + languageQ8_04.1B5.38 GiB0.20 GiB
Spec sheetPredictedwhat these mean

This page models a generic 6GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.