Best local AI models for 4GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 4GB card gives you about 3.72 GiB to work with after driver overhead. 33 indexed models fit at 32K context — the largest being Qwen3.5-9B-Base at 9.7B parameters in IQ3_XS.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 4GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
Qwen3.5-4Bvision + languageIQ2_M4.7B3.63 GiB0.09 GiB
Qwen3.5-0.8Bvision + languageBF16873M2.60 GiB1.12 GiB
gemma-4-E2B-itvision + languageIQ3_XXS5.1B3.51 GiB0.21 GiB
Qwen3.5-2Bvision + languageQ8_02.3B3.11 GiB0.61 GiB
LFM2.5-VL-1.6Bvision + languageBF161.6B3.37 GiB0.35 GiB
MiniCPM-V-4.6vision + languageBF161.3B2.57 GiB1.15 GiB
LocateAnything-3Bvision + languageQ3_K_M3.8B3.54 GiB0.18 GiB
OvisOCR2vision + languageBF16853M2.57 GiB1.15 GiB
gemma-3n-E2B-itvision + languageQ3_K_M5.4B3.54 GiB0.18 GiB
Qwen2-VL-2B-Instructvision + languageQ8_02.2B3.21 GiB0.51 GiB
medgemma-4b-itvision + languageIQ4_XS4.3B3.72 GiB0.00 GiB
Qwen3.5-0.8B-Basevision + languageBF16873M2.60 GiB1.12 GiB
LFM2-VL-1.6Bvision + languageBF161.6B3.37 GiB0.35 GiB
LFM2.5-VL-450Mvision + languageF32449M2.48 GiB1.24 GiB
Qwen3.5-2B-Basevision + languageQ8_02.3B3.05 GiB0.67 GiB
Qwen3.5-9B-Basevision + languageIQ3_XS9.7B3.29 GiB0.43 GiB
gemma-4-E2B-it-qat-q4_0-unquantized-hereticvision + languageI1-IQ3_XXS5.1B3.51 GiB0.21 GiB
LFM2-VL-450Mvision + languageBF16451M1.82 GiB1.90 GiB
medgemma-1.5-4b-itvision + languageQ3_K_L4.3B3.69 GiB0.03 GiB
LFM2-VL-3Bvision + languageQ6_K3.0B3.27 GiB0.45 GiB
Gemma-3-4B-VL-it-Gemini-Pro-Heretic-Uncensored-Thinkingvision + languageQ3_K_L4.3B3.69 GiB0.03 GiB
Qwen3.5-0.8B-hereticvision + languageQ8_0853M2.17 GiB1.55 GiB
Qwen3.5-4B-hereticvision + languageBF164.5B3.01 GiB0.71 GiB
NuExtract3vision + languageQ2_K4.5B3.60 GiB0.12 GiB
Qwen3.5-2B-hereticvision + languageQ8_02.2B3.56 GiB0.16 GiB
InternVL3_5-8Bvision + languageIQ2_M8.5B3.69 GiB0.03 GiB
Nanonets-OCR-svision + languageQ4_K_S3.8B3.65 GiB0.07 GiB
gemma-3-4b-it-abliteratedvision + languageQ3_K_L4.3B3.69 GiB0.03 GiB
MiniCPM-V-4.6-Thinkingvision + languageF161.3B2.57 GiB1.15 GiB
AfriqueQwen3.5-4Bvision + languageI1-IQ2_M5.2B3.69 GiB0.03 GiB
AREX-Turbovision + languageIQ2_M4.5B3.51 GiB0.21 GiB
Fara1.5-4Bvision + languageIQ2_M4.5B3.51 GiB0.21 GiB
Qwen3.5-2B-enkovision + languageQ8_02.1B2.83 GiB0.89 GiB
Spec sheetPredictedwhat these mean

This page models a generic 4GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.