Best local AI models for 6GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 6GB card gives you about 5.58 GiB to work with after driver overhead. 502 indexed models fit at 32K context — the largest being granite-20b-code-instruct-8k at 20.1B parameters in IQ1_M.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 6GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
gemma-4-E4B-ittext generationQ3_K_S8.0B4.92 GiB0.66 GiB
Llama-3.2-1B-Instructtext generationF161.2B4.11 GiB1.47 GiB
ced-basetext generationF3286M1.16 GiB4.42 GiB
Qwen2.5-7B-Instructtext generationQ2_K7.6B5.41 GiB0.17 GiB
UI-TARS-1.5-7Btext generationQ2_K8.3B5.41 GiB0.17 GiB
gemma-3-1b-ittext generationF161000M2.81 GiB2.77 GiB
gemma-4-E2B-it-qat-q4_0-unquantizedtext generationQ4_K5.1B4.22 GiB1.36 GiB
Qwen3-1.7Btext generationQ4_12.0B5.54 GiB0.04 GiB
embeddinggemma-300mtext generationF32303M2.05 GiB3.53 GiB
Llama-3.2-3B-Instructtext generationQ2_K3.2B5.58 GiB0.00 GiB
Qwen3-0.6Btext generationQ8_0752M5.02 GiB0.56 GiB
Wan2.1-T2V-1.3Btext generationQ5_K_M1.4B3.44 GiB2.14 GiB
LFM2.5-1.2B-Instructtext generationBF161.2B3.37 GiB2.21 GiB
Qwen2.5-Coder-7B-Instructtext generationQ2_K7.6B5.41 GiB0.17 GiB
Qwen2.5-1.5B-Instructtext generationF161.5B4.56 GiB1.02 GiB
gemma-3-4b-ittext generationQ8_04.3B5.46 GiB0.12 GiB
MiniCPM5-1B-Claude-Opus-Fable5-Thinkingtext generationF161.1B3.55 GiB2.03 GiB
Ornith-1.0-9Btext generationIQ2_M9.2B5.44 GiB0.14 GiB
granite-4.1-3btext generationQ5_K_M3.4B5.57 GiB0.01 GiB
Qwen2.5-3B-Instructtext generationQ8_03.1B5.30 GiB0.28 GiB
gemma-2-2b-ittext generationQ8_02.6B5.26 GiB0.32 GiB
MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinkingtext generationF161.1B3.55 GiB2.03 GiB
Qwen2.5-0.5B-Instructtext generationF16494M2.08 GiB3.50 GiB
TinyLlama-1.1B-Chat-v1.0text generationF161.1B3.53 GiB2.05 GiB
SmolLM2-135M-Instructtext generationF16135M1.72 GiB3.86 GiB
DeepSeek-R1-Distill-Qwen-7Btext generationQ2_K7.6B5.41 GiB0.17 GiB
GLM-4.6V-Flashtext generationUD-IQ2_XXS10.3B5.36 GiB0.22 GiB
Qwen2.5-Coder-3B-Instructtext generationQ8_03.1B5.30 GiB0.28 GiB
Qwen2.5-Coder-1.5B-Instructtext generationF161.5B4.56 GiB1.02 GiB
gemma-3-270m-ittext generationF16268M1.38 GiB4.20 GiB
umt5-xxltext generationQ6_K5.7B5.20 GiB0.38 GiB
DeepSeek-R1-Distill-Qwen-1.5Btext generationBF161.8B4.99 GiB0.59 GiB
LFM2.5-8B-A1BMoEtext generationUD-IQ4_NL8.5B5.23 GiB0.35 GiB
SmolVLM-500M-Instructtext generationF16507M2.78 GiB2.80 GiB
tinygemma3_cifartext generationQ8_039M0.93 GiB4.65 GiB
Ministral-3-3B-Reasoning-2512text generationQ2_K4.3B5.42 GiB0.16 GiB
Qwen3-0.6B-Basetext generationF16596M5.39 GiB0.19 GiB
Qwen2-7B-Instructtext generationIQ3_XXS7.6B5.50 GiB0.08 GiB
VibeThinker-3Btext generationQ8_03.1B5.00 GiB0.58 GiB
Yi-1.5-6B-Chattext generationQ3_K_S6.1B5.35 GiB0.23 GiB
Ministral-3-3B-Instruct-2512-BF16text generationIQ3_XS4.3B5.53 GiB0.05 GiB
Qwen2.5-VL-3B-Instructtext generationQ8_03.8B5.00 GiB0.58 GiB
t5-v1_1-xxltext generationQ2_K4.8B5.56 GiB0.02 GiB
Qwen3.6-27B-DFlashtext generationF161.7B4.26 GiB1.32 GiB
Qwen3-Reranker-0.6Btext generationF16596M5.39 GiB0.19 GiB
LFM2.5-230Mtext generationBF16230M1.57 GiB4.01 GiB
LFM2.5-350Mtext generationBF16354M1.82 GiB3.76 GiB
Nanbeige4.2-3Btext generationIQ3_M4.2B5.51 GiB0.07 GiB
MiniCPM5-1Btext generationF161.1B3.55 GiB2.03 GiB
TinyLlama-1.1B-Chat-v0.3text generationQ8_01.1B2.57 GiB3.01 GiB
Qwen3.5-9B-Claude-4.6-Opus-Deckard-V4.2-Uncensored-Heretic-Thinkingtext generationI1-IQ3_XXS9.4B5.50 GiB0.08 GiB
Qwen2.5-VL-7B-Instruct-abliteratedtext generationI1-IQ3_XXS8.3B5.50 GiB0.08 GiB
Agents-A1-4Btext generationQ4_K_M4.5B4.33 GiB1.25 GiB
SmolLM3-3Btext generationQ6_K_L3.1B5.48 GiB0.10 GiB
gemma-2-2b-it-abliteratedtext generationQ8_02.6B5.26 GiB0.32 GiB
Qwen3.5-9B-Claude-4.6-HighIQ-THINKING-HERETIC-UNCENSOREDtext generationI1-IQ3_XXS9.4B5.37 GiB0.21 GiB
Ministral-3-3B-Instruct-2512text generationQ2_K3.8B5.42 GiB0.16 GiB
Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliteratedtext generationI1-Q2_K9.7B5.48 GiB0.10 GiB
LFM2.5-Audio-1.5Btext generationF161.5B3.52 GiB2.06 GiB
SmolLM2-360M-Instructtext generationF16362M2.69 GiB2.89 GiB
Spec sheetPredictedwhat these mean

This page models a generic 6GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.