Best local AI models for 6GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 6GB card gives you about 5.58 GiB to work with after driver overhead. 647 indexed models fit at 32K context — the largest being granite-20b-code-instruct-8k at 20.1B parameters in IQ1_M.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 6GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
Qwen3.5-9Bvision + languageUD-IQ2_M9.7B5.53 GiB0.05 GiB
nemotron-3.5-asr-streaming-0.6bspeech recognitionF32638M3.22 GiB2.36 GiB
Qwen3.5-4Bvision + languageQ6_K_L4.7B5.50 GiB0.08 GiB
gemma-4-E4B-ittext generationQ3_K_S8.0B4.92 GiB0.66 GiB
Qwen3.5-0.8Bvision + languageBF16873M2.60 GiB2.98 GiB
Llama-3.2-1B-Instructtext generationF161.2B4.11 GiB1.47 GiB
gemma-4-E2B-itvision + languageQ6_K_L5.1B5.29 GiB0.29 GiB
parakeet-tdt-0.6b-v3speech recognitionF32627M3.18 GiB2.40 GiB
ced-basetext generationF3286M1.16 GiB4.42 GiB
Ace-Step1.5speech synthesisF32160M2.71 GiB2.87 GiB
Qwen2.5-7B-Instructtext generationQ2_K7.6B5.41 GiB0.17 GiB
Qwen3-TTS-12Hz-0.6B-Basespeech synthesisQ4_K_M915M5.57 GiB0.01 GiB
Qwythos-9B-v2vision + languageI1-Q2_K9.7B5.48 GiB0.10 GiB
UI-TARS-1.5-7Btext generationQ2_K8.3B5.41 GiB0.17 GiB
gemma-3-1b-ittext generationF161000M2.81 GiB2.77 GiB
gemma-4-E2B-it-qat-q4_0-unquantizedtext generationQ4_K5.1B4.22 GiB1.36 GiB
Qwen3-1.7Btext generationQ4_12.0B5.54 GiB0.04 GiB
whisper-mediumspeech recognitionF32764M3.69 GiB1.89 GiB
embeddinggemma-300mtext generationF32303M2.05 GiB3.53 GiB
Llama-3.2-3B-Instructtext generationQ2_K3.2B5.58 GiB0.00 GiB
Qwen3-0.6Btext generationQ8_0752M5.02 GiB0.56 GiB
Wan2.1-T2V-1.3Btext generationQ5_K_M1.4B3.44 GiB2.14 GiB
LFM2.5-1.2B-Instructtext generationBF161.2B3.37 GiB2.21 GiB
Qwen2.5-Coder-7B-Instructtext generationQ2_K7.6B5.41 GiB0.17 GiB
Qwen2.5-1.5B-Instructtext generationF161.5B4.56 GiB1.02 GiB
gemma-3-4b-ittext generationQ8_04.3B5.46 GiB0.12 GiB
whisper-large-v3speech recognitionF161.5B3.74 GiB1.84 GiB
MiniCPM5-1B-Claude-Opus-Fable5-Thinkingtext generationF161.1B3.55 GiB2.03 GiB
Qwen2.5-VL-7B-Instructvision + languageUD-IQ3_XXS8.3B5.55 GiB0.03 GiB
Qwen3-VL-2B-Instructvision + languageQ5_K_L2.1B5.54 GiB0.04 GiB
Ornith-1.0-9Btext generationIQ2_M9.2B5.44 GiB0.14 GiB
jina-embeddings-v5-text-smallembeddingsF16596M5.39 GiB0.19 GiB
whisper-large-v3-turbospeech recognitionF16809M2.36 GiB3.22 GiB
granite-4.1-3btext generationQ5_K_M3.4B5.57 GiB0.01 GiB
Qwen3.5-2Bvision + languageBF162.3B4.80 GiB0.78 GiB
Qwen2.5-3B-Instructtext generationQ8_03.1B5.30 GiB0.28 GiB
gemma-2-2b-ittext generationQ8_02.6B5.26 GiB0.32 GiB
MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinkingtext generationF161.1B3.55 GiB2.03 GiB
Qwen2.5-0.5B-Instructtext generationF16494M2.08 GiB3.50 GiB
embeddinggemma-300m-qat-q8_0-unquantizedembeddingsQ8_0303M1.22 GiB4.36 GiB
Qwen3-ASR-1.7Bspeech recognitionF162.3B5.23 GiB0.35 GiB
TinyLlama-1.1B-Chat-v1.0text generationF161.1B3.53 GiB2.05 GiB
Qwen3-ASR-0.6Bspeech recognitionF16938M2.32 GiB3.26 GiB
SmolLM2-135M-Instructtext generationF16135M1.72 GiB3.86 GiB
DeepSeek-R1-Distill-Qwen-7Btext generationQ2_K7.6B5.41 GiB0.17 GiB
GLM-4.6V-Flashtext generationUD-IQ2_XXS10.3B5.36 GiB0.22 GiB
Qwen2.5-Coder-3B-Instructtext generationQ8_03.1B5.30 GiB0.28 GiB
KaLM-embedding-multilingual-mini-instruct-v2.5embeddingsQ8_0494M1.65 GiB3.93 GiB
nomic-embed-text-v1.5embeddingsF32137M2.40 GiB3.18 GiB
Qwen2.5-Coder-1.5B-Instructtext generationF161.5B4.56 GiB1.02 GiB
GigaAM-v3speech recognitionF32223M1.67 GiB3.91 GiB
gemma-3-270m-ittext generationF16268M1.38 GiB4.20 GiB
umt5-xxltext generationQ6_K5.7B5.20 GiB0.38 GiB
DeepSeek-R1-Distill-Qwen-1.5Btext generationBF161.8B4.99 GiB0.59 GiB
LFM2.5-8B-A1BMoEtext generationUD-IQ4_NL8.5B5.23 GiB0.35 GiB
jina-embeddings-v5-text-nanoembeddingsF16212M2.30 GiB3.28 GiB
SmolVLM-500M-Instructtext generationF16507M2.78 GiB2.80 GiB
tinygemma3_cifartext generationQ8_039M0.93 GiB4.65 GiB
LFM2.5-VL-1.6Bvision + languageBF161.6B3.37 GiB2.21 GiB
Ministral-3-3B-Reasoning-2512text generationQ2_K4.3B5.42 GiB0.16 GiB
Spec sheetPredictedwhat these mean

This page models a generic 6GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.