Best local AI models for 10GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 10GB card gives you about 9.30 GiB to work with after driver overhead. 1211 indexed models fit at 32K context — the largest being Skywork-R1V3-38B at 38.4B parameters in IQ2_XXS.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 10GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
Qwen3.5-9Bvision + languageQ6_K9.7B8.99 GiB0.31 GiB
gemma-4-12B-itvision + languageQ3_K_M12.0B9.18 GiB0.12 GiB
nemotron-3.5-asr-streaming-0.6bspeech recognitionF32638M3.22 GiB6.08 GiB
Qwen3.5-4Bvision + languageQ8_04.7B6.12 GiB3.18 GiB
Qwythos-9B-Claude-Mythos-5-1Mvision + languageQ5_K9.4B8.02 GiB1.28 GiB
gemma-4-E4B-ittext generationQ8_08.0B8.95 GiB0.35 GiB
Qwen3-4Btext generationQ8_04.0B9.30 GiB0.00 GiB
Qwen3-8Btext generationQ3_K_M8.2B9.17 GiB0.13 GiB
Qwen3.5-0.8Bvision + languageBF16873M2.60 GiB6.70 GiB
Llama-3.2-1B-Instructtext generationF161.2B4.11 GiB5.19 GiB
gemma-4-E2B-itvision + languageQ8_05.1B5.74 GiB3.56 GiB
gemma-4-E4B-it-qat-q4_0-unquantizedvision + languageQ4_07.9B6.12 GiB3.18 GiB
Qwopus3.6-35B-A3B-v1MoEvision + languageI1-IQ1_M36.0B9.10 GiB0.20 GiB
parakeet-tdt-0.6b-v3speech recognitionF32627M3.18 GiB6.12 GiB
Llama-3.1-8B-Instructtext generationQ4_K_S8.0B9.21 GiB0.09 GiB
ced-basetext generationF3286M1.16 GiB8.14 GiB
Ace-Step1.5speech synthesisF32160M2.71 GiB6.59 GiB
Qwen2.5-7B-Instructtext generationQ6_K_L7.6B8.67 GiB0.63 GiB
Qwen3-TTS-12Hz-0.6B-Basespeech synthesisQ8_0915M8.68 GiB0.62 GiB
Qwythos-9B-v2vision + languageQ5_K_L9.7B8.93 GiB0.37 GiB
UI-TARS-1.5-7Btext generationQ6_K8.3B8.43 GiB0.87 GiB
gemma-3-1b-ittext generationF161000M2.81 GiB6.49 GiB
gemma-4-E2B-it-qat-q4_0-unquantizedtext generationQ4_K5.1B4.22 GiB5.08 GiB
Qwen3-1.7Btext generationBF162.0B8.08 GiB1.22 GiB
whisper-mediumspeech recognitionF32764M3.69 GiB5.61 GiB
embeddinggemma-300mtext generationF32303M2.05 GiB7.25 GiB
Llama-3.2-3B-Instructtext generationQ8_03.2B7.50 GiB1.80 GiB
Qwen3-0.6Btext generationBF16752M5.68 GiB3.62 GiB
Voxtral-Mini-4B-Realtime-2602speech recognitionQ8_04.4B8.47 GiB0.83 GiB
Wan2.1-T2V-1.3Btext generationQ5_01.4B8.58 GiB0.72 GiB
LFM2.5-1.2B-Instructtext generationBF161.2B3.37 GiB5.93 GiB
Qwen2.5-Coder-7B-Instructtext generationQ6_K_L7.6B8.67 GiB0.63 GiB
Qwen3-VL-4B-Instructvision + languageQ8_04.4B9.30 GiB0.00 GiB
Qwen2.5-1.5B-Instructtext generationF161.5B4.56 GiB4.74 GiB
Jan-v3-4B-base-instructtext generationQ6_K_L4.4B8.86 GiB0.44 GiB
gemma-3-4b-ittext generationBF164.3B8.85 GiB0.45 GiB
whisper-large-v3speech recognitionF161.5B3.74 GiB5.56 GiB
MiniCPM5-1B-Claude-Opus-Fable5-Thinkingtext generationF161.1B3.55 GiB5.75 GiB
Qwen2.5-VL-7B-Instructvision + languageQ6_K_L8.3B8.67 GiB0.63 GiB
Qwen3-VL-2B-Instructvision + languageBF162.1B7.50 GiB1.80 GiB
Ornith-1.0-9Btext generationQ6_K9.2B9.01 GiB0.29 GiB
jina-embeddings-v5-text-smallembeddingsF16596M5.39 GiB3.91 GiB
whisper-large-v3-turbospeech recognitionF16809M2.36 GiB6.94 GiB
Qwen3-4B-Instruct-2507text generationQ8_04.0B9.30 GiB0.00 GiB
granite-4.1-3btext generationQ8_03.4B6.67 GiB2.63 GiB
gemma-3-12b-itvision + languageQ3_K_M12.2B8.91 GiB0.39 GiB
Qwen3.5-2Bvision + languageBF162.3B4.80 GiB4.50 GiB
Qwen2.5-3B-Instructtext generationF163.1B7.69 GiB1.61 GiB
gemma-2-2b-ittext generationQ8_02.6B5.26 GiB4.04 GiB
MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinkingtext generationF161.1B3.55 GiB5.75 GiB
Qwen2.5-0.5B-Instructtext generationF16494M2.08 GiB7.22 GiB
DeepSeek-R1-0528-Qwen3-8Btext generationQ3_K_M8.2B9.17 GiB0.13 GiB
embeddinggemma-300m-qat-q8_0-unquantizedembeddingsQ8_0303M1.22 GiB8.08 GiB
Qwen3-VL-8B-Instructtext generationQ3_K_M8.8B9.17 GiB0.13 GiB
Qwen3-ASR-1.7Bspeech recognitionF162.3B5.23 GiB4.07 GiB
gemma-4-12b-heretic-abliteratedtext generationI1-Q3_K_M12.0B8.98 GiB0.32 GiB
TinyLlama-1.1B-Chat-v1.0text generationF161.1B3.53 GiB5.77 GiB
Phi-4-mini-instructtext generationQ8_03.8B8.61 GiB0.69 GiB
Qwen3-ASR-0.6Bspeech recognitionF16938M2.32 GiB6.98 GiB
SmolLM2-135M-Instructtext generationF16135M1.72 GiB7.58 GiB
Spec sheetPredictedwhat these mean

This page models a generic 10GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.