Best local AI models for 20GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 20GB card gives you about 18.60 GiB to work with after driver overhead. 16 indexed models fit at 32K context — the largest being lingbot-world-v2-14b-causal-fast at 18.5B parameters in Q6_K.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 20GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
Wan2.2-Animate-14Bvideo generationQ8_017.3B18.27 GiB0.33 GiB
Wan2.1-I2V-14B-480Pvideo generationQ8_016.4B17.73 GiB0.87 GiB
Bernini-Rvideo generationQ6_K14.3B12.02 GiB6.58 GiB
Wan2.2-Distill-Modelsvideo generationQ8_014.3B15.19 GiB3.41 GiB
Wan2.2-TI2V-5Bvideo generationQ8_05.0B5.87 GiB12.73 GiB
Wan2.1-T2V-14Bvideo generationQ8_014.3B15.62 GiB2.98 GiB
Wan-Dancer-14Bvideo generationQ3_K_M17.2B16.66 GiB1.94 GiB
Wan2.1-I2V-14B-720Pvideo generationQ8_016.4B17.73 GiB0.87 GiB
Wan2.1-VACE-14Bvideo generationQ8_017.3B18.22 GiB0.38 GiB
Wan2.2-S2V-14Bvideo generationQ6_K16.3B15.94 GiB2.66 GiB
Wan2.1-FLF2V-14B-720Pvideo generationQ8_016.4B17.74 GiB0.86 GiB
JoyAI-Echovideo generationQ4_K_M12.2B15.46 GiB3.14 GiB
HunyuanVideo-1.5video generationQ8_08.3B9.22 GiB9.38 GiB
Wan2.2-TI2V-5B-Turbovideo generationQ8_05.0B5.87 GiB12.73 GiB
SkyReels-V2-DF-14B-540Pvideo generationQ8_014.3B15.19 GiB3.41 GiB
lingbot-world-v2-14b-causal-fastvideo generationQ6_K18.5B15.27 GiB3.33 GiB
Spec sheetPredictedwhat these mean

This page models a generic 20GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.