Best local AI models for 24GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 24GB card gives you about 22.32 GiB to work with after driver overhead. 16 indexed models fit at 32K context — the largest being lingbot-world-v2-14b-causal-fast at 18.5B parameters in Q8_0.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 24GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
Wan2.2-Animate-14Bvideo generationQ8_017.3B18.27 GiB4.05 GiB
Wan2.1-I2V-14B-480Pvideo generationQ8_016.4B17.73 GiB4.59 GiB
Bernini-Rvideo generationQ5_K_M14.3B20.96 GiB1.36 GiB
Wan2.2-Distill-Modelsvideo generationQ8_014.3B15.19 GiB7.13 GiB
Wan2.2-TI2V-5Bvideo generationQ8_05.0B5.87 GiB16.45 GiB
Wan2.1-T2V-14Bvideo generationQ8_014.3B15.62 GiB6.70 GiB
Wan-Dancer-14Bvideo generationQ4_K_S17.2B20.27 GiB2.05 GiB
Wan2.1-I2V-14B-720Pvideo generationQ8_016.4B17.73 GiB4.59 GiB
Wan2.1-VACE-14Bvideo generationQ8_017.3B18.22 GiB4.10 GiB
Wan2.2-S2V-14Bvideo generationQ8_016.3B19.10 GiB3.22 GiB
Wan2.1-FLF2V-14B-720Pvideo generationQ8_016.4B17.74 GiB4.58 GiB
JoyAI-Echovideo generationQ6_K12.2B19.07 GiB3.25 GiB
HunyuanVideo-1.5video generationQ8_08.3B9.22 GiB13.10 GiB
Wan2.2-TI2V-5B-Turbovideo generationQ8_05.0B5.87 GiB16.45 GiB
SkyReels-V2-DF-14B-540Pvideo generationQ8_014.3B15.19 GiB7.13 GiB
lingbot-world-v2-14b-causal-fastvideo generationQ8_018.5B19.40 GiB2.92 GiB
Spec sheetPredictedwhat these mean

This page models a generic 24GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.