Best local AI models for 64GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 64GB card gives you about 59.52 GiB to work with after driver overhead. 185 indexed models fit at 32K context — the largest being Step-3.7-Flash at 201B parameters in IQ1_M.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 64GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
Qwen3.6-35B-A3BMoEvision + languageQ8_036.0B38.50 GiB21.02 GiB
Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-MTPvision + languageQ8_027.8B58.77 GiB0.75 GiB
Qwen3.5-9Bvision + languageBF169.7B18.98 GiB40.54 GiB
gemma-4-26B-A4B-itMoEvision + languageBF1626.5B50.98 GiB8.54 GiB
gemma-4-12B-itvision + languageBF1612.0B25.51 GiB34.01 GiB
Qwen3.5-4Bvision + languageBF164.7B9.88 GiB49.64 GiB
Qwythos-9B-Claude-Mythos-5-1Mvision + languageBF169.4B35.67 GiB23.85 GiB
gemma-4-31B-itvision + languageQ8_031.3B37.93 GiB21.59 GiB
Muse-Glimmer-30Bvision + languageBF1629.8B53.28 GiB6.24 GiB
gemma-4-26B-A4B-it-qat-q4_0-unquantizedMoEvision + languageQ4_026.5B15.78 GiB43.74 GiB
Qwen3.5-122B-A10BMoEvision + languageUD-IQ4_XS125B59.25 GiB0.27 GiB
Qwen3.5-0.8Bvision + languageBF16873M2.60 GiB56.92 GiB
gemma-4-E2B-itvision + languageBF165.1B9.71 GiB49.81 GiB
gemma-4-31B-it-qat-q4_0-unquantizedvision + languageQ4_032.7B23.49 GiB36.03 GiB
gemma-4-E4B-it-qat-q4_0-unquantizedvision + languageQ4_07.9B6.12 GiB53.40 GiB
Qwen3-VL-30B-A3B-InstructMoEvision + languageQ8_031.1B34.05 GiB25.47 GiB
Qwopus3.6-35B-A3B-v1MoEvision + languageQ8_036.0B36.64 GiB22.88 GiB
Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTPvision + languageQ8_09.7B21.60 GiB37.92 GiB
Qwen3.5-35B-A3BMoEvision + languageQ8_036.0B36.65 GiB22.87 GiB
Qwythos-9B-v2vision + languageBF169.7B35.67 GiB23.85 GiB
ThinkingCap-Qwen3.6-27Bvision + languageF1627.4B53.77 GiB5.75 GiB
Qwopus3.6-27B-Codervision + languageQ8_027.8B29.92 GiB29.60 GiB
Qwen3-VL-4B-Instructvision + languageBF164.4B12.81 GiB46.71 GiB
Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinkingvision + languageQ8_039.5B43.77 GiB15.75 GiB
Qwen2.5-VL-7B-Instructvision + languageBF168.3B16.80 GiB42.72 GiB
Qwen3-VL-2B-Instructvision + languageBF162.1B7.50 GiB52.02 GiB
Qwen3.5-27Bvision + languageBF1627.8B53.77 GiB5.75 GiB
gemma-3-12b-itvision + languageBF1612.2B25.24 GiB34.28 GiB
Qwen3.5-2Bvision + languageBF162.3B4.80 GiB54.72 GiB
Qwen3.6-27B-Heretic2-Uncensored-Finetune-Thinkingvision + languageQ8_027.4B30.68 GiB28.84 GiB
Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-DistilledMoEvision + languageQ8_036.0B36.63 GiB22.89 GiB
Qwen3.6-35B-A3B-uncensored-heretic-Native-MTP-PreservedMoEvision + languageQ8_035.1B36.64 GiB22.88 GiB
Qwen3.5-9Bvision + languageQ8_09.7B10.95 GiB48.57 GiB
Qwen3.6-35B-A3B-uncensored-hereticMoEvision + languageQ8_035.1B35.80 GiB23.72 GiB
gemma-4-31B-it-uncensored-hereticvision + languageQ8_031.3B37.45 GiB22.07 GiB
Step-3.7-Flashvision + languageIQ1_M201B58.27 GiB1.25 GiB
Qwopus3.6-27B-v2vision + languageQ8_027.8B29.92 GiB29.60 GiB
Qwen3.6-27B-uncensored-heretic-v2-Native-MTP-Preservedvision + languageBF1627.4B53.77 GiB5.75 GiB
Qwopus3.5-122B-A10B-Kimi-K2.6-destill-healed-abliteratedMoEvision + languageQ3_K_M123B57.28 GiB2.24 GiB
Mistral-Small-3.2-24B-Instruct-2506vision + languageBF1624.0B49.83 GiB9.69 GiB
LFM2.5-VL-1.6Bvision + languageBF161.6B3.37 GiB56.15 GiB
gemma-4-E4B-it-ultra-uncensored-hereticvision + languageBF168.0B15.34 GiB44.18 GiB
Unlimited-OCRMoEvision + languageBF163.3B8.14 GiB51.38 GiB
diffusiongemma-26B-A4B-itMoEvision + languageBF1625.8B49.40 GiB10.12 GiB
Qwopus3.5-9B-v3.5vision + languageBF169.7B18.53 GiB40.99 GiB
Qwen3.6-27B-uncensored-heretic-v2vision + languageBF1627.4B52.98 GiB6.54 GiB
Tess-4-27Bvision + languageBF1627.8B53.77 GiB5.75 GiB
Qwen3.5-9B-GLM5.1-Distill-v1vision + languageQ8_09.7B17.56 GiB41.96 GiB
Qwable-9B-Claude-Fable-5vision + languageF169.4B18.53 GiB40.99 GiB
Llama-4-Scout-17B-16E-InstructMoEvision + languageQ3_K_M109B57.41 GiB2.11 GiB
Qwen3-VL-32B-Instructvision + languageQ8_033.4B41.32 GiB18.20 GiB
UI-TARS-72B-DPOvision + languageQ5_K_S73.4B58.78 GiB0.74 GiB
Qwen3.5-9B-Claude-4.6-OS-Auto-Variable-HERETIC-UNCENSORED-THINKINGvision + languageBF169.4B18.53 GiB40.99 GiB
Qwen3.6-35B-A3BMoEvision + languageQ8_036.0B36.63 GiB22.89 GiB
gemma-4-12b-it-uncensoredvision + languageF1612.0B25.51 GiB34.01 GiB
gemma-4-26B-A4B-it-qat-q4_0-unquantized-uncensored-hereticMoEvision + languageNVFP425.8B18.79 GiB40.73 GiB
Holo-3.1-9Bvision + languageF169.4B18.53 GiB40.99 GiB
MiniCPM-V-4_5vision + languageF168.7B35.85 GiB23.67 GiB
MiniCPM-V-4.6vision + languageBF161.3B2.57 GiB56.95 GiB
Ornith-Agents-A1-3.6-35B-A3B-dare_tiesMoEvision + languageQ8_034.7B37.03 GiB22.49 GiB
Spec sheetPredictedwhat these mean

This page models a generic 64GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.