Best local AI models for 128GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 128GB card gives you about 119.04 GiB to work with after driver overhead. 191 indexed models fit at 32K context — the largest being MiniMax-M3 at 427B parameters in IQ2_XXS.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 128GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
Qwen3.6-35B-A3BMoEvision + languageBF1636.0B67.61 GiB51.43 GiB
Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-MTPvision + languageQ6_K27.8B90.87 GiB28.17 GiB
Qwen3.5-9Bvision + languageBF169.7B18.98 GiB100.06 GiB
gemma-4-26B-A4B-itMoEvision + languageBF1626.5B50.98 GiB68.06 GiB
gemma-4-12B-itvision + languageBF1612.0B25.51 GiB93.53 GiB
Qwen3.5-4Bvision + languageBF164.7B9.88 GiB109.16 GiB
Qwythos-9B-Claude-Mythos-5-1Mvision + languageBF169.4B35.67 GiB83.37 GiB
gemma-4-31B-itvision + languageBF1631.3B64.25 GiB54.79 GiB
Muse-Glimmer-30Bvision + languageBF1629.8B53.28 GiB65.76 GiB
gemma-4-26B-A4B-it-qat-q4_0-unquantizedMoEvision + languageQ4_026.5B15.78 GiB103.26 GiB
Qwen3.5-122B-A10BMoEvision + languageQ6_K_L125B102.88 GiB16.16 GiB
Qwen3.5-0.8Bvision + languageBF16873M2.60 GiB116.44 GiB
gemma-4-E2B-itvision + languageBF165.1B9.71 GiB109.33 GiB
gemma-4-31B-it-qat-q4_0-unquantizedvision + languageQ4_032.7B23.49 GiB95.55 GiB
gemma-4-E4B-it-qat-q4_0-unquantizedvision + languageQ4_07.9B6.12 GiB112.92 GiB
Qwen3-VL-30B-A3B-InstructMoEvision + languageBF1631.1B60.69 GiB58.35 GiB
Qwopus3.6-35B-A3B-v1MoEvision + languageF1636.0B67.61 GiB51.43 GiB
Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTPvision + languageQ8_09.7B21.60 GiB97.44 GiB
Qwen3.5-35B-A3BMoEvision + languageBF1636.0B67.61 GiB51.43 GiB
Qwythos-9B-v2vision + languageBF169.7B35.67 GiB83.37 GiB
ThinkingCap-Qwen3.6-27Bvision + languageF1627.4B53.77 GiB65.27 GiB
Qwopus3.6-27B-Codervision + languageQ8_027.8B29.92 GiB89.12 GiB
Qwen3-VL-4B-Instructvision + languageBF164.4B12.81 GiB106.23 GiB
Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinkingvision + languageQ8_039.5B43.77 GiB75.27 GiB
Qwen2.5-VL-7B-Instructvision + languageBF168.3B16.80 GiB102.24 GiB
Qwen3-VL-2B-Instructvision + languageBF162.1B7.50 GiB111.54 GiB
Qwen3.5-27Bvision + languageBF1627.8B53.77 GiB65.27 GiB
gemma-3-12b-itvision + languageBF1612.2B25.24 GiB93.80 GiB
Qwen3.5-2Bvision + languageBF162.3B4.80 GiB114.24 GiB
Qwen3.6-27B-Heretic2-Uncensored-Finetune-Thinkingvision + languageQ8_027.4B30.68 GiB88.36 GiB
Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-DistilledMoEvision + languageF1636.0B67.61 GiB51.43 GiB
Qwen3.6-35B-A3B-uncensored-heretic-Native-MTP-PreservedMoEvision + languageBF1635.1B67.62 GiB51.42 GiB
Qwen3.5-9Bvision + languageQ8_09.7B10.95 GiB108.09 GiB
Qwen3.6-35B-A3B-uncensored-hereticMoEvision + languageBF1635.1B66.04 GiB53.00 GiB
gemma-4-31B-it-uncensored-hereticvision + languageBF1631.3B64.25 GiB54.79 GiB
Step-3.7-Flashvision + languageIQ4_XS201B113.79 GiB5.25 GiB
Qwopus3.6-27B-v2vision + languageQ8_027.8B29.92 GiB89.12 GiB
Qwen3.6-27B-uncensored-heretic-v2-Native-MTP-Preservedvision + languageBF1627.4B53.77 GiB65.27 GiB
Qwopus3.5-122B-A10B-Kimi-K2.6-destill-healed-abliteratedMoEvision + languageQ5_K_M123B84.19 GiB34.85 GiB
Mistral-Small-3.2-24B-Instruct-2506vision + languageBF1624.0B49.83 GiB69.21 GiB
LFM2.5-VL-1.6Bvision + languageBF161.6B3.37 GiB115.67 GiB
gemma-4-E4B-it-ultra-uncensored-hereticvision + languageBF168.0B15.34 GiB103.70 GiB
Unlimited-OCRMoEvision + languageBF163.3B8.14 GiB110.90 GiB
diffusiongemma-26B-A4B-itMoEvision + languageBF1625.8B49.40 GiB69.64 GiB
Qwen3.5-397B-A17BMoEvision + languageIQ2_XS403B118.58 GiB0.46 GiB
Ornith-1.0-397BMoEvision + languageUD-IQ2_M397B117.62 GiB1.42 GiB
Qwopus3.5-9B-v3.5vision + languageBF169.7B18.53 GiB100.51 GiB
Qwen3.6-27B-uncensored-heretic-v2vision + languageBF1627.4B52.98 GiB66.06 GiB
Tess-4-27Bvision + languageBF1627.8B53.77 GiB65.27 GiB
Qwen3.5-9B-GLM5.1-Distill-v1vision + languageQ8_09.7B17.56 GiB101.48 GiB
Qwable-9B-Claude-Fable-5vision + languageF169.4B18.53 GiB100.51 GiB
Llama-4-Scout-17B-16E-InstructMoEvision + languageQ8_0109B113.49 GiB5.55 GiB
Qwen3-VL-32B-Instructvision + languageBF1633.4B69.92 GiB49.12 GiB
UI-TARS-72B-DPOvision + languageQ8_073.4B82.89 GiB36.15 GiB
Qwen3.5-9B-Claude-4.6-OS-Auto-Variable-HERETIC-UNCENSORED-THINKINGvision + languageBF169.4B18.53 GiB100.51 GiB
Qwen3.6-35B-A3BMoEvision + languageBF1636.0B67.61 GiB51.43 GiB
gemma-4-12b-it-uncensoredvision + languageF1612.0B25.51 GiB93.53 GiB
gemma-4-26B-A4B-it-qat-q4_0-unquantized-uncensored-hereticMoEvision + languageNVFP425.8B18.79 GiB100.25 GiB
MiniMax-M3MoEvision + languageIQ2_XXS427B113.17 GiB5.87 GiB
Holo-3.1-9Bvision + languageF169.4B18.53 GiB100.51 GiB
Spec sheetPredictedwhat these mean

This page models a generic 128GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.