Best local AI models for 96GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 96GB card gives you about 89.28 GiB to work with after driver overhead. 190 indexed models fit at 32K context — the largest being MiniMax-M3 at 427B parameters in IQ1_S.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 96GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
Qwen3.6-35B-A3BMoEvision + languageBF1636.0B67.61 GiB21.67 GiB
Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-MTPvision + languageIQ4_XS27.8B63.92 GiB25.36 GiB
Qwen3.5-9Bvision + languageBF169.7B18.98 GiB70.30 GiB
gemma-4-26B-A4B-itMoEvision + languageBF1626.5B50.98 GiB38.30 GiB
gemma-4-12B-itvision + languageBF1612.0B25.51 GiB63.77 GiB
Qwen3.5-4Bvision + languageBF164.7B9.88 GiB79.40 GiB
Qwythos-9B-Claude-Mythos-5-1Mvision + languageBF169.4B35.67 GiB53.61 GiB
gemma-4-31B-itvision + languageBF1631.3B64.25 GiB25.03 GiB
Muse-Glimmer-30Bvision + languageBF1629.8B53.28 GiB36.00 GiB
gemma-4-26B-A4B-it-qat-q4_0-unquantizedMoEvision + languageQ4_026.5B15.78 GiB73.50 GiB
Qwen3.5-122B-A10BMoEvision + languageUD-Q5_K_M125B88.79 GiB0.49 GiB
Qwen3.5-0.8Bvision + languageBF16873M2.60 GiB86.68 GiB
gemma-4-E2B-itvision + languageBF165.1B9.71 GiB79.57 GiB
gemma-4-31B-it-qat-q4_0-unquantizedvision + languageQ4_032.7B23.49 GiB65.79 GiB
gemma-4-E4B-it-qat-q4_0-unquantizedvision + languageQ4_07.9B6.12 GiB83.16 GiB
Qwen3-VL-30B-A3B-InstructMoEvision + languageBF1631.1B60.69 GiB28.59 GiB
Qwopus3.6-35B-A3B-v1MoEvision + languageF1636.0B67.61 GiB21.67 GiB
Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTPvision + languageQ8_09.7B21.60 GiB67.68 GiB
Qwen3.5-35B-A3BMoEvision + languageBF1636.0B67.61 GiB21.67 GiB
Qwythos-9B-v2vision + languageBF169.7B35.67 GiB53.61 GiB
ThinkingCap-Qwen3.6-27Bvision + languageF1627.4B53.77 GiB35.51 GiB
Qwopus3.6-27B-Codervision + languageQ8_027.8B29.92 GiB59.36 GiB
Qwen3-VL-4B-Instructvision + languageBF164.4B12.81 GiB76.47 GiB
Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinkingvision + languageQ8_039.5B43.77 GiB45.51 GiB
Qwen2.5-VL-7B-Instructvision + languageBF168.3B16.80 GiB72.48 GiB
Qwen3-VL-2B-Instructvision + languageBF162.1B7.50 GiB81.78 GiB
Qwen3.5-27Bvision + languageBF1627.8B53.77 GiB35.51 GiB
gemma-3-12b-itvision + languageBF1612.2B25.24 GiB64.04 GiB
Qwen3.5-2Bvision + languageBF162.3B4.80 GiB84.48 GiB
Qwen3.6-27B-Heretic2-Uncensored-Finetune-Thinkingvision + languageQ8_027.4B30.68 GiB58.60 GiB
Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-DistilledMoEvision + languageF1636.0B67.61 GiB21.67 GiB
Qwen3.6-35B-A3B-uncensored-heretic-Native-MTP-PreservedMoEvision + languageBF1635.1B67.62 GiB21.66 GiB
Qwen3.5-9Bvision + languageQ8_09.7B10.95 GiB78.33 GiB
Qwen3.6-35B-A3B-uncensored-hereticMoEvision + languageBF1635.1B66.04 GiB23.24 GiB
gemma-4-31B-it-uncensored-hereticvision + languageBF1631.3B64.25 GiB25.03 GiB
Step-3.7-Flashvision + languageUD-IQ3_S201B88.39 GiB0.89 GiB
Qwopus3.6-27B-v2vision + languageQ8_027.8B29.92 GiB59.36 GiB
Qwen3.6-27B-uncensored-heretic-v2-Native-MTP-Preservedvision + languageBF1627.4B53.77 GiB35.51 GiB
Qwopus3.5-122B-A10B-Kimi-K2.6-destill-healed-abliteratedMoEvision + languageQ5_K_M123B84.19 GiB5.09 GiB
Mistral-Small-3.2-24B-Instruct-2506vision + languageBF1624.0B49.83 GiB39.45 GiB
LFM2.5-VL-1.6Bvision + languageBF161.6B3.37 GiB85.91 GiB
gemma-4-E4B-it-ultra-uncensored-hereticvision + languageBF168.0B15.34 GiB73.94 GiB
Unlimited-OCRMoEvision + languageBF163.3B8.14 GiB81.14 GiB
diffusiongemma-26B-A4B-itMoEvision + languageBF1625.8B49.40 GiB39.88 GiB
Qwen3.5-397B-A17BMoEvision + languageIQ1_S403B84.43 GiB4.85 GiB
Ornith-1.0-397BMoEvision + languageIQ1_M397B86.88 GiB2.40 GiB
Qwopus3.5-9B-v3.5vision + languageBF169.7B18.53 GiB70.75 GiB
Qwen3.6-27B-uncensored-heretic-v2vision + languageBF1627.4B52.98 GiB36.30 GiB
Tess-4-27Bvision + languageBF1627.8B53.77 GiB35.51 GiB
Qwen3.5-9B-GLM5.1-Distill-v1vision + languageQ8_09.7B17.56 GiB71.72 GiB
Qwable-9B-Claude-Fable-5vision + languageF169.4B18.53 GiB70.75 GiB
Llama-4-Scout-17B-16E-InstructMoEvision + languageQ5_K_L109B80.70 GiB8.58 GiB
Qwen3-VL-32B-Instructvision + languageBF1633.4B69.92 GiB19.36 GiB
UI-TARS-72B-DPOvision + languageQ8_073.4B82.89 GiB6.39 GiB
Qwen3.5-9B-Claude-4.6-OS-Auto-Variable-HERETIC-UNCENSORED-THINKINGvision + languageBF169.4B18.53 GiB70.75 GiB
Qwen3.6-35B-A3BMoEvision + languageBF1636.0B67.61 GiB21.67 GiB
gemma-4-12b-it-uncensoredvision + languageF1612.0B25.51 GiB63.77 GiB
gemma-4-26B-A4B-it-qat-q4_0-unquantized-uncensored-hereticMoEvision + languageNVFP425.8B18.79 GiB70.49 GiB
MiniMax-M3MoEvision + languageIQ1_S427B88.87 GiB0.41 GiB
Holo-3.1-9Bvision + languageF169.4B18.53 GiB70.75 GiB
Spec sheetPredictedwhat these mean

This page models a generic 96GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.