Best local AI models for 48GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 48GB card gives you about 44.64 GiB to work with after driver overhead. 184 indexed models fit at 32K context — the largest being XORTRON-NXTXPRTXXL at 128B parameters in I1-IQ2_XXS.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 48GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
Qwen3.6-35B-A3BMoEvision + languageQ8_036.0B38.50 GiB6.14 GiB
Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-MTPvision + languageQ5_K_M27.8B41.90 GiB2.74 GiB
Qwen3.5-9Bvision + languageBF169.7B18.98 GiB25.66 GiB
gemma-4-26B-A4B-itMoEvision + languageQ8_026.5B28.22 GiB16.42 GiB
gemma-4-12B-itvision + languageBF1612.0B25.51 GiB19.13 GiB
Qwen3.5-4Bvision + languageBF164.7B9.88 GiB34.76 GiB
Qwythos-9B-Claude-Mythos-5-1Mvision + languageBF169.4B35.67 GiB8.97 GiB
gemma-4-31B-itvision + languageQ8_031.3B37.93 GiB6.71 GiB
Muse-Glimmer-30Bvision + languageQ8_029.8B31.51 GiB13.13 GiB
gemma-4-26B-A4B-it-qat-q4_0-unquantizedMoEvision + languageQ4_026.5B15.78 GiB28.86 GiB
Qwen3.5-122B-A10BMoEvision + languageIQ2_M125B42.97 GiB1.67 GiB
Qwen3.5-0.8Bvision + languageBF16873M2.60 GiB42.04 GiB
gemma-4-E2B-itvision + languageBF165.1B9.71 GiB34.93 GiB
gemma-4-31B-it-qat-q4_0-unquantizedvision + languageQ4_032.7B23.49 GiB21.15 GiB
gemma-4-E4B-it-qat-q4_0-unquantizedvision + languageQ4_07.9B6.12 GiB38.52 GiB
Qwen3-VL-30B-A3B-InstructMoEvision + languageQ8_031.1B34.05 GiB10.59 GiB
Qwopus3.6-35B-A3B-v1MoEvision + languageQ8_036.0B36.64 GiB8.00 GiB
Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTPvision + languageQ8_09.7B21.60 GiB23.04 GiB
Qwen3.5-35B-A3BMoEvision + languageQ8_036.0B36.65 GiB7.99 GiB
Qwythos-9B-v2vision + languageBF169.7B35.67 GiB8.97 GiB
ThinkingCap-Qwen3.6-27Bvision + languageQ8_027.4B29.98 GiB14.66 GiB
Qwopus3.6-27B-Codervision + languageQ8_027.8B29.92 GiB14.72 GiB
Qwen3-VL-4B-Instructvision + languageBF164.4B12.81 GiB31.83 GiB
Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinkingvision + languageQ8_039.5B43.77 GiB0.87 GiB
Qwen2.5-VL-7B-Instructvision + languageBF168.3B16.80 GiB27.84 GiB
Qwen3-VL-2B-Instructvision + languageBF162.1B7.50 GiB37.14 GiB
Qwen3.5-27Bvision + languageQ8_027.8B29.98 GiB14.66 GiB
gemma-3-12b-itvision + languageBF1612.2B25.24 GiB19.40 GiB
Qwen3.5-2Bvision + languageBF162.3B4.80 GiB39.84 GiB
Qwen3.6-27B-Heretic2-Uncensored-Finetune-Thinkingvision + languageQ8_027.4B30.68 GiB13.96 GiB
Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-DistilledMoEvision + languageQ8_036.0B36.63 GiB8.01 GiB
Qwen3.6-35B-A3B-uncensored-heretic-Native-MTP-PreservedMoEvision + languageQ8_035.1B36.64 GiB8.00 GiB
Qwen3.5-9Bvision + languageQ8_09.7B10.95 GiB33.69 GiB
Qwen3.6-35B-A3B-uncensored-hereticMoEvision + languageQ8_035.1B35.80 GiB8.84 GiB
gemma-4-31B-it-uncensored-hereticvision + languageQ8_031.3B37.45 GiB7.19 GiB
Qwopus3.6-27B-v2vision + languageQ8_027.8B29.92 GiB14.72 GiB
Qwen3.6-27B-uncensored-heretic-v2-Native-MTP-Preservedvision + languageQ8_027.4B37.66 GiB6.98 GiB
Qwopus3.5-122B-A10B-Kimi-K2.6-destill-healed-abliteratedMoEvision + languageQ2_K123B44.24 GiB0.40 GiB
Mistral-Small-3.2-24B-Instruct-2506vision + languageQ8_024.0B29.25 GiB15.39 GiB
LFM2.5-VL-1.6Bvision + languageBF161.6B3.37 GiB41.27 GiB
gemma-4-E4B-it-ultra-uncensored-hereticvision + languageBF168.0B15.34 GiB29.30 GiB
Unlimited-OCRMoEvision + languageBF163.3B8.14 GiB36.50 GiB
diffusiongemma-26B-A4B-itMoEvision + languageQ8_025.8B27.36 GiB17.28 GiB
Qwopus3.5-9B-v3.5vision + languageBF169.7B18.53 GiB26.11 GiB
Qwen3.6-27B-uncensored-heretic-v2vision + languageQ8_027.4B36.82 GiB7.82 GiB
Tess-4-27Bvision + languageQ8_027.8B32.44 GiB12.20 GiB
Qwen3.5-9B-GLM5.1-Distill-v1vision + languageQ8_09.7B17.56 GiB27.08 GiB
Qwable-9B-Claude-Fable-5vision + languageF169.4B18.53 GiB26.11 GiB
Llama-4-Scout-17B-16E-InstructMoEvision + languageUD-IQ2_M109B43.22 GiB1.42 GiB
Qwen3-VL-32B-Instructvision + languageQ8_033.4B41.32 GiB3.32 GiB
UI-TARS-72B-DPOvision + languageIQ3_M73.4B44.00 GiB0.64 GiB
Qwen3.5-9B-Claude-4.6-OS-Auto-Variable-HERETIC-UNCENSORED-THINKINGvision + languageBF169.4B18.53 GiB26.11 GiB
Qwen3.6-35B-A3BMoEvision + languageQ8_036.0B36.63 GiB8.01 GiB
gemma-4-12b-it-uncensoredvision + languageF1612.0B25.51 GiB19.13 GiB
gemma-4-26B-A4B-it-qat-q4_0-unquantized-uncensored-hereticMoEvision + languageNVFP425.8B18.79 GiB25.85 GiB
Holo-3.1-9Bvision + languageF169.4B18.53 GiB26.11 GiB
MiniCPM-V-4_5vision + languageF168.7B35.85 GiB8.79 GiB
MiniCPM-V-4.6vision + languageBF161.3B2.57 GiB42.07 GiB
Ornith-Agents-A1-3.6-35B-A3B-dare_tiesMoEvision + languageQ8_034.7B37.03 GiB7.61 GiB
Qwen3.5-9B-ultra-uncensored-hereticvision + languageF169.4B18.53 GiB26.11 GiB
Spec sheetPredictedwhat these mean

This page models a generic 48GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.