Best local AI models for 4GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 4GB card gives you about 3.72 GiB to work with after driver overhead. 29 indexed models fit at 32K context — the largest being canary-qwen-2.5b at 2.6B parameters in Q6_K.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 4GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
nemotron-3.5-asr-streaming-0.6bspeech recognitionF32638M3.22 GiB0.50 GiB
parakeet-tdt-0.6b-v3speech recognitionF32627M3.18 GiB0.54 GiB
whisper-mediumspeech recognitionF32764M3.69 GiB0.03 GiB
whisper-large-v3speech recognitionQ8_01.5B2.44 GiB1.28 GiB
whisper-large-v3-turbospeech recognitionF16809M2.36 GiB1.36 GiB
Qwen3-ASR-1.7Bspeech recognitionQ8_02.3B3.18 GiB0.54 GiB
Qwen3-ASR-0.6Bspeech recognitionF16938M2.32 GiB1.40 GiB
GigaAM-v3speech recognitionF32223M1.67 GiB2.05 GiB
parakeet-ctc-0.6bspeech recognitionF32609M3.11 GiB0.61 GiB
whisper-smallspeech recognitionF32242M1.75 GiB1.97 GiB
whisper-largespeech recognitionQ8_01.5B2.40 GiB1.32 GiB
canary-1b-flashspeech recognitionF16811M2.51 GiB1.21 GiB
whisper-large-v2speech recognitionQ8_01.5B2.40 GiB1.32 GiB
canary-qwen-2.5bspeech recognitionQ6_K2.6B2.90 GiB0.82 GiB
Breeze-ASR-25speech recognitionQ8_01.5B2.40 GiB1.32 GiB
nemotron-speech-streaming-en-0.6bspeech recognitionF32618M3.15 GiB0.57 GiB
parakeet-ctc-1.1bspeech recognitionF161.1B2.83 GiB0.89 GiB
parakeet-rnnt-1.1bspeech recognitionF161.1B2.84 GiB0.88 GiB
whisper-basespeech recognitionF3273M1.12 GiB2.60 GiB
moonshine-streaming-mediumspeech recognitionF32266M2.85 GiB0.87 GiB
whisper-medium.enspeech recognitionF32764M3.69 GiB0.03 GiB
parakeet-rnnt-0.6bspeech recognitionF32617M3.14 GiB0.58 GiB
whisper-small.enspeech recognitionF32242M1.75 GiB1.97 GiB
moonshine-streaming-smallspeech recognitionF32140M1.91 GiB1.81 GiB
whisper-tinyspeech recognitionF3238M0.99 GiB2.73 GiB
whisper-base.enspeech recognitionF3273M1.12 GiB2.60 GiB
moonshine-streaming-tinyspeech recognitionF3244M1.16 GiB2.56 GiB
moonshine-basespeech recognitionF3262M0.99 GiB2.73 GiB
Qwen3-ForcedAligner-0.6Bspeech recognitionF16918M2.56 GiB1.16 GiB
Spec sheetPredictedwhat these mean

This page models a generic 4GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.