Best local AI models for 4GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 4GB card gives you about 3.72 GiB to work with after driver overhead. 13 indexed models fit at 32K context — the largest being Qwen3.5-9B-DFlash at 1.3B parameters in BF16.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 4GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
embeddinggemma-300m-qat-q8_0-unquantizedembeddingsQ8_0303M1.22 GiB2.50 GiB
KaLM-embedding-multilingual-mini-instruct-v2.5embeddingsQ8_0494M1.65 GiB2.07 GiB
nomic-embed-text-v1.5embeddingsF32137M2.40 GiB1.32 GiB
jina-embeddings-v5-text-nanoembeddingsF16212M2.30 GiB1.42 GiB
all-MiniLM-L6-v2embeddingsF3223M1.13 GiB2.59 GiB
mxbai-embed-xsmall-v1embeddingsF3224M1.13 GiB2.59 GiB
nomic-embed-text-v2-moeMoEembeddingsF32475M2.58 GiB1.14 GiB
jina-reranker-v1-tiny-enembeddingsF1633M1.01 GiB2.71 GiB
Qwen3.5-9B-DFlashembeddingsBF161.3B3.47 GiB0.25 GiB
gte-smallembeddingsQ8_033M1.36 GiB2.36 GiB
nomic-embed-text-v1embeddingsF32137M2.40 GiB1.32 GiB
LFM2.5-Embedding-350MembeddingsF16354M1.82 GiB1.90 GiB
LFM2.5-ColBERT-350MembeddingsF16353M1.82 GiB1.90 GiB
Spec sheetPredictedwhat these mean

This page models a generic 4GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.