Best local AI models for 10GB VRAM

Ranked by what actually fits at 32K context, computed from real file bytes.

A 10GB card gives you about 9.30 GiB to work with after driver overhead. 26 indexed models fit at 32K context — the largest being Nemotron-3-Embed-8B-BF16 at 8.0B parameters in IQ4_XS.

From the file· fit from summed bytesFrom the file· KV per layer

Fits in 10GB at 32K context

largest quantization that fits, per model
ModelModalityBest quantParamsTotalHeadroom
jina-embeddings-v5-text-smallembeddingsF16596M5.39 GiB3.91 GiB
embeddinggemma-300m-qat-q8_0-unquantizedembeddingsQ8_0303M1.22 GiB8.08 GiB
KaLM-embedding-multilingual-mini-instruct-v2.5embeddingsQ8_0494M1.65 GiB7.65 GiB
nomic-embed-text-v1.5embeddingsF32137M2.40 GiB6.90 GiB
jina-embeddings-v5-text-nanoembeddingsF16212M2.30 GiB7.00 GiB
all-MiniLM-L6-v2embeddingsF3223M1.13 GiB8.17 GiB
mxbai-embed-xsmall-v1embeddingsF3224M1.13 GiB8.17 GiB
nomic-embed-text-v2-moeMoEembeddingsF32475M2.58 GiB6.72 GiB
bge-m3embeddingsQ8_0567M4.37 GiB4.93 GiB
snowflake-arctic-embed-l-v2.0embeddingsF32568M5.90 GiB3.40 GiB
jina-reranker-v1-tiny-enembeddingsF1633M1.01 GiB8.29 GiB
Qwen3.5-9B-DFlashembeddingsBF161.3B3.47 GiB5.83 GiB
Qwen3-Embedding-0.6BembeddingsF16596M5.39 GiB3.91 GiB
gte-smallembeddingsQ8_033M1.36 GiB7.94 GiB
Qwen3-Embedding-8BembeddingsQ3_K_L7.6B9.21 GiB0.09 GiB
nomic-embed-text-v1embeddingsF32137M2.40 GiB6.90 GiB
LFM2.5-Embedding-350MembeddingsF16354M1.82 GiB7.48 GiB
Qwen3-Embedding-4BembeddingsQ8_04.0B9.30 GiB0.00 GiB
Nemotron-3-Embed-8B-BF16embeddingsIQ4_XS8.0B9.20 GiB0.10 GiB
nomic-embed-codeembeddingsQ6_K_L7.1B8.14 GiB1.16 GiB
LCO-Embedding-Omni-3B-2605embeddingsQ8_04.7B5.30 GiB4.00 GiB
qwen-indic-v1embeddingsI1-IQ4_XS7.6B9.27 GiB0.03 GiB
Octen-Embedding-4BembeddingsQ8_04.0B9.30 GiB0.00 GiB
bge-reranker-v2-m3embeddingsQ8_0568M4.37 GiB4.93 GiB
LFM2.5-ColBERT-350MembeddingsF16353M1.82 GiB7.48 GiB
gte-largeembeddingsQ8_0335M4.11 GiB5.19 GiB
Spec sheetPredictedwhat these mean

This page models a generic 10GB accelerator, so it answers what fits rather than how fast it runs. For tokens per second you need a specific card — pick one from hardware, where bandwidth is known.