NVIDIA · workstation

RTX A2000

RTX A2000 has 6 GB of VRAM at 288 GB/s — about 5.58 GiB usable after driver and compositor overhead. 1211 of 2118 indexed models fit at 4K context with q8_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
6 GB
GDDR6
Bandwidth
288 GB/s
192-bit bus
Tensor FP16
32 TF
dense
TDP
70 W
$449 MSRP
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1035image 1vision language 90embedding 26audio asr 38audio tts 19video 2

What fits at 4K context

largest quantization that fits, per model · 1211 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
deepseek-math-7b-instructIQ4_XS6.9B3.56 GiB1.00 GiB5.58 GiB0.00 GiB36±22%
Qwen3-Reranker-8BI1-IQ4_XS8.2B4.25 GiB0.30 GiB5.58 GiB0.00 GiB36±22%
Janus-Pro-7BIQ4_XS7.4B3.56 GiB1.00 GiB5.58 GiB0.00 GiB36±22%
deepseek-coder-7b-instruct-v1.5IQ4_XS6.9B3.56 GiB1.00 GiB5.58 GiB0.00 GiB36±22%
Qwythos-9B-v2Q3_K_S9.7B4.48 GiB0.07 GiB5.58 GiB0.00 GiB36±22%
Tess-4-9BQ3_K_S9.7B4.48 GiB0.07 GiB5.58 GiB0.00 GiB36±22%
Parable-Granite-4.1-8B-Claude-Fable-5I1-Q3_K_L8.4B4.21 GiB0.33 GiB5.58 GiB0.00 GiB36±22%
SOLAR-10.7B-Instruct-v1.0I1-IQ3_XS10.7B4.14 GiB0.40 GiB5.58 GiB0.00 GiB36±22%
LFM2-8B-A1BMoEQ4_K_S8.3B4.56 GiB0.02 GiB5.58 GiB0.00 GiB106±37%
Tiger-Gemma-12B-v3IQ2_S12.8B4.15 GiB0.38 GiB5.58 GiB0.00 GiB36±22%
AfriqueGemma-12BI1-IQ2_S12.2B4.15 GiB0.38 GiB5.58 GiB0.00 GiB36±22%
INTELLECT-1-InstructQ2_K_L10.2B4.19 GiB0.35 GiB5.57 GiB0.01 GiB36±22%
gemma-4-E4B-uncensoredI1-Q3_K_M7.9B4.49 GiB0.07 GiB5.57 GiB0.01 GiB36±22%
gemma-4-E4B-it-qat-q4_0-unquantized-hereticI1-Q3_K_M7.9B4.49 GiB0.07 GiB5.57 GiB0.01 GiB36±22%
gemma-4-E4B-it-qat-heretic_decensoredI1-Q3_K_M7.9B4.49 GiB0.07 GiB5.57 GiB0.01 GiB36±22%
gemma-4-E4B-it-QAT-SOMPOA-heresyI1-Q3_K_M7.9B4.49 GiB0.07 GiB5.57 GiB0.01 GiB36±22%
gemma4-e4b-mahou-nsfwI1-Q3_K_M7.9B4.49 GiB0.07 GiB5.57 GiB0.01 GiB36±22%
gemma-4-E4B-it-mentalchat16kI1-Q3_K_M7.9B4.49 GiB0.07 GiB5.57 GiB0.01 GiB36±22%
gemma4-E4B-it-abliteratedI1-Q3_K_M7.9B4.49 GiB0.07 GiB5.57 GiB0.01 GiB36±22%
gemma-4-E4B-it-OBLITERATEDI1-Q3_K_M8.0B4.49 GiB0.07 GiB5.57 GiB0.01 GiB36±22%
Ministral-3-8B-Instruct-2512-BF16-abliteratedI1-Q3_K_L8.9B4.25 GiB0.28 GiB5.57 GiB0.01 GiB36±22%
Amaretto-8BI1-Q3_K_L8.9B4.25 GiB0.28 GiB5.57 GiB0.01 GiB36±22%
gemma-3-12b-it-vl-Gemini-3-Pro-Preview-Heretic-Uncensored-ThinkingI1-Q2_K_S12.2B4.14 GiB0.38 GiB5.57 GiB0.01 GiB36±22%
gemma-3-12b-it-vl-Deepseek-v3.1-Heretic-Uncensored-ThinkingI1-Q2_K_S12.2B4.14 GiB0.38 GiB5.57 GiB0.01 GiB36±22%
gemma-3-12b-it-vl-GLM-4.7-Flash-Heretic-Uncensored-ThinkingI1-Q2_K_S12.2B4.14 GiB0.38 GiB5.57 GiB0.01 GiB36±22%
Floppa-12B-Gemma3-UncensoredI1-Q2_K_S12.2B4.14 GiB0.38 GiB5.57 GiB0.01 GiB36±22%
gemma-3-12b-it-hereticI1-Q2_K_S12.2B4.14 GiB0.38 GiB5.57 GiB0.01 GiB36±22%
codegeex4-all-9bIQ2_XXS9.4B3.19 GiB1.33 GiB5.57 GiB0.01 GiB36±22%
gemma-4-E4B-it-hereticQ4_K_S8.0B4.48 GiB0.07 GiB5.57 GiB0.01 GiB36±22%
Forsaken-Void-12BI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Silver-Siren-ST-12BI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Dans-PersonalityEngine-V1.3.0-12bI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
MN-12B-Runeweaver-RP-RUI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Impish_Bloodmoon_12BI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Wayfarer-2-12BI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Wayfarer-12BI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Muse-12BI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Rocinante-X-12B-v1-Heretic-UncensoredI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Mistral-Heretica-12BI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
arcee-fusion-lumaid-12BI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Mistral-NeMo-12B-AbliteratedI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Captain-Eris_Violet-V0.420-12BI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Rocinante-X-12B-v1-absolute-heresyI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Rocinante-X-12B-v1I1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Mistral-Nemo-2407-12B-Thinking-Claude-Gemini-GPT5.2-Uncensored-HERETICI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Dans-SakuraKaze-V1.0.0-12bI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Mistral-Nemo-Inst-2407-12B-Thinking-Uncensored-HERETIC-HI-Claude-OpusI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Mistral-Nemo-Instruct-2407-12B-Thinking-M-Claude-Opus-High-ReasoningI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Mordant-12B-ThinkI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Riverfish-Rocinante-12B-SFT-DPOI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
MN-Violet-Lotus-12B-HereticI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Himeyuri-Magnum-12B-HereticMergeI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Kinggaroo-12b-v1I1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Nera_Noctis-12BI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Peaceful-Days-12BI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
Blissful-Days-12BI1-Q2_K_S12.2B4.19 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
glm-4-9b-chatIQ2_XXS9.4B3.19 GiB1.33 GiB5.56 GiB0.02 GiB36±22%
SambaLingo-Japanese-ChatI1-Q3_K_L6.9B3.47 GiB1.06 GiB5.56 GiB0.02 GiB36±22%
Tini-Cybersec-8B-A1BMoEQ4_08.5B4.54 GiB0.02 GiB5.56 GiB0.02 GiB107±37%
Qwen3-14BUD-IQ2_XXS14.8B4.16 GiB0.33 GiB5.56 GiB0.02 GiB36±22%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a RTX A2000 run?
1211 of 2118 indexed open-weight models fit a RTX A2000 at 4,096 context with q8_0 KV cache, the largest being deepseek-math-7b-instruct at IQ4_XS. That covers text, vision-language, image, video and speech models.
How much usable memory does a RTX A2000 actually have?
Its nameplate is 6 GB, but about 5.58 GiB is available to a model once driver and compositor overhead is accounted for.
Is a RTX A2000 fast for local AI?
Its memory bandwidth is 288 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.