NVIDIA · consumer
GeForce RTX 3080 Ti
GeForce RTX 3080 Ti has 20 GB of VRAM at 760 GB/s — about 18.60 GiB usable after driver and compositor overhead. 1868 of 2118 indexed models fit at 64K context with q4_0 KV.
Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
20 GB
GDDR6X
Bandwidth
760 GB/s
320-bit bus
Tensor FP16
136 TF
dense
TDP
350 W
$1199 MSRP
text 1593vision language 171video 16embedding 26audio tts 21audio asr 39image 2
What fits at 64K context
largest quantization that fits, per model · 1868 of 2118 indexed
| Model | Best quant | Params | Weights● | KV● | Total in memory◐ | Headroom◐ | tok/s◐ |
|---|---|---|---|---|---|---|---|
| Carnice-Qwen3.6-MoE-35B-A3BMoE | I1-IQ4_XS | 36.0B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 148±37% |
| Qwen35B-Agent-R2-AbliteratedMoE | I1-IQ4_XS | 34.7B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 148±37% |
| Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-DistilledMoE | I1-IQ4_XS | 36.0B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 148±37% |
| Darwin-35B-A3B-OpusMoE | I1-IQ4_XS | 36.0B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 148±37% |
| Qwen35B-Agent-R2MoE | I1-IQ4_XS | 34.7B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 148±37% |
| Carnice-MoE-35B-A3BMoE | I1-IQ4_XS | 36.0B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 148±37% |
| spoomplesmaxx-flash-35B-A3MoE | I1-IQ4_XS | 35.1B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 148±37% |
| Huihui-Qwen3.6-35B-A3B-Claude-4.7-Opus-abliteratedMoE | I1-IQ4_XS | 36.0B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 148±37% |
| Qwen3.6-35B-A3B-Uncensored-AggressiveMoE | I1-IQ4_XS | 35.1B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 148±37% |
| WorldSim-Opus-3.6-35B-A3BMoE | I1-IQ4_XS | 35.1B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 148±37% |
| Qwen3.6-35B-A3B-abliterated-MAXMoE | I1-IQ4_XS | 35.1B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 148±37% |
| Huihui-Qwen3.6-35B-A3B-abliteratedMoE | I1-IQ4_XS | 36.0B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 148±37% |
| Qwopus3.6-35B-A3B-v1MoE | I1-IQ4_XS | 36.0B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 148±37% |
| Qwen3.6-35B-A3B-StyleTuneMoE | I1-IQ4_XS | 35.1B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 148±37% |
| Qwen3.6-35B-A3B-abliteratedMoE | I1-IQ4_XS | 35.1B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 148±37% |
| Qwen3.6-35B-A3B-abliterated-v4MoE | IQ4_XS | 34.7B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 148±37% |
| 0GM-1.0-35B-A3B-0427MoE | I1-IQ4_XS | 36.0B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 148±37% |
| Qwen3.6-27B-A3B-CoderMoE | I1-Q5_K_M | 26.7B | 17.44 GiB | 0.35 GiB | 18.60 GiB | 0.00 GiB | 126±37% |
| NVIDIA-Nemotron-3-Nano-30B-A3B-BF16MoE | UD-IQ3_XXS | 31.6B | 16.90 GiB | 0.91 GiB | 18.59 GiB | 0.01 GiB | 109±37% |
| Qwen3-Coder-NextMoE | IQ1_M | 79.7B | 16.11 GiB | 1.69 GiB | 18.59 GiB | 0.01 GiB | 100±37% |
| Qwen3-Next-80B-A3B-ThinkingMoE | IQ1_M | 81.3B | 16.11 GiB | 1.69 GiB | 18.59 GiB | 0.01 GiB | 100±37% |
| Qwen3-Next-80B-A3B-InstructMoE | IQ1_M | 81.3B | 16.11 GiB | 1.69 GiB | 18.59 GiB | 0.01 GiB | 100±37% |
| GRM-2.6-Plus-0628 | Q4_1 | 27.8B | 16.60 GiB | 1.13 GiB | 18.59 GiB | 0.01 GiB | 31±12.9% |
| ThinkingCap-Qwen3.6-27B | Q4_1 | 27.4B | 16.60 GiB | 1.13 GiB | 18.59 GiB | 0.01 GiB | 31±12.9% |
| Tess-4-27B | Q4_1 | 27.8B | 16.60 GiB | 1.13 GiB | 18.59 GiB | 0.01 GiB | 31±12.9% |
| L3-Dark-Planet-8B | IQ4_XS | 8.0B | 15.50 GiB | 2.25 GiB | 18.59 GiB | 0.01 GiB | 31±12.9% |
| t5-v1_1-xxl | F32 | 4.8B | 17.74 GiB | 0.00 GiB | 18.59 GiB | 0.01 GiB | 31±12.9% |
| rnj-1-instruct | BF16 | 8.3B | 15.49 GiB | 2.25 GiB | 18.59 GiB | 0.01 GiB | 31±12.9% |
| granite-4.0-h-smallMoE | Q4_0 | 32.2B | 17.51 GiB | 0.28 GiB | 18.58 GiB | 0.02 GiB | 83±37% |
| Huihui-GLM-4.7-Flash-abliterated-57BMoE | I1-IQ2_XS | 57.3B | 15.38 GiB | 2.35 GiB | 18.57 GiB | 0.03 GiB | 72±37% |
| Nemotron-Cascade-2-30B-A3B-heretic-ara-uncensoredMoE | I1-IQ3_M | 31.6B | 16.86 GiB | 0.91 GiB | 18.56 GiB | 0.04 GiB | 110±37% |
| Nemotron-Cascade-2-30B-A3BMoE | I1-IQ3_M | 31.6B | 16.86 GiB | 0.91 GiB | 18.56 GiB | 0.04 GiB | 110±37% |
| Seed-OSS-36B-Instruct-biprojected-norm-preserving-abliterated | I1-IQ3_XXS | 36.2B | 13.15 GiB | 4.50 GiB | 18.55 GiB | 0.05 GiB | 31±12.9% |
| Seed-OSS-36B-Instruct | IQ3_XXS | 36.2B | 13.15 GiB | 4.50 GiB | 18.55 GiB | 0.05 GiB | 31±12.9% |
| Hermes-4.3-36B-heretic | I1-IQ3_XXS | 36.2B | 13.15 GiB | 4.50 GiB | 18.55 GiB | 0.05 GiB | 31±12.9% |
| Hermes-4.3-36B | IQ3_XXS | 36.2B | 13.15 GiB | 4.50 GiB | 18.55 GiB | 0.05 GiB | 31±12.9% |
| Crow-9B-HERETIC-4.6 | BF16 | 9.4B | 17.14 GiB | 0.56 GiB | 18.54 GiB | 0.06 GiB | 31±12.9% |
| Qwen3.5-9B-Coder | F16 | 9.7B | 17.14 GiB | 0.56 GiB | 18.54 GiB | 0.06 GiB | 31±12.9% |
| Qwythos-9B-Claude-Mythos-5-1M-MTP | F16 | 9.7B | 17.14 GiB | 0.56 GiB | 18.54 GiB | 0.06 GiB | 31±12.9% |
| Qwen3.5-9B-Fable-5-v1 | F16 | 9.7B | 17.14 GiB | 0.56 GiB | 18.54 GiB | 0.06 GiB | 31±12.9% |
| Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated | F16 | 9.7B | 17.14 GiB | 0.56 GiB | 18.54 GiB | 0.06 GiB | 31±12.9% |
| PINQWEN-3.5-9B-1M-BF16 | F16 | 9.7B | 17.14 GiB | 0.56 GiB | 18.54 GiB | 0.06 GiB | 31±12.9% |
| Openprose-2-Flash | F16 | 9.7B | 17.14 GiB | 0.56 GiB | 18.54 GiB | 0.06 GiB | 31±12.9% |
| Qwen3.5-9B-Nikusui-v1 | F16 | 9.7B | 17.14 GiB | 0.56 GiB | 18.54 GiB | 0.06 GiB | 31±12.9% |
| Ornith-1.0-9B-heretic-MTP | F16 | 9.4B | 17.14 GiB | 0.56 GiB | 18.54 GiB | 0.06 GiB | 31±12.9% |
| Qwen3.5-9B | BF16 | 9.7B | 17.14 GiB | 0.56 GiB | 18.54 GiB | 0.06 GiB | 31±12.9% |
| Tess-4-9B | BF16 | 9.7B | 17.14 GiB | 0.56 GiB | 18.54 GiB | 0.06 GiB | 31±12.9% |
| dotwebs-1 | F16 | 9.7B | 17.14 GiB | 0.56 GiB | 18.54 GiB | 0.06 GiB | 31±12.9% |
| lift | BF16 | 9.7B | 17.14 GiB | 0.56 GiB | 18.54 GiB | 0.06 GiB | 31±12.9% |
| Ornith-1.0-9B | BF16 | 9.2B | 17.14 GiB | 0.56 GiB | 18.54 GiB | 0.06 GiB | 31±12.9% |
| MN-GRAND-23.5B-Gutenberg-UNCENSORED-V2-GLM4.7-Thinking | IQ4_XS | 23.4B | 11.99 GiB | 5.70 GiB | 18.54 GiB | 0.06 GiB | 31±12.9% |
| Qwen3-Coder-REAP-25B-A3BMoE | Q5_0 | 24.9B | 16.05 GiB | 1.69 GiB | 18.53 GiB | 0.07 GiB | 78±37% |
| Orca-2-13b-Alpaca-Uncensored | I1-IQ2_XS | 13.0B | 3.62 GiB | 14.06 GiB | 18.53 GiB | 0.07 GiB | 31±12.9% |
| WizardLM-13B-Uncensored | I1-IQ2_XS | 13.0B | 3.62 GiB | 14.06 GiB | 18.53 GiB | 0.07 GiB | 31±12.9% |
| WizardCoder-Python-13B-V1.0 | I1-IQ2_XS | 13.0B | 3.62 GiB | 14.06 GiB | 18.53 GiB | 0.07 GiB | 31±12.9% |
| Guanaco-13B-Uncensored | I1-IQ2_XS | 13.0B | 3.62 GiB | 14.06 GiB | 18.53 GiB | 0.07 GiB | 31±12.9% |
| Qwen3.6-35B-A3B-uncensored-heretic-Native-MTP-PreservedMoE | Q3_K_L | 35.1B | 17.37 GiB | 0.35 GiB | 18.53 GiB | 0.07 GiB | 149±37% |
| Qwen3.5-35B-A3B-uncensored-heretic-v2-Native-MTP-PreservedMoE | Q3_K_L | 35.1B | 17.37 GiB | 0.35 GiB | 18.53 GiB | 0.07 GiB | 149±37% |
| Huihui-Qwen3.5-35B-A3B-abliteratedMoE | I1-IQ4_XS | 36.0B | 17.37 GiB | 0.35 GiB | 18.53 GiB | 0.07 GiB | 149±37% |
| Qwen3.5-35B-A3B-BaseMoE | I1-IQ4_XS | 36.0B | 17.37 GiB | 0.35 GiB | 18.53 GiB | 0.07 GiB | 149±37% |
Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.
Questions people ask
- What AI models can a GeForce RTX 3080 Ti run?
- 1868 of 2118 indexed open-weight models fit a GeForce RTX 3080 Ti at 65,536 context with q4_0 KV cache, the largest being Carnice-Qwen3.6-MoE-35B-A3B at I1-IQ4_XS. That covers text, vision-language, image, video and speech models.
- How much usable memory does a GeForce RTX 3080 Ti actually have?
- Its nameplate is 20 GB, but about 18.60 GiB is available to a model once driver and compositor overhead is accounted for.
- Is a GeForce RTX 3080 Ti fast for local AI?
- Its memory bandwidth is 760 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.