AMD · consumer

Radeon RX 7700

Radeon RX 7700 has 16 GB of VRAM at 624 GB/s — about 14.88 GiB usable after driver and compositor overhead. 1858 of 2118 indexed models fit at 16K context with q4_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
16 GB
GDDR6
Bandwidth
624 GB/s
256-bit bus
Tensor FP16
dense
TDP
263 W
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1593vision language 162video 15embedding 26audio asr 39audio tts 21image 2

What fits at 16K context

largest quantization that fits, per model · 1858 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
OpenBuddy-R1-0528-Distill-Qwen3-32B-Preview0-QATIQ3_XS32.8B12.76 GiB1.13 GiB14.88 GiB0.00 GiB28±26.5%
Qwen3-VL-32B-Instruct-ultra-uncensored-hereticI1-IQ3_XS33.4B12.76 GiB1.13 GiB14.88 GiB0.00 GiB28±26.5%
Huihui-Qwen3-VL-32B-Instruct-abliteratedI1-IQ3_XS33.4B12.76 GiB1.13 GiB14.88 GiB0.00 GiB28±26.5%
KAT-DevIQ3_XS32.8B12.76 GiB1.13 GiB14.88 GiB0.00 GiB28±26.5%
ColorGUI-32BI1-IQ3_XS33.4B12.76 GiB1.13 GiB14.88 GiB0.00 GiB28±26.5%
Qwen3-VL-32B-InstructIQ3_XS33.4B12.76 GiB1.13 GiB14.88 GiB0.00 GiB28±26.5%
Qwen3-32B-UncensoredI1-IQ3_XS32.8B12.76 GiB1.13 GiB14.88 GiB0.00 GiB28±26.5%
Qwen3-32B-abliteratedI1-IQ3_XS32.8B12.76 GiB1.13 GiB14.88 GiB0.00 GiB28±26.5%
DeepSWE-PreviewIQ3_XS32.8B12.76 GiB1.13 GiB14.88 GiB0.00 GiB28±26.5%
AReaL-boba-2-32BI1-IQ3_XS32.8B12.76 GiB1.13 GiB14.88 GiB0.00 GiB28±26.5%
Assistant_Pepe_32BI1-IQ3_XS32.8B12.76 GiB1.13 GiB14.88 GiB0.00 GiB28±26.5%
Fallen-Gemma3-27B-v1Q3_K_L27.4B13.54 GiB0.39 GiB14.87 GiB0.01 GiB28±26.5%
MN-GRAND-23.5B-Gutenberg-UNCENSORED-V2-GLM4.7-ThinkingI1-Q4_023.4B12.49 GiB1.42 GiB14.86 GiB0.02 GiB28±26.5%
ThinkingCap-Qwen3.6-27BQ3_K_M27.4B13.60 GiB0.28 GiB14.85 GiB0.03 GiB28±26.5%
Tess-4-27BQ3_K_M27.8B13.60 GiB0.28 GiB14.85 GiB0.03 GiB28±26.5%
Darwin-35B-A3B-OpusMoEIQ3_XXS36.0B13.85 GiB0.09 GiB14.84 GiB0.04 GiB139±37%
Aurora-Code-1MoEIQ3_XXS34.7B13.85 GiB0.09 GiB14.84 GiB0.04 GiB139±37%
grug-35b-v2MoEIQ3_XXS35.1B13.85 GiB0.09 GiB14.84 GiB0.04 GiB139±37%
grug-35bMoEIQ3_XXS35.1B13.85 GiB0.09 GiB14.84 GiB0.04 GiB139±37%
WorldSim-Opus-3.6-35B-A3BMoEIQ3_XXS35.1B13.85 GiB0.09 GiB14.84 GiB0.04 GiB139±37%
Qwen3.6-35B-A3B-AnkoMoEIQ3_XXS35.1B13.85 GiB0.09 GiB14.84 GiB0.04 GiB139±37%
KAT-Coder-V2.5-DevMoEIQ3_XXS34.7B13.85 GiB0.09 GiB14.84 GiB0.04 GiB139±37%
Ornith-1.0-35BMoEIQ3_XXS34.7B13.85 GiB0.09 GiB14.84 GiB0.04 GiB139±37%
Nex-N2-miniMoEIQ3_XXS35.1B13.85 GiB0.09 GiB14.84 GiB0.04 GiB139±37%
Qwen3.5-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-ThinkingI1-Q2_K39.5B13.46 GiB0.42 GiB14.84 GiB0.04 GiB28±26.5%
granite-20b-code-instruct-8kQ5_K_L20.1B13.86 GiB0.00 GiB14.84 GiB0.04 GiB28±26.5%
gemma-4-26B-A4B-itMoEIQ4_NL26.5B13.69 GiB0.26 GiB14.83 GiB0.05 GiB28±26.5%
Muse-Glimmer-30BQ3_K_L29.8B13.77 GiB0.08 GiB14.83 GiB0.05 GiB28±26.5%
deepseek-coder-33b-instructIQ3_XS33.3B12.76 GiB1.09 GiB14.83 GiB0.05 GiB28±26.5%
gpt-oss-20b-hereticMoEQ4_K_S20.9B13.83 GiB0.11 GiB14.83 GiB0.05 GiB80±37%
Gemma-4-Gembrain-X-Core-31BI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Gemma-4-Gembrain-X-31BI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Gemma-4-31B-Isometry-Fabled-PersonaI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Versipellis-31BI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Gemma4-Gutenberg-31BI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
G4-MeroMero-31B-uncensored-hereticI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Gemma-4-Novelist-31BI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Wanabi-Gemma4-31BI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
G4-Alice-v1.2-31BI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Agares-31B-v1I1-IQ3_S30.7B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Gemma4-Gutenberg-31B-HereticI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-hereticI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Gemma-4-Gemsicle-31BI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Gemma-4-Gembrain-31B-it-uncensored-hereticI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Melinoe-Gemma4-31B-VL-hereticI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
G4-MeroMero-31BI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Glistening-Gem-31B-v1.0I1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Melinoe-Gemma4-31B-VLI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Gemma-4-31B-Storymaxxed3I1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Huihui-gemma-4-31B-it-qat-q4_0-unquantized-abliteratedI1-IQ3_S32.7B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
gemma-4-31B-Queen-it-qat-q4_0-unquantizedI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
gemma-4-31B-it-qat-q4_0-unquantized-hereticI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Gemma-4-AssGuard-31BI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
copywriter-gemma4-31bI1-IQ3_S32.7B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
gemma-4-31B-heretic-finetuneI1-IQ3_S30.7B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Gemma-4-Garnet-V2-31B-it-ultra-uncensored-hereticI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
gemma-4-31B-it-Claude-Opus-Distill-v2Q3_K_S32.7B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
gemma-4-31B-it-abliterated-v3I1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
Gemma-4-Harmonia-31B-uncensored-hereticQ3_K_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
gemma-4-31B-it-noloopI1-IQ3_S31.3B12.82 GiB1.03 GiB14.83 GiB0.05 GiB28±26.5%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Radeon RX 7700 run?
1858 of 2118 indexed open-weight models fit a Radeon RX 7700 at 16,384 context with q4_0 KV cache, the largest being OpenBuddy-R1-0528-Distill-Qwen3-32B-Preview0-QAT at IQ3_XS. That covers text, vision-language, image, video and speech models.
How much usable memory does a Radeon RX 7700 actually have?
Its nameplate is 16 GB, but about 14.88 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Radeon RX 7700 fast for local AI?
Its memory bandwidth is 624 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.