AMD · workstation

Radeon Pro W7700

Radeon Pro W7700 has 16 GB of VRAM at 576 GB/s — about 14.88 GiB usable after driver and compositor overhead. 1681 of 2118 indexed models fit at 64K context with q8_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
16 GB
GDDR6
Bandwidth
576 GB/s
256-bit bus
Tensor FP16
dense
TDP
190 W
$999 MSRP
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
vision language 152text 1427audio asr 39video 15embedding 26audio tts 21image 1

What fits at 64K context

largest quantization that fits, per model · 1681 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
Huihui-gemma-4-26B-A4B-it-abliteratedMoEUD-IQ4_NL26.5B12.50 GiB1.48 GiB14.87 GiB0.01 GiB26±26.5%
gemma-4-A4B-98e-v7-coder-itMoEQ4_K_L20.5B12.50 GiB1.48 GiB14.87 GiB0.01 GiB26±26.5%
gemma-4-A4B-98e-v6-coder-itMoEQ4_K_L20.5B12.50 GiB1.48 GiB14.87 GiB0.01 GiB26±26.5%
gemma-4-A4B-98e-v7-coderx-itMoEQ4_K_L20.5B12.50 GiB1.48 GiB14.87 GiB0.01 GiB26±26.5%
Mistral-Nemo-Base-2407Q5_112.2B8.61 GiB5.31 GiB14.87 GiB0.01 GiB26±26.5%
Violet_Twilight-v0.2Q5_112.2B8.61 GiB5.31 GiB14.87 GiB0.01 GiB26±26.5%
gemma-4-31B-itUD-IQ2_XXS31.3B7.95 GiB5.94 GiB14.86 GiB0.02 GiB26±26.5%
Kimi-Linear-48B-A3B-InstructMoEIQ2_XS49.1B12.94 GiB1.01 GiB14.86 GiB0.02 GiB26±26.5%
Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTPQ4_K_M9.7B12.86 GiB1.06 GiB14.86 GiB0.02 GiB26±26.5%
Fallen-Gemma3-27B-v1IQ3_M27.4B11.69 GiB2.23 GiB14.85 GiB0.03 GiB26±26.5%
GLM-4.7-Flash-REAP-23B-A3B-absolute-heresyMoEI1-Q4_023.0B12.18 GiB1.76 GiB14.85 GiB0.03 GiB57±37%
GRM-2.6-Plus-0628IQ3_XXS27.8B11.76 GiB2.13 GiB14.85 GiB0.03 GiB26±26.5%
ThinkingCap-Qwen3.6-27BIQ3_XXS27.4B11.76 GiB2.13 GiB14.85 GiB0.03 GiB26±26.5%
Tess-4-27BIQ3_XXS27.8B11.76 GiB2.13 GiB14.85 GiB0.03 GiB26±26.5%
granite-4.0-h-smallMoEQ3_K_S32.2B13.43 GiB0.53 GiB14.85 GiB0.03 GiB63±37%
Le-Chaton-Slim-23BMoEI1-Q3_K_M23.3B10.48 GiB3.45 GiB14.84 GiB0.04 GiB34±37%
Llama3.2-30B-A3B-II-Dark-Champion-INSTRUCT-Heretic-Abliterated-UncensoredMoEI1-IQ2_XXS30.0B7.69 GiB6.24 GiB14.84 GiB0.04 GiB27±37%
granite-20b-code-instruct-8kQ5_K_L20.1B13.86 GiB0.00 GiB14.84 GiB0.04 GiB26±26.5%
Rocinante-XL-16B-v1I1-IQ3_S16.1B6.72 GiB7.17 GiB14.84 GiB0.04 GiB26±26.5%
Ling-mini-2.0MoEQ6_K_L16.3B12.61 GiB1.33 GiB14.83 GiB0.05 GiB77±37%
Phi-3.5-mini-instructIQ2_S3.8B1.17 GiB12.75 GiB14.83 GiB0.05 GiB26±26.5%
Pantheon-Reasoning-27BI1-IQ3_S27.8B11.74 GiB2.13 GiB14.83 GiB0.05 GiB26±26.5%
Qwen3.6-27B-uncensored-heretic-v2-Native-MTP-PreservedI1-IQ3_S27.4B11.74 GiB2.13 GiB14.83 GiB0.05 GiB26±26.5%
Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-MTPI1-IQ3_S27.8B11.74 GiB2.13 GiB14.83 GiB0.05 GiB26±26.5%
Qwen3.6-27B-Fable-5-ExperimentalI1-IQ3_S27.8B11.74 GiB2.13 GiB14.83 GiB0.05 GiB26±26.5%
Qwable-5-27B-CoderI1-IQ3_S27.8B11.74 GiB2.13 GiB14.83 GiB0.05 GiB26±26.5%
EVE-27b-XENO-HAT-DeepSeek-V4-FlashI1-IQ3_S27.8B11.74 GiB2.13 GiB14.83 GiB0.05 GiB26±26.5%
EVE-27B-XENO-HATI1-IQ3_S27.8B11.74 GiB2.13 GiB14.83 GiB0.05 GiB26±26.5%
Godoter-27BI1-IQ3_S27.8B11.74 GiB2.13 GiB14.83 GiB0.05 GiB26±26.5%
Reasoning-Medical-27BI1-IQ3_S27.8B11.74 GiB2.13 GiB14.83 GiB0.05 GiB26±26.5%
Qwopus3.6-27B-v2-abliteratedI1-IQ3_S27.4B11.74 GiB2.13 GiB14.83 GiB0.05 GiB26±26.5%
Qwen3.6-27B-Uncensored-HauhauCS-Aggressive-BF16I1-IQ3_S27.8B11.74 GiB2.13 GiB14.83 GiB0.05 GiB26±26.5%
Reasoning-Medical0.1-27BI1-IQ3_S27.8B11.74 GiB2.13 GiB14.83 GiB0.05 GiB26±26.5%
Huihui-ThinkingCap-Qwen3.6-27B-abliteratedI1-IQ3_S27.4B11.74 GiB2.13 GiB14.83 GiB0.05 GiB26±26.5%
Semancer-27BI1-IQ3_S27.8B11.74 GiB2.13 GiB14.83 GiB0.05 GiB26±26.5%
Darwin-28B-CoderI1-IQ3_S26.9B11.74 GiB2.13 GiB14.83 GiB0.05 GiB26±26.5%
Nous-Hermes-2-SOLAR-10.7BQ5_110.7B7.51 GiB6.38 GiB14.82 GiB0.06 GiB26±26.5%
NVIDIA-Nemotron-Nano-12B-v2Q3_K_M12.3B5.61 GiB8.23 GiB14.82 GiB0.06 GiB26±26.5%
Qwen3.6-27B-A3B-CoderMoEI1-IQ4_XS26.7B13.25 GiB0.66 GiB14.81 GiB0.07 GiB87±37%
Qwen3.5-27B-Engineer-Deckard-GeminiI1-IQ3_M27.7B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
Qwen3.5-27B-HERETIC-Polaris-Advanced-Thinking-Alpha-uncensoredI1-IQ3_M27.4B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
Qwen3.5-27B-Deckard-PKD-Heretic-Uncensored-ThinkingI1-IQ3_M27.4B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
Qwen3.6-27B-Heretic2-ThinkingI1-IQ3_M27.4B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
Qwen3.6-27B-Uncensored-AggressiveI1-IQ3_M27.4B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
Qwen-3.5-Opus-GLM-27BI1-IQ3_M26.9B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
Qwen3.6-27B-abliteratedI1-IQ3_M27.4B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
KoQweopus-3.5-27B-experimentalI1-IQ3_M27.8B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
Webcoda-AI-27BI1-IQ3_M27.4B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
Qwen3.5-27B-imabari-v2I1-IQ3_M27.8B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
Huihui-Qwen3.5-27B-abliteratedI1-IQ3_M27.8B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
Qwen3.5-27B-uncensored-heretic-v1I1-IQ3_M27.4B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
Qwen3.5-27B-Unredacted-MAXI1-IQ3_M27.4B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
Qwen3.5-27B-hereticI1-IQ3_M27.4B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
Carnice-V2-27bI1-IQ3_M27.4B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
Qwen3.5-Queen-27BI1-IQ3_M27.4B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
GRaPE-2-ProI1-IQ3_M27.8B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
ThinkingCap-Qwen3.6-27B-hereticIQ3_M27.4B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
Qwen3.5-27B-DerestrictedI1-IQ3_M27.8B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
Darwin-28B-REASONI1-IQ3_M26.9B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
Huihui-Qwen3.5-27B-Claude-4.6-Opus-abliteratedI1-IQ3_M27.8B11.72 GiB2.13 GiB14.80 GiB0.08 GiB26±26.5%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Radeon Pro W7700 run?
1681 of 2118 indexed open-weight models fit a Radeon Pro W7700 at 65,536 context with q8_0 KV cache, the largest being Huihui-gemma-4-26B-A4B-it-abliterated at UD-IQ4_NL. That covers text, vision-language, image, video and speech models.
How much usable memory does a Radeon Pro W7700 actually have?
Its nameplate is 16 GB, but about 14.88 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Radeon Pro W7700 fast for local AI?
Its memory bandwidth is 576 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.