AMD · unified x86

AMD Ryzen AI Max+ 395 (Radeon 8060S)

AMD Ryzen AI Max+ 395 (Radeon 8060S) has 64 GB of VRAM at 256 GB/s — about 44.64 GiB usable after driver and compositor overhead. 2051 of 2118 indexed models fit at 8K context with q4_0 KV. Note only 48 GB of its 64 GB is allocatable to the GPU.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
64 GB
LPDDR5X-8000
Bandwidth
256 GB/s
256-bit bus
Tensor FP16
dense
TDP
120 W
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1762vision language 185image 2audio asr 39audio tts 21video 16embedding 26

What fits at 8K context

largest quantization that fits, per model · 2051 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
diffusiongemma-26B-A4B-it-HERETIC-UncensoredMoEBF1625.8B47.07 GiB0.17 GiB47.93 GiB0.07 GiB3±25%
diffusiongemma-26B-A4B-itMoEBF1625.8B47.07 GiB0.17 GiB47.93 GiB0.07 GiB3±25%
gemma-4-26B-A4B-it-Claude-Opus-DistillMoEBF1626.5B47.04 GiB0.17 GiB47.89 GiB0.11 GiB3±25%
gemma-4-26B-A4B-it-Claude-Opus-Distill-v2MoEBF1626.5B47.04 GiB0.17 GiB47.89 GiB0.11 GiB3±25%
G4-MeroMero-26B-A4BMoEBF1625.8B47.04 GiB0.17 GiB47.89 GiB0.11 GiB3±25%
gemma-4-26B-A4B-it-qat-q4_0-unquantized-hereticMoEF1625.8B47.04 GiB0.17 GiB47.89 GiB0.11 GiB3±25%
G4-MeroMero-26B-A4B-it-uncensored-hereticMoEBF1625.8B47.04 GiB0.17 GiB47.89 GiB0.11 GiB3±25%
gemma-4-26B-A4B-itMoEF1626.5B47.04 GiB0.17 GiB47.89 GiB0.11 GiB3±25%
gemma-4-26B-A4B-it-ultra-uncensored-hereticMoEBF1625.8B47.04 GiB0.17 GiB47.89 GiB0.11 GiB3±25%
gemma-4-26B-A4B-it-uncensored-hereticMoEBF1625.8B47.04 GiB0.17 GiB47.89 GiB0.11 GiB3±25%
gemma-4-26B-A4B-it-abliterixMoEF1625.8B47.04 GiB0.17 GiB47.89 GiB0.11 GiB3±25%
gemma-4-26B-A4BMoEBF1626.5B47.04 GiB0.17 GiB47.89 GiB0.11 GiB3±25%
gemma-4-26B-A4B-Heretic-StableMoEBF1625.8B47.04 GiB0.17 GiB47.89 GiB0.11 GiB3±25%
gemma-4-26B-A4B-it-Uncensored-MAXMoEBF1625.8B47.04 GiB0.17 GiB47.89 GiB0.11 GiB3±25%
dots.llm1.instMoEUD-IQ1_S143B44.94 GiB2.18 GiB47.85 GiB0.15 GiB12±37%
HunyuanImage-2.1Q5_017.5B47.04 GiB0.00 GiB47.79 GiB0.21 GiB3±25%
Step-3.5-Flash-REAP-121B-A11BI1-IQ3_XS121B45.92 GiB1.13 GiB47.78 GiB0.22 GiB3±25%
Mixtral_34Bx2_MoE_60BMoEQ6_K60.8B46.47 GiB0.53 GiB47.78 GiB0.22 GiB2±37%
Qwen3-Coder-NextMoEQ4_179.7B46.78 GiB0.21 GiB47.68 GiB0.32 GiB20±37%
Qwen3-Next-80B-A3B-ThinkingMoEQ4_181.3B46.78 GiB0.21 GiB47.68 GiB0.32 GiB20±37%
Qwen3-Next-80B-A3B-InstructMoEQ4_181.3B46.78 GiB0.21 GiB47.68 GiB0.32 GiB20±37%
Mistral-Small-Instruct-2409IQ4_XS22.2B46.42 GiB0.49 GiB47.67 GiB0.33 GiB3±25%
NVIDIA-Nemotron-3-Super-120B-A12B-BF16MoEIQ2_XXS124B46.71 GiB0.19 GiB47.60 GiB0.40 GiB16±37%
Qwen3.5-122B-A10B-hereticMoEI1-IQ3_XS123B46.72 GiB0.05 GiB47.50 GiB0.50 GiB19±37%
Mistral-Medium-3.5-128BUD-IQ3_XXS128B45.87 GiB0.77 GiB47.50 GiB0.50 GiB3±25%
Llama-4-Scout-17B-16E-InstructMoEKV unresolvedQ3_K_S109B46.34 GiB0.42 GiB47.49 GiB0.51 GiB13±37%
Huihui-GLM-4.5-Air-abliterated-lossytensorsMoEI1-IQ3_XS110B46.34 GiB0.40 GiB47.47 GiB0.53 GiB13±37%
Qwen3.5-88BMoEI1-Q4_K_S87.7B46.63 GiB0.05 GiB47.41 GiB0.59 GiB16±37%
GLM-4.6VMoEUD-IQ3_XXS108B46.26 GiB0.40 GiB47.40 GiB0.60 GiB13±37%
Huihui-Qwen3-Coder-Next-abliteratedMoEQ4_179.7B46.65 GiB0.05 GiB47.39 GiB0.61 GiB21±37%
Ornith-1.0-35B-AEON-Ultimate-Uncensored-BF16MoEQ5_K_M35.1B46.64 GiB0.04 GiB47.39 GiB0.61 GiB19±37%
Qwen3-Coder-REAP-25B-A3BMoEBF1624.9B46.34 GiB0.21 GiB47.25 GiB0.75 GiB12±37%
dolphin-2.6-mixtral-8x7bMoEQ8_046.7B46.22 GiB0.28 GiB47.24 GiB0.76 GiB6±37%
Nous-Hermes-2-Mixtral-8x7B-DPOMoEQ8_046.7B46.22 GiB0.28 GiB47.24 GiB0.76 GiB6±37%
Mixtral-8x7B-Instruct-v0.1MoEQ8_046.7B46.22 GiB0.28 GiB47.24 GiB0.76 GiB6±37%
xLAM-8x7b-rMoEQ8_046.7B46.22 GiB0.28 GiB47.24 GiB0.76 GiB6±37%
Open_Gpt4_8x7B_v0.1MoEQ8_046.7B46.22 GiB0.28 GiB47.24 GiB0.76 GiB6±37%
dolphin-2.5-mixtral-8x7bMoEQ8_046.7B46.22 GiB0.28 GiB47.23 GiB0.77 GiB6±37%
dolphin-2.7-mixtral-8x7bMoEQ8_046.7B46.22 GiB0.28 GiB47.23 GiB0.77 GiB6±37%
Mixtral-8x7B-v0.1MoEQ8_046.7B46.22 GiB0.28 GiB47.23 GiB0.77 GiB6±37%
Mixtral-8x7B-MoE-RP-StoryMoEQ8_046.7B46.22 GiB0.28 GiB47.23 GiB0.77 GiB6±37%
Noromaid-v0.4-Mixtral-Instruct-8x7b-ZlossMoEQ8_046.7B46.22 GiB0.28 GiB47.23 GiB0.77 GiB6±37%
Open_Gpt4_8x7B_v0.2MoEQ8_046.7B46.22 GiB0.28 GiB47.23 GiB0.77 GiB6±37%
Devstral-2-123B-Instruct-2512UD-IQ3_XXS125B45.60 GiB0.77 GiB47.23 GiB0.77 GiB3±25%
Mistral-Small-4-119B-2603MoEIQ3_XXS119B46.44 GiB0.05 GiB47.22 GiB0.78 GiB19±37%
Assistant_Pepe_70BQ5_K_S70.6B45.65 GiB0.70 GiB47.18 GiB0.82 GiB3±25%
Hunyuan-A13B-InstructMoEQ4_K_L80.4B46.05 GiB0.28 GiB47.03 GiB0.97 GiB3±25%
Llama-3.1-70BQ5_070.6B45.45 GiB0.70 GiB46.98 GiB1.02 GiB3±25%
Qwen3-Coder-Next-REAMMoEI1-Q6_K60.3B46.22 GiB0.05 GiB46.96 GiB1.04 GiB20±37%
Laguna-S-2.1MoEIQ3_XXS118B46.07 GiB0.15 GiB46.94 GiB1.06 GiB17±37%
Apertus-70B-Instruct-2509Q5_K_S70.6B45.35 GiB0.70 GiB46.93 GiB1.07 GiB3±25%
CodeLlama-70b-Instruct-hfI1-Q5_K_M69.0B45.41 GiB0.70 GiB46.93 GiB1.07 GiB3±25%
CodeLlama-70b-Python-hfI1-Q5_K_M69.0B45.41 GiB0.70 GiB46.93 GiB1.07 GiB3±25%
Nous-Hermes-Llama2-70bI1-Q5_K_M69.0B45.41 GiB0.70 GiB46.93 GiB1.07 GiB3±25%
Midnight-Miqu-70B-v1.5I1-Q5_K_M69.0B45.41 GiB0.70 GiB46.93 GiB1.07 GiB3±25%
KafkaLM-70B-German-V0.1Q5_K_M69.0B45.41 GiB0.70 GiB46.93 GiB1.07 GiB3±25%
llama2_70b_chat_uncensoredQ5_K_M69.0B45.41 GiB0.70 GiB46.93 GiB1.07 GiB3±25%
Xwin-LM-70b-V0.1Q5_K_M69.0B45.41 GiB0.70 GiB46.93 GiB1.07 GiB3±25%
Llama-2-70b-chat-hfQ5_K_M69.0B45.41 GiB0.70 GiB46.93 GiB1.07 GiB3±25%
GLM-4.5-Air-REAP-82B-A12BMoEQ4_081.9B45.78 GiB0.40 GiB46.91 GiB1.09 GiB12±37%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a AMD Ryzen AI Max+ 395 (Radeon 8060S) run?
2051 of 2118 indexed open-weight models fit a AMD Ryzen AI Max+ 395 (Radeon 8060S) at 8,192 context with q4_0 KV cache, the largest being diffusiongemma-26B-A4B-it-HERETIC-Uncensored at BF16. That covers text, vision-language, image, video and speech models.
How much usable memory does a AMD Ryzen AI Max+ 395 (Radeon 8060S) actually have?
Its nameplate is 64 GB, but about 44.64 GiB is available to a model once driver and compositor overhead is accounted for, and only 48 GB of the pool can be allocated to the GPU at all.
Is a AMD Ryzen AI Max+ 395 (Radeon 8060S) fast for local AI?
Its memory bandwidth is 256 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.