Intel · workstation

Arc Pro B50 16GB

Arc Pro B50 16GB has 16 GB of VRAM at 224 GB/s — about 14.88 GiB usable after driver and compositor overhead. 1813 of 2118 indexed models fit at 32K context with q8_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
16 GB
GDDR6
Bandwidth
224 GB/s
128-bit bus
Tensor FP16
85 TF
dense
TDP
70 W
$349 MSRP
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1551vision language 159video 15audio asr 39image 2embedding 26audio tts 21

What fits at 32K context

largest quantization that fits, per model · 1813 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
Rocinante-XL-16B-v1Q5_K_S16.1B10.45 GiB3.59 GiB14.88 GiB0.00 GiB9±30%
GRM-2.6-Plus-0628IQ3_M27.8B12.95 GiB1.06 GiB14.87 GiB0.01 GiB9±30%
ThinkingCap-Qwen3.6-27BIQ3_M27.4B12.95 GiB1.06 GiB14.87 GiB0.01 GiB9±30%
Tess-4-27BIQ3_M27.8B12.95 GiB1.06 GiB14.87 GiB0.01 GiB9±30%
GLM-Z1-Rumination-32B-0414IQ2_S33.1B9.93 GiB4.05 GiB14.87 GiB0.01 GiB9±30%
Gemma4-Gutenberg-31BIQ2_XS31.3B10.71 GiB3.28 GiB14.87 GiB0.01 GiB9±30%
gemma-4-31B-itIQ2_XS31.3B10.71 GiB3.28 GiB14.87 GiB0.01 GiB9±30%
Gemma4-Gutenberg-31B-HereticIQ2_XS31.3B10.71 GiB3.28 GiB14.87 GiB0.01 GiB9±30%
Equinox-31BIQ2_XS31.3B10.71 GiB3.28 GiB14.87 GiB0.01 GiB9±30%
gemma-4-31B-it-SDFT-Heretic-RPIQ2_XS30.7B10.71 GiB3.28 GiB14.87 GiB0.01 GiB9±30%
Qwen3.5-40B-RoughHouse-Claude-4.6-Opus-Polar-Deckard-Uncensored-Heretic-ThinkingI1-IQ2_S39.5B12.41 GiB1.59 GiB14.87 GiB0.01 GiB9±30%
Olmo-3.1-32B-InstructIQ3_XS32.2B12.45 GiB1.51 GiB14.86 GiB0.02 GiB9±30%
Olmo-3.1-32B-ThinkIQ3_XS32.2B12.45 GiB1.51 GiB14.86 GiB0.02 GiB9±30%
Olmo-3-32B-ThinkIQ3_XS32.2B12.45 GiB1.51 GiB14.86 GiB0.02 GiB9±30%
GLM-4.7-Flash-hereticMoEQ3_K_M29.9B13.17 GiB0.88 GiB14.85 GiB0.03 GiB28±37%
dolphin-2.9.2-Phi-3-MediumKV unresolvedQ6_K14.0B10.67 GiB3.32 GiB14.85 GiB0.03 GiB9±30%
Phi-3-medium-128k-instructQ6_K14.0B10.67 GiB3.32 GiB14.85 GiB0.03 GiB9±30%
Phi-3-medium-4k-instructI1-Q6_K14.0B10.67 GiB3.32 GiB14.85 GiB0.03 GiB9±30%
OpenAI-gpt-oss-20B-Claude-4.5-Opus-Heretic-UncensoredMoEI1-Q4_K_S20.9B13.65 GiB0.41 GiB14.84 GiB0.04 GiB24±37%
gpt-oss-20b-uncensoredMoEI1-Q4_K_S20.9B13.65 GiB0.41 GiB14.84 GiB0.04 GiB24±37%
gpt-oss-safeguard-20bMoEI1-Q4_K_S21.5B13.65 GiB0.41 GiB14.84 GiB0.04 GiB24±37%
Huihui-gpt-oss-20b-BF16-abliterated-v2MoEI1-Q4_K_S20.9B13.65 GiB0.41 GiB14.84 GiB0.04 GiB24±37%
metatune-gpt20b-R1.09MoEI1-Q4_K_S21.5B13.65 GiB0.41 GiB14.84 GiB0.04 GiB24±37%
gpt-oss-20b-DerestrictedMoEQ4_K_S20.9B13.65 GiB0.41 GiB14.84 GiB0.04 GiB24±37%
gemma-7bI1-Q6_K8.5B6.53 GiB7.44 GiB14.84 GiB0.04 GiB9±30%
Aurora-Code-1MoEI1-Q3_K_M34.7B13.70 GiB0.33 GiB14.84 GiB0.04 GiB42±37%
gemma-4-26B-A4B-itMoEIQ4_XS26.5B13.23 GiB0.82 GiB14.84 GiB0.04 GiB9±30%
gemma-4-12B-coder-fable5-composer2.5-v1-abliteratedQ8_012.0B12.68 GiB1.31 GiB14.84 GiB0.04 GiB9±30%
gemma-4-12B-coder-fable5-composer2.5-v1-sft-v5-abliteratedQ8_012.0B12.68 GiB1.31 GiB14.84 GiB0.04 GiB9±30%
codegeex4-all-9bIQ2_XS9.4B3.36 GiB10.63 GiB14.84 GiB0.04 GiB9±30%
glm-4-9b-chatIQ2_XS9.4B3.36 GiB10.63 GiB14.83 GiB0.05 GiB9±30%
GLM-4.7-Flash-REAP-23B-A3BMoEQ4_K_M23.0B13.14 GiB0.88 GiB14.83 GiB0.05 GiB25±37%
Laguna-XS-2.1MoEIQ3_XXS33.4B13.30 GiB0.73 GiB14.83 GiB0.05 GiB35±37%
MN-GRAND-23.5B-Gutenberg-UNCENSORED-V2-GLM4.7-ThinkingI1-IQ3_XXS23.4B8.60 GiB5.38 GiB14.83 GiB0.05 GiB9±30%
reka-flash-3.1I1-Q4_K_S20.9B11.76 GiB2.19 GiB14.83 GiB0.05 GiB9±30%
reka-flash-3Q4_K_S20.9B11.76 GiB2.19 GiB14.83 GiB0.05 GiB9±30%
CallerIQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
Dumpling-Qwen2.5-32BIQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
OREAL-32BIQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
QwQ-32B-Preview-abliterated-linear25I1-IQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
openhands-lm-32b-v0.1I1-IQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
Qwen2.5-Coder-32B-abliteratedI1-IQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
m1-32bI1-IQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
XMainframe-v2-Instruct-32bI1-IQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
Qwen2.5-Coder-32B-Python-SpecialistI1-IQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
Qwen2.5-32b-RP-InkI1-IQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
LongWriter-Zero-32BIQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
OpenCodeReasoning-Nemotron-32B-IOIIQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
Qwen2.5-Coder-32B-Instruct-abliteratedIQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
OlympicCoder-32BIQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
OpenCodeReasoning-Nemotron-32BIQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
OpenThinker-32BIQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
QwQ-32B-ArliAI-RpR-v4IQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
Qwen2.5-Coder-32B-InstructIQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
Qwen2.5-Coder-32BIQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
QwQ-32B-abliteratedIQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
DeepSeek-R1-Distill-Qwen-32B-hereticI1-IQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
InnoSpark-HPC-RM-32BI1-IQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
OpenThinker2-32BIQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
INTELLECT-2IQ2_S32.8B9.67 GiB4.25 GiB14.82 GiB0.06 GiB9±30%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a Arc Pro B50 16GB run?
1813 of 2118 indexed open-weight models fit a Arc Pro B50 16GB at 32,768 context with q8_0 KV cache, the largest being Rocinante-XL-16B-v1 at Q5_K_S. That covers text, vision-language, image, video and speech models.
How much usable memory does a Arc Pro B50 16GB actually have?
Its nameplate is 16 GB, but about 14.88 GiB is available to a model once driver and compositor overhead is accounted for.
Is a Arc Pro B50 16GB fast for local AI?
Its memory bandwidth is 224 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.