NVIDIA · unified x86

NVIDIA DGX Spark (GB10)

NVIDIA DGX Spark (GB10) has 128 GB of unified memory at 273 GB/s — about 119.04 GiB usable after driver and compositor overhead. 2085 of 2118 indexed models fit at 128K context with q8_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
128 GB
LPDDR5X-8533
Bandwidth
273 GB/s
256-bit bus
Tensor FP16
125 TF
dense
TDP
140 W
$3999 MSRP
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1790vision language 191audio tts 21image 2audio asr 39video 16embedding 26

What fits at 128K context

largest quantization that fits, per model · 2085 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
MiniMax-M2.1MoEQ3_K_M229B101.77 GiB16.47 GiB119.02 GiB0.02 GiB4±37%
MiniMax-M2.5MoEQ3_K_M229B101.77 GiB16.47 GiB119.02 GiB0.02 GiB4±37%
MiniMax-M2MoEQ3_K_M229B101.77 GiB16.47 GiB119.02 GiB0.02 GiB4±37%
MiniMax-M2.7-BF16-ultra-uncensored-hereticMoEQ3_K_M229B101.77 GiB16.47 GiB119.02 GiB0.02 GiB4±37%
gpt-oss-120b-abliteratedMoEQ8_0117B115.76 GiB2.40 GiB118.96 GiB0.08 GiB9±37%
GLM-4.6VMoEQ8_0108B105.81 GiB12.22 GiB118.86 GiB0.18 GiB5±37%
Ornith-1.0-397BMoEUD-IQ2_M397B115.83 GiB1.99 GiB118.67 GiB0.37 GiB10±37%
MiniMax-M2.7MoEIQ3_M229B101.33 GiB16.47 GiB118.58 GiB0.46 GiB4±37%
Wizard-Vicuna-30B-UncensoredI1-IQ3_M32.5B13.86 GiB103.59 GiB118.32 GiB0.72 GiB2±12.9%
archangel_sft-kto_llama30bI1-IQ3_M32.5B13.86 GiB103.59 GiB118.32 GiB0.72 GiB2±12.9%
Qwen3-VL-235B-A22B-ThinkingMoEQ3_K_M236B104.72 GiB12.48 GiB118.04 GiB1.00 GiB5±37%
Qwen3-VL-235B-A22B-InstructMoEQ3_K_M236B104.72 GiB12.48 GiB118.04 GiB1.00 GiB5±37%
Qwen3-235B-A22BMoEQ3_K_M235B104.72 GiB12.48 GiB118.04 GiB1.00 GiB5±37%
Qwen3-235B-A22B-abliteratedMoEI1-Q3_K_M235B104.72 GiB12.48 GiB118.04 GiB1.00 GiB5±37%
Qwen3-235B-A22B-Thinking-2507MoEQ3_K_M235B104.72 GiB12.48 GiB118.04 GiB1.00 GiB5±37%
Qwen3-235B-A22B-Instruct-2507MoEQ3_K_M235B104.72 GiB12.48 GiB118.04 GiB1.00 GiB5±37%
Behemoth-X-123B-v2Q6_K123B93.68 GiB23.38 GiB118.01 GiB1.03 GiB2±12.9%
Mistral-Large-Instruct-2411Q6_K123B93.68 GiB23.38 GiB118.01 GiB1.03 GiB2±12.9%
WizardLM-Uncensored-SuperCOT-StoryTelling-30bQ3_K_S32.5B13.10 GiB103.59 GiB117.56 GiB1.48 GiB2±12.9%
grok-2MoEIQ3_XXS270B99.62 GiB17.00 GiB117.56 GiB1.48 GiB2±37%
Step-3.7-FlashUD-IQ4_NL201B90.63 GiB26.05 GiB117.51 GiB1.53 GiB2±12.9%
GLM-4.6-REAP-268B-A32BMoEQ2_K_L269B92.11 GiB24.44 GiB117.39 GiB1.65 GiB3±37%
MiniMax-M3MoEIQ2_XXS427B108.60 GiB7.97 GiB117.39 GiB1.65 GiB6±37%
Trinity-Large-ThinkingMoEIQ2_S399B112.03 GiB4.40 GiB117.26 GiB1.78 GiB9±37%
SuperHY3-abliterated-NVFP4MoEIQ2_M172B95.10 GiB21.25 GiB117.19 GiB1.85 GiB4±37%
Hy3MoEIQ2_M299B95.08 GiB21.25 GiB117.17 GiB1.87 GiB4±37%
dots.llm1.instMoEIQ2_S143B50.40 GiB65.88 GiB117.10 GiB1.94 GiB2±37%
ERNIE-4.5-300B-A47B-PTQ2_K_L300B101.76 GiB14.34 GiB117.03 GiB2.01 GiB2±12.9%
MiMo-V2.5MoEKV unresolvedUD-IQ3_S311B106.98 GiB7.97 GiB115.79 GiB3.25 GiB6±37%
GLM-4.7MoEUD-IQ1_S358B90.50 GiB24.44 GiB115.78 GiB3.26 GiB3±37%
Hermes-4-405BUD-IQ1_S406B81.23 GiB33.47 GiB115.78 GiB3.26 GiB2±12.9%
GLM-4.7-REAP-218B-A32BMoEQ3_K_S218B90.39 GiB24.44 GiB115.66 GiB3.38 GiB3±37%
GLM-4.5MoEUD-IQ1_S358B90.38 GiB24.44 GiB115.66 GiB3.38 GiB3±37%
Qwen3.5-397B-A17BMoEUD-IQ1_M403B112.75 GiB1.99 GiB115.60 GiB3.44 GiB10±37%
GLM-4.6MoEUD-IQ1_S357B90.28 GiB24.44 GiB115.56 GiB3.48 GiB3±37%
Gemma-4-Dark-Gemistry-31BQ8_032.7B102.98 GiB11.25 GiB115.11 GiB3.93 GiB2±12.9%
Nex-N2-ProMoEIQ2_S397B112.23 GiB1.99 GiB115.08 GiB3.96 GiB11±37%
gemma-2-27b-itF3227.2B101.43 GiB12.65 GiB115.02 GiB4.02 GiB2±12.9%
Qwen3-Coder-REAP-363B-A35BMoEUD-IQ1_S363B97.24 GiB16.47 GiB114.54 GiB4.50 GiB4±37%
command-a-plus-05-2026-bf16MoEIQ4_XS219B110.67 GiB2.35 GiB113.82 GiB5.22 GiB7±37%
Trinity-Large-TrueBaseMoEI1-IQ2_S399B108.32 GiB4.40 GiB113.56 GiB5.48 GiB9±37%
MiMo-V2-FlashMoEKV unresolvedQ2_K_L310B104.70 GiB7.97 GiB113.52 GiB5.52 GiB7±37%
NVIDIA-Nemotron-3-Super-120B-A12B-BF16MoEUD-Q6_K124B106.87 GiB5.84 GiB113.51 GiB5.53 GiB7±37%
command-r-35b-writer-v2I1-Q6_K35.0B26.74 GiB85.00 GiB112.64 GiB6.40 GiB2±12.9%
Llama-4-Maverick-17B-128E-InstructMoEKV unresolvedUD-TQ1_0402B98.45 GiB12.75 GiB112.03 GiB7.01 GiB6±37%
step-3.5-flashQ3_K_M199B84.04 GiB26.05 GiB110.91 GiB8.13 GiB2±12.9%
DeepSeek-Coder-V2-Instruct-0724MoEQ3_K236B104.93 GiB4.48 GiB110.25 GiB8.79 GiB8±37%
DeepSeek-V2.5MoEQ3_K236B104.93 GiB4.48 GiB110.25 GiB8.79 GiB8±37%
DeepSeek-Coder-V2-InstructMoEQ3_K236B104.93 GiB4.48 GiB110.25 GiB8.79 GiB8±37%
DeepSeek-V4-FlashMoEUD-IQ3_S291B109.25 GiB0.03 GiB110.14 GiB8.90 GiB13±37%
Mistral-Medium-3.5-128BQ5_K_L128B85.78 GiB23.38 GiB110.11 GiB8.93 GiB2±12.9%
Qwen3.5-REAP-262B-A17BMoEIQ3_M262B106.73 GiB1.99 GiB109.58 GiB9.46 GiB10±37%
MiniMax-M2.1-REAP-139B-A10BMoEI1-Q5_K_M139B91.98 GiB16.47 GiB109.23 GiB9.81 GiB4±37%
m51Lab-MiniMax-M2.7-REAP-139B-A10BMoEI1-Q5_K_M139B91.98 GiB16.47 GiB109.23 GiB9.81 GiB4±37%
DeepSeek-V4-Flash-0731MoEUD-IQ3_S304B108.10 GiB0.03 GiB108.98 GiB10.06 GiB13±37%
Mixtral-8x22B-Instruct-v0.1MoEQ5_K_M141B93.11 GiB14.88 GiB108.84 GiB10.20 GiB3±37%
Mixtral-8x22B-v0.1MoEQ5_K_M141B93.11 GiB14.88 GiB108.84 GiB10.20 GiB3±37%
Mixtral-8x22B-v0.1MoEQ5_K_M141B93.10 GiB14.88 GiB108.84 GiB10.20 GiB3±37%
Qwen3.5-REAP-212B-A17BMoEIQ4_XS212B105.39 GiB1.99 GiB108.24 GiB10.80 GiB9±37%
Trinity-Large-PreviewMoEIQ2_S399B102.49 GiB4.40 GiB107.72 GiB11.32 GiB9±37%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Questions people ask

What AI models can a NVIDIA DGX Spark (GB10) run?
2085 of 2118 indexed open-weight models fit a NVIDIA DGX Spark (GB10) at 131,072 context with q8_0 KV cache, the largest being MiniMax-M2.1 at Q3_K_M. That covers text, vision-language, image, video and speech models.
How much usable memory does a NVIDIA DGX Spark (GB10) actually have?
Its nameplate is 128 GB, but about 119.04 GiB is available to a model once driver and compositor overhead is accounted for.
Is a NVIDIA DGX Spark (GB10) fast for local AI?
Its memory bandwidth is 273 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.