NVIDIA · datacenter

L4

L4 has 24 GB of VRAM at 300 GB/s — about 22.32 GiB usable after driver and compositor overhead. 1720 of 2118 indexed models fit at 128K context with q8_0 KV.

Spec sheet· bandwidth, theoreticalFrom the file· fit from summed bytesPredicted· speed
Memory
24 GB
GDDR6
Bandwidth
300 GB/s
192-bit bus
Tensor FP16
121 TF
dense
TDP
72 W
KV cachef16q8_0q4_0quantizing the KV cache is a ~2× lever on the dominant term at long context
text 1450vision language 167audio asr 39image 1video 16audio tts 21embedding 26

What fits at 128K context

largest quantization that fits, per model · 1720 of 2118 indexed
ModelBest quantParamsWeightsKVTotal in memoryHeadroomtok/s
Phi-3-medium-128k-instructQ4_K_M14.0B7.98 GiB13.28 GiB22.32 GiB0.00 GiB8±22%
Phi-3-medium-4k-instructI1-Q4_K_M14.0B7.98 GiB13.28 GiB22.32 GiB0.00 GiB8±22%
gemma-4-26B-A4B-it-heretic-ara-v2MoEQ5_K_M25.8B18.52 GiB2.81 GiB22.32 GiB0.00 GiB8±22%
Ministral-3-14B-Instruct-2512-BF16Q6_K_L13.9B10.63 GiB10.63 GiB22.31 GiB0.01 GiB8±22%
INTELLECT-1-InstructQ8_010.2B10.11 GiB11.16 GiB22.31 GiB0.01 GiB8±22%
internlm2-math-plus-20bI1-IQ3_M19.9B8.50 GiB12.75 GiB22.31 GiB0.01 GiB8±22%
Rocinante-XL-16B-v1I1-IQ3_M16.1B6.91 GiB14.34 GiB22.30 GiB0.02 GiB8±22%
L3.2-Rogue-Creative-Instruct-Uncensored-Abliterated-7BQ3_K_M7.5B3.49 GiB17.80 GiB22.30 GiB0.02 GiB8±22%
Pantheon-Reasoning-26B-A4B-1.1MoEQ5_K_M26.5B18.47 GiB2.81 GiB22.26 GiB0.06 GiB8±22%
WizardCoder-Python-34B-V1.0I1-IQ2_XXS33.7B8.41 GiB12.75 GiB22.26 GiB0.06 GiB8±22%
Phind-CodeLlama-34B-Python-v1I1-IQ2_XXS33.7B8.41 GiB12.75 GiB22.26 GiB0.06 GiB8±22%
Phind-CodeLlama-34B-v2I1-IQ2_XXS33.7B8.41 GiB12.75 GiB22.26 GiB0.06 GiB8±22%
Llama3.2-24B-A3B-II-Dark-Champion-INSTRUCT-Heretic-Abliterated-UncensoredMoEI1-Q6_K18.0B13.81 GiB7.44 GiB22.26 GiB0.06 GiB10±37%
Darwin-35B-A3B-OpusMoEQ4_K_M36.0B19.92 GiB1.33 GiB22.25 GiB0.07 GiB31±37%
Aurora-Code-1MoEQ4_K_M34.7B19.92 GiB1.33 GiB22.25 GiB0.07 GiB31±37%
grug-35b-v2MoEQ4_K_M35.1B19.92 GiB1.33 GiB22.25 GiB0.07 GiB31±37%
grug-35bMoEQ4_K_M35.1B19.92 GiB1.33 GiB22.25 GiB0.07 GiB31±37%
WorldSim-Opus-3.6-35B-A3BMoEQ4_K_M35.1B19.92 GiB1.33 GiB22.25 GiB0.07 GiB31±37%
Qwen3.6-35B-A3B-AnkoMoEQ4_K_M35.1B19.92 GiB1.33 GiB22.25 GiB0.07 GiB31±37%
KAT-Coder-V2.5-DevMoEQ4_K_M34.7B19.92 GiB1.33 GiB22.25 GiB0.07 GiB31±37%
Ornith-1.0-35BMoEQ4_K_M34.7B19.92 GiB1.33 GiB22.25 GiB0.07 GiB31±37%
Nex-N2-miniMoEQ4_K_M35.1B19.92 GiB1.33 GiB22.25 GiB0.07 GiB31±37%
Qwen3.6-35B-A3BMoEUD-Q4_K_S36.0B19.92 GiB1.33 GiB22.25 GiB0.07 GiB31±37%
NVIDIA-Nemotron-Nano-9B-v2Q5_K_S8.9B6.32 GiB14.88 GiB22.24 GiB0.08 GiB8±22%
openNemo-9B-abliteratedQ5_K_S8.9B6.32 GiB14.88 GiB22.24 GiB0.08 GiB8±22%
umt5-xxlF325.7B21.17 GiB0.00 GiB22.22 GiB0.10 GiB8±22%
GLM-4.7-Flash-REAP-23B-A3BMoEQ6_K23.0B17.69 GiB3.51 GiB22.21 GiB0.11 GiB16±37%
dolphincoder-starcoder2-15bKV unresolvedQ8_016.0B15.80 GiB5.31 GiB22.20 GiB0.12 GiB8±22%
starcoder2-15bKV unresolvedQ8_016.0B15.80 GiB5.31 GiB22.20 GiB0.12 GiB8±22%
Phi-4-reasoning-plusQ4_K_S14.7B7.86 GiB13.28 GiB22.20 GiB0.12 GiB8±22%
Phi-4-reasoningQ4_K_S14.7B7.86 GiB13.28 GiB22.20 GiB0.12 GiB8±22%
phi-4Q4_K_S14.7B7.86 GiB13.28 GiB22.20 GiB0.12 GiB8±22%
Nemotron-Cascade-2-30B-A3BMoEQ3_K_M31.6B17.76 GiB3.45 GiB22.19 GiB0.13 GiB18±37%
GLM-4.7-FlashMoEQ4_131.2B17.67 GiB3.51 GiB22.19 GiB0.13 GiB17±37%
Salience-1.5-FlashMoEI1-Q3_K_L31.1B14.81 GiB6.38 GiB22.18 GiB0.14 GiB12±37%
Huihui-Qwen3-VL-30B-A3B-Instruct-abliteratedMoEI1-Q3_K_L31.1B14.81 GiB6.38 GiB22.18 GiB0.14 GiB12±37%
Qwen3-30B-A3B-Gemini-Pro-High-Reasoning-2507-ABLITERATED-UNCENSOREDMoEI1-Q3_K_L30.5B14.81 GiB6.38 GiB22.18 GiB0.14 GiB12±37%
MiroThinker-v1.0-30BMoEI1-Q3_K_L30.5B14.81 GiB6.38 GiB22.18 GiB0.14 GiB12±37%
Qwen3-30B-A3B-YOYO-V5MoEI1-Q3_K_L30.5B14.81 GiB6.38 GiB22.18 GiB0.14 GiB12±37%
Qwen3-30B-A3B-Thinking-2507-Claude-4.5-Sonnet-High-Reasoning-DistillMoEI1-Q3_K_L30.5B14.81 GiB6.38 GiB22.18 GiB0.14 GiB12±37%
Huihui-Qwen3-30B-A3B-Thinking-2507-abliteratedMoEI1-Q3_K_L30.5B14.81 GiB6.38 GiB22.18 GiB0.14 GiB12±37%
Huihui-Qwen3-30B-A3B-Instruct-2507-abliteratedMoEI1-Q3_K_L30.5B14.81 GiB6.38 GiB22.18 GiB0.14 GiB12±37%
Qwen3-30B-A3B-abliterated-eroticMoEI1-Q3_K_L30.5B14.81 GiB6.38 GiB22.18 GiB0.14 GiB12±37%
Qwen3-30B-A3B-abliteratedMoEQ3_K_L30.5B14.81 GiB6.38 GiB22.18 GiB0.14 GiB12±37%
Qwen3-30B-A3B-Instruct-2507MoEQ3_K_L30.5B14.81 GiB6.38 GiB22.18 GiB0.14 GiB12±37%
Qwen3-30B-A3B-Thinking-2507MoEQ3_K_L30.5B14.81 GiB6.38 GiB22.18 GiB0.14 GiB12±37%
Huihui-Qwen3-Coder-30B-A3B-Instruct-abliteratedMoEI1-Q3_K_L30.5B14.81 GiB6.38 GiB22.17 GiB0.15 GiB12±37%
Qwen3-Coder-30B-A3B-Instruct-RTPurboMoEI1-Q3_K_L30.5B14.81 GiB6.38 GiB22.17 GiB0.15 GiB12±37%
GLM-4.7-Flash-hereticMoEQ4_129.9B17.65 GiB3.51 GiB22.17 GiB0.15 GiB17±37%
EVA-abliterated-TIES-Qwen2.5-14BI1-Q4_K_M14.8B8.37 GiB12.75 GiB22.17 GiB0.15 GiB8±22%
Neuron-V1-14B-InstructI1-Q4_K_M14.8B8.37 GiB12.75 GiB22.17 GiB0.15 GiB8±22%
Ektome-Qwen2.5-Coder-14B-Instruct-PristinelyUncensoredI1-Q4_K_M14.8B8.37 GiB12.75 GiB22.17 GiB0.15 GiB8±22%
Qwen2.5-14B-Instruct-1M-abliteratedI1-Q4_K_M14.8B8.37 GiB12.75 GiB22.17 GiB0.15 GiB8±22%
DeepCoder-14B-PreviewQ4_K_M14.8B8.37 GiB12.75 GiB22.17 GiB0.15 GiB8±22%
Deepseeker-Kunou-Qwen2.5-14bI1-Q4_K_M14.8B8.37 GiB12.75 GiB22.17 GiB0.15 GiB8±22%
SuperNova-MediusQ4_K_M14.8B8.37 GiB12.75 GiB22.17 GiB0.15 GiB8±22%
14B-Qwen2.5-Kunou-v1I1-Q4_K_M14.8B8.37 GiB12.75 GiB22.17 GiB0.15 GiB8±22%
Sugoi-14B-Ultra-HFI1-Q4_K_M14.8B8.37 GiB12.75 GiB22.17 GiB0.15 GiB8±22%
Qwen2.5-14B-Instruct-abliterated-v2Q4_K_M14.8B8.37 GiB12.75 GiB22.17 GiB0.15 GiB8±22%
Qwen2.5-14B-Instruct-UncensoredQ4_K_M14.8B8.37 GiB12.75 GiB22.17 GiB0.15 GiB8±22%
From the filePredictedwhat these mean

Speed is modeled, not measured: decode is memory-bandwidth bound, so tokens per second is bytes read per token against achievable bandwidth. Mixture-of-experts models carry a wider band because only the routed experts are read each step, and few have been measured publicly.

Measured on this card

third-party benchmarks, aggregated
WorkloadMedianMiddle 50%Runs
Image generation12.04 it/s10.9313.0814
Benchmarked· n=14

Aggregated from community-submitted runs, so the spread is wide by nature — it covers different models, resolutions, step counts and settings, not one controlled configuration. Read the middle 50% rather than the median alone. These figures are reproduced with attribution from vladmandic-sd-data-benchmark, which publishes no licence — so we display and link rather than redistribute them.

Questions people ask

What AI models can a L4 run?
1720 of 2118 indexed open-weight models fit a L4 at 131,072 context with q8_0 KV cache, the largest being Phi-3-medium-128k-instruct at Q4_K_M. That covers text, vision-language, image, video and speech models.
How much usable memory does a L4 actually have?
Its nameplate is 24 GB, but about 22.32 GiB is available to a model once driver and compositor overhead is accounted for.
Is a L4 fast for local AI?
Its memory bandwidth is 300 GB/s, and that figure — not teraflops — is what governs token generation speed. Capacity decides what you can run; bandwidth decides how fast it runs.