Skip to content
llm-speed
Leaderboard/hardware/rtx-4090-24gb

RTX 4090 (24GB) LLM benchmark

The fastest LLM measured on the RTX 4090 (24GB) is gemma3 at 195.0 decode tok/s via ollama (signed run). Across 40 reproducible runs on 5 models, this page lists decode tok/s, prefill, and TTFT for each, every number linking to the run it came from.

Fastest known config on RTX 4090 (24GB)

195.0 decode tok/s

gemma3 via ollama (Q4_K_M). see full run

glm-4.7-flash

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortollama@0.31.1Q4_K_Mno datano datano datar_o636l3cc-rr
chat-longollama@0.31.1Q4_K_Mno datano datano datar_o636l3cc-rr
concurrent-decodeollama@0.31.1Q4_K_Mno datano datano datar_o636l3cc-rr
agent-traceollama@0.31.1Q4_K_M129.9tok/s2,491.1tok/s1,262msr_o636l3cc-rr

gemma3

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortollama@0.31.1Q4_K_M46.95tok/s144.5tok/s817msr_x23y_sg24pm
chat-longollama@0.31.1Q4_K_M45.25tok/s1,594.1tok/s1,998msr_x23y_sg24pm
concurrent-decodeollama@0.31.1Q4_K_M46.17tok/sno datano datar_x23y_sg24pm
agent-traceollama@0.31.1Q4_K_M45.33tok/s2,556.8tok/s956msr_x23y_sg24pm
chat-shortollama@0.31.1Q4_K_M92.65tok/s171.4tok/s689msr_3kmrc135e0e
chat-longollama@0.31.1Q4_K_M87.60tok/s2,206.4tok/s1,444msr_3kmrc135e0e
concurrent-decodeollama@0.31.1Q4_K_M90.43tok/sno datano datar_3kmrc135e0e
agent-traceollama@0.31.1Q4_K_M88.53tok/s3,123.9tok/s815msr_3kmrc135e0e
chat-shortollama@0.31.1Q4_K_M195.0tok/s167.2tok/s706msr_dlanfbgym0h
chat-longollama@0.31.1Q4_K_M187.6tok/s3,254.1tok/s979msr_dlanfbgym0h
concurrent-decodeollama@0.31.1Q4_K_M193.1tok/sno datano datar_dlanfbgym0h
agent-traceollama@0.31.1Q4_K_M190.0tok/s3,543.4tok/s715msr_dlanfbgym0h

r1

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortollama@0.31.1Q4_K_Mno datano datano datar_zrjj-pj93q8
chat-longollama@0.31.1Q4_K_M81.09tok/s240.4tok/s13,070msr_zrjj-pj93q8
concurrent-decodeollama@0.31.1Q4_K_Mno datano datano datar_zrjj-pj93q8
agent-traceollama@0.31.1Q4_K_Mno datano datano datar_zrjj-pj93q8
chat-shortollama@0.31.1Q4_K_Mno datano datano datar_fg77v2hhohb
chat-longollama@0.31.1Q4_K_M131.9tok/s686.3tok/s4,578msr_fg77v2hhohb
concurrent-decodeollama@0.31.1Q4_K_Mno datano datano datar_fg77v2hhohb
agent-traceollama@0.31.1Q4_K_M133.8tok/s8,852.4tok/s366msr_fg77v2hhohb
chat-shortollama@0.31.1Q4_K_Mno datano datano datar_l2ck67ls40i
chat-longollama@0.31.1Q4_K_M3.76tok/s14.28tok/s219,986msr_l2ck67ls40i
concurrent-decodeollama@0.31.1Q4_K_Mno datano datano datar_l2ck67ls40i
agent-traceollama@0.31.1Q4_K_M3.79tok/s3,515.1tok/s971msr_l2ck67ls40i
chat-shortollama@0.31.1Q4_K_Mno datano datano datar_2r1p3w9ps7c
chat-longollama@0.31.1Q4_K_M131.0tok/s599.9tok/s5,238msr_2r1p3w9ps7c
concurrent-decodeollama@0.31.1Q4_K_Mno datano datano datar_2r1p3w9ps7c
agent-traceollama@0.31.1Q4_K_M132.4tok/s9,612.8tok/s337msr_2r1p3w9ps7c

qwen3-coder

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortollama@0.31.1Q4_K_M145.2tok/s195.6tok/s562msr_wjq32z47vlp
chat-longollama@0.31.1Q4_K_M165.5tok/s3,527.2tok/s892msr_wjq32z47vlp
concurrent-decodeollama@0.31.1Q4_K_M179.9tok/sno datano datar_wjq32z47vlp
agent-traceollama@0.31.1Q4_K_Mno datano datano datar_wjq32z47vlp

gpt-oss

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortollama@0.31.1MXFP4no datano datano datar_iu2sfa9ykvw
chat-longollama@0.31.1MXFP4141.7tok/s631.5tok/s5,048msr_iu2sfa9ykvw
concurrent-decodeollama@0.31.1MXFP4no datano datano datar_iu2sfa9ykvw
agent-traceollama@0.31.1MXFP4no datano datano datar_iu2sfa9ykvw

Models measured on RTX 4090 (24GB)

Common questions about RTX 4090 (24GB)

Direct Q&A drawn from the runs above: fastest LLM, supported model classes, backend rankings, quantization guidance.

Read the RTX 4090 (24GB) FAQ →