Skip to content
llm-speed
Leaderboard/hardware/rtx-4090-48gb

RTX 4090 (48GB) LLM benchmark

The fastest LLM measured on the RTX 4090 (48GB) is qwen2.5-coder at 161.1 decode tok/s via ollama (signed run). Across 16 reproducible runs on 3 models, this page lists decode tok/s, prefill, and TTFT for each, every number linking to the run it came from.

Fastest known config on RTX 4090 (48GB)

161.1 decode tok/s

qwen2.5-coder via ollama (Q4_K_M). see full run

qwen3.6

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortollama@0.31.1Q4_K_Mno datano datano datar_h_659oy695r
chat-longollama@0.31.1Q4_K_Mno datano datano datar_h_659oy695r
concurrent-decodeollama@0.31.1Q4_K_Mno datano datano datar_h_659oy695r
agent-traceollama@0.31.1Q4_K_M44.18tok/s1,910.5tok/s1,808msr_h_659oy695r

qwen2.5-coder

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortollama@0.31.1Q4_K_M89.45tok/s466.6tok/s281msr_73tnfdueq2h
chat-longollama@0.31.1Q4_K_M83.84tok/s3,572.3tok/s887msr_73tnfdueq2h
concurrent-decodeollama@0.31.1Q4_K_M88.63tok/sno datano datar_73tnfdueq2h
agent-traceollama@0.31.1Q4_K_M86.21tok/s5,298.4tok/s395msr_73tnfdueq2h
chat-shortollama@0.31.1Q4_K_M159.4tok/s452.0tok/s290msr_mv8n8k9wu1e
chat-longollama@0.31.1Q4_K_M154.7tok/s5,998.7tok/s528msr_mv8n8k9wu1e
concurrent-decodeollama@0.31.1Q4_K_M161.1tok/sno datano datar_mv8n8k9wu1e
agent-traceollama@0.31.1Q4_K_M158.1tok/s6,421.1tok/s320msr_mv8n8k9wu1e

llama3.1

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortollama@0.31.1Q4_K_M154.4tok/s328.0tok/s335msr_h1ub_1uxzdh
chat-longollama@0.31.1Q4_K_M146.3tok/s5,032.5tok/s623msr_h1ub_1uxzdh
concurrent-decodeollama@0.31.1Q4_K_M154.2tok/sno datano datar_h1ub_1uxzdh
agent-traceollama@0.31.1Q4_K_M149.4tok/s5,377.5tok/s387msr_h1ub_1uxzdh

Models measured on RTX 4090 (48GB)

Common questions about RTX 4090 (48GB)

Direct Q&A drawn from the runs above: fastest LLM, supported model classes, backend rankings, quantization guidance.

Read the RTX 4090 (48GB) FAQ →