Skip to content
llm-speed
Leaderboard/hardware/rtx-3090-24gb

RTX 3090 (24GB) LLM benchmark

The fastest LLM measured on the RTX 3090 (24GB) is coder-v2 at 189.5 decode tok/s via ollama (signed run). Across 16 reproducible runs on 3 models, this page lists decode tok/s, prefill, and TTFT for each, every number linking to the run it came from.

Fastest known config on RTX 3090 (24GB)

189.5 decode tok/s

coder-v2 via ollama (Q4_0). see full run

coder-v2

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortollama@0.31.1Q4_0189.5tok/s159.2tok/s735msr_o2-1w665rtq
chat-longollama@0.31.1Q4_077.56tok/s3,907.5tok/s838msr_o2-1w665rtq
concurrent-decodeollama@0.31.1Q4_0155.6tok/sno datano datar_o2-1w665rtq
agent-traceollama@0.31.1Q4_0101.2tok/s6,933.1tok/s352msr_o2-1w665rtq

qwen2.5-coder

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortollama@0.31.1Q4_K_M69.21tok/s402.0tok/s326msr_6ahy-dq0f_0
chat-longollama@0.31.1Q4_K_M65.83tok/s2,070.6tok/s1,530msr_6ahy-dq0f_0
concurrent-decodeollama@0.31.1Q4_K_M67.64tok/sno datano datar_6ahy-dq0f_0
agent-traceollama@0.31.1Q4_K_M63.63tok/s3,518.8tok/s483msr_6ahy-dq0f_0
chat-shortollama@0.31.1Q4_K_M39.86tok/s2.83tok/s46,337msr_pb0jpnbujji
chat-longollama@0.31.1Q4_K_M135.0tok/s3,319.4tok/s954msr_pb0jpnbujji
concurrent-decodeollama@0.31.1Q4_K_M139.2tok/sno datano datar_pb0jpnbujji
agent-traceollama@0.31.1Q4_K_M134.2tok/s4,111.1tok/s487msr_pb0jpnbujji

llama3.1

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortollama@0.31.1Q4_K_M136.2tok/s2.20tok/s49,960msr_9hurqggbshk
chat-longollama@0.31.1Q4_K_M127.5tok/s3,004.3tok/s1,044msr_9hurqggbshk
concurrent-decodeollama@0.31.1Q4_K_M133.9tok/sno datano datar_9hurqggbshk
agent-traceollama@0.31.1Q4_K_M127.5tok/s3,475.9tok/s527msr_9hurqggbshk

Models measured on RTX 3090 (24GB)

Common questions about RTX 3090 (24GB)

Direct Q&A drawn from the runs above: fastest LLM, supported model classes, backend rankings, quantization guidance.

Read the RTX 3090 (24GB) FAQ →