Skip to content
llm-speed

RTX 3090 (24GB) LLM benchmark

The fastest LLM measured on the RTX 3090 (24GB) is coder-v2 at 189.5 decode tok/s via ollama (signed run). Across 16 reproducible runs on 3 models, this page lists decode tok/s, prefill, and TTFT for each, every number linking to the run it came from.

Fastest known config on RTX 3090 (24GB)

189.5 decode tok/s

coder-v2 via ollama (Q4_0). see full run

coder-v2

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortollama@0.31.1Q4_0189.5tok/s159.2tok/s735msr_o2-1w665rtq
chat-longollama@0.31.1Q4_077.56tok/s3,907.5tok/s838msr_o2-1w665rtq
concurrent-decodeollama@0.31.1Q4_0155.6tok/sno datano datar_o2-1w665rtq
agent-traceollama@0.31.1Q4_0101.2tok/s6,933.1tok/s352msr_o2-1w665rtq

qwen2.5-coder

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortollama@0.31.1Q4_K_M69.21tok/s402.0tok/s326msr_6ahy-dq0f_0
chat-longollama@0.31.1Q4_K_M65.83tok/s2,070.6tok/s1,530msr_6ahy-dq0f_0
concurrent-decodeollama@0.31.1Q4_K_M67.64tok/sno datano datar_6ahy-dq0f_0
agent-traceollama@0.31.1Q4_K_M63.63tok/s3,518.8tok/s483msr_6ahy-dq0f_0
chat-shortollama@0.31.1Q4_K_M39.86tok/s2.83tok/s46,337msr_pb0jpnbujji
chat-longollama@0.31.1Q4_K_M135.0tok/s3,319.4tok/s954msr_pb0jpnbujji
concurrent-decodeollama@0.31.1Q4_K_M139.2tok/sno datano datar_pb0jpnbujji
agent-traceollama@0.31.1Q4_K_M134.2tok/s4,111.1tok/s487msr_pb0jpnbujji

llama3.1

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortollama@0.31.1Q4_K_M136.2tok/s2.20tok/s49,960msr_9hurqggbshk
chat-longollama@0.31.1Q4_K_M127.5tok/s3,004.3tok/s1,044msr_9hurqggbshk
concurrent-decodeollama@0.31.1Q4_K_M133.9tok/sno datano datar_9hurqggbshk
agent-traceollama@0.31.1Q4_K_M127.5tok/s3,475.9tok/s527msr_9hurqggbshk

Community folklore on RTX 3090 (24GB)

401 unverified claims extracted from Reddit/HN comments. Lower trust than signed runs above; every row links to the source.

  • communityconfidence 85%

    10.00tok/s qwen-2.5-32B on RTX 3090 via ollama Q8

    our signed data: RTX 3090 · qwen-2.5-32B

    a beast! 28 tok/sec at 32K context is more than usable for a lot of coding situations. * The P40s continue to surprise. A single P40 can do 10 tok/sec, which is perfectly usable. * 3xP40 fits 120K context at Q8 comfortably. * performance doesn't scale with more P40s. Using `-sm r…

    source: Reddit · u/No-Statement-0001 · 2024-11-11

  • communityconfidence 85%

    28.00tok/s qwen-2.5-32B on RTX 3090 via ollama Q8

    our signed data: RTX 3090 · qwen-2.5-32B

    ase of qwen-2.5-32B today. I bench marked the Q4 and Q8 quants on my local rig (3xP40, 1x3090). Some observations: * the 3090 is a beast! 28 tok/sec at 32K context is more than usable for a lot of coding situations. * The P40s continue to surprise. A single P40 can do 10 tok/se…

    source: Reddit · u/No-Statement-0001 · 2024-11-11

  • communityconfidence 85%

    10.00tok/s qwen-2.5-32B on RTX 3090 via ollama Q8

    our signed data: RTX 3090 · qwen-2.5-32B

    a beast! 28 tok/sec at 32K context is more than usable for a lot of coding situations. * The P40s continue to surprise. A single P40 can do 10 tok/sec, which is perfectly usable. * 3xP40 fits 120K context at Q8 comfortably. * performance doesn't scale with more P40s. Using `-sm r…

    source: Reddit · u/No-Statement-0001 · 2024-11-11

  • communityconfidence 85%

    28.00tok/s qwen-2.5-32B on RTX 3090 via ollama Q8

    our signed data: RTX 3090 · qwen-2.5-32B

    ase of qwen-2.5-32B today. I bench marked the Q4 and Q8 quants on my local rig (3xP40, 1x3090). Some observations: * the 3090 is a beast! 28 tok/sec at 32K context is more than usable for a lot of coding situations. * The P40s continue to surprise. A single P40 can do 10 tok/se…

    source: Reddit · u/No-Statement-0001 · 2024-11-11

  • communityconfidence 85%

    65.00tok/s Qwen3-Coder-Next on RTX 3090 via vllm FP8

    our signed data: RTX 3090 · Qwen3-Coder-Next

    Next-FP8-Dynamic quant with vLLM v0.16.0 over 4 RTX 3090s with a 200k context window. I get around 71tps at low context, dropping to around 65tps at the 100k context point. Something to note, I'm seeing pretty bad issues with vLLM nightly, affecting this model especially, that c…

    source: Reddit · u/rmhubbert · 2026-03-04

  • communityconfidence 85%

    71.00tok/s Qwen3-Coder-Next on RTX 3090 via vllm FP8

    our signed data: RTX 3090 · Qwen3-Coder-Next

    sted. I'm running Unsloth's Qwen3-Coder-Next-FP8-Dynamic quant with vLLM v0.16.0 over 4 RTX 3090s with a 200k context window. I get around 71tps at low context, dropping to around 65tps at the 100k context point. Something to note, I'm seeing pretty bad issues with vLLM nightly…

    source: Reddit · u/rmhubbert · 2026-03-04

  • communityconfidence 85%

    65.00tok/s Qwen3-Coder-Next on RTX 3090 via vllm FP8

    our signed data: RTX 3090 · Qwen3-Coder-Next

    Next-FP8-Dynamic quant with vLLM v0.16.0 over 4 RTX 3090s with a 200k context window. I get around 71tps at low context, dropping to around 65tps at the 100k context point. Something to note, I'm seeing pretty bad issues with vLLM nightly, affecting this model especially, that c…

    source: Reddit · u/rmhubbert · 2026-03-04

  • communityconfidence 85%

    71.00tok/s Qwen3-Coder-Next on RTX 3090 via vllm FP8

    our signed data: RTX 3090 · Qwen3-Coder-Next

    sted. I'm running Unsloth's Qwen3-Coder-Next-FP8-Dynamic quant with vLLM v0.16.0 over 4 RTX 3090s with a 200k context window. I get around 71tps at low context, dropping to around 65tps at the 100k context point. Something to note, I'm seeing pretty bad issues with vLLM nightly…

    source: Reddit · u/rmhubbert · 2026-03-04

  • communityconfidence 85%

    65.00tok/s Qwen3-Coder-Next on RTX 3090 via vllm FP8

    our signed data: RTX 3090 · Qwen3-Coder-Next

    Next-FP8-Dynamic quant with vLLM v0.16.0 over 4 RTX 3090s with a 200k context window. I get around 71tps at low context, dropping to around 65tps at the 100k context point. Something to note, I'm seeing pretty bad issues with vLLM nightly, affecting this model especially, that c…

    source: Reddit · u/rmhubbert · 2026-03-04

  • communityconfidence 85%

    71.00tok/s Qwen3-Coder-Next on RTX 3090 via vllm FP8

    our signed data: RTX 3090 · Qwen3-Coder-Next

    sted. I'm running Unsloth's Qwen3-Coder-Next-FP8-Dynamic quant with vLLM v0.16.0 over 4 RTX 3090s with a 200k context window. I get around 71tps at low context, dropping to around 65tps at the 100k context point. Something to note, I'm seeing pretty bad issues with vLLM nightly…

    source: Reddit · u/rmhubbert · 2026-03-04

See all 401 claims for RTX 3090 (24GB)

Models measured on RTX 3090 (24GB)

Common questions about RTX 3090 (24GB)

Direct Q&A drawn from the runs above: fastest LLM, supported model classes, backend rankings, quantization guidance.

Read the RTX 3090 (24GB) FAQ →