Skip to content
llm-speed
Leaderboard/hardware/rtx-5090-32gb

RTX 5090 (32GB) LLM benchmark

The fastest LLM measured on the RTX 5090 (32GB) is stable-code-instruct-3b at 356.1 decode tok/s via llama.cpp (signed run). Across 97 reproducible runs on 19 models, this page lists decode tok/s, prefill, and TTFT for each, every number linking to the run it came from.

Fastest known config on RTX 5090 (32GB)

356.1 decode tok/s

stable-code-instruct-3b via llama.cpp. see full run

Coder-V2-Lite-Instruct

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-293.1tok/sno data297msr_bfpto9so2o1
chat-longllama.cpp-181.2tok/sno data361msr_bfpto9so2o1
concurrent-decodellama.cpp-268.4tok/sno datano datar_bfpto9so2o1
agent-tracellama.cpp-204.5tok/s24,978.7tok/s80.7msr_bfpto9so2o1
chat-shortllama.cpp-309.5tok/sno data268msr_0_gs1rgl2fl

gpt-oss-20b

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-318.4tok/sno data173msr_b9ul-vxh9sc
chat-longllama.cpp-301.6tok/sno data239msr_b9ul-vxh9sc
concurrent-decodellama.cpp-302.8tok/sno datano datar_b9ul-vxh9sc
agent-tracellama.cpp-304.5tok/s26,907.5tok/s77.7msr_b9ul-vxh9sc
chat-shortllama.cpp-69.42tok/sno data333msr_r9h57uts9lr

Yi-Coder-9B-Chat

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-66.79tok/sno data317msr_zlh6az5q0o_
chat-longllama.cpp-69.60tok/sno data1,195msr_zlh6az5q0o_
concurrent-decodellama.cpp-70.99tok/sno datano datar_zlh6az5q0o_
agent-tracellama.cpp-71.76tok/s4,478.0tok/s397msr_zlh6az5q0o_
chat-shortllama.cpp-199.3tok/sno data36.2msr_u4iojm6-ekg

stable-code-instruct-3b

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-341.9tok/sno data175msr_q9f15lz6831
chat-longllama.cpp-289.1tok/sno data232msr_q9f15lz6831
concurrent-decodellama.cpp-356.1tok/sno datano datar_q9f15lz6831
agent-tracellama.cpp-292.8tok/s44,387.5tok/s42.7msr_q9f15lz6831
chat-shortllama.cpp-331.0tok/sno data36.7msr_8l57cim1i10

Qwen2.5-32B-Instruct

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-68.71tok/sno data77.0msr_bjy5a5izxjc
chat-longllama.cpp-65.36tok/sno data968msr_bjy5a5izxjc
concurrent-decodellama.cpp-68.60tok/sno datano datar_bjy5a5izxjc
agent-tracellama.cpp-66.45tok/s10,407.9tok/s214msr_bjy5a5izxjc
chat-shortllama.cpp-71.90tok/sno data115msr_twfs86tf_xf

Qwen2.5-14B-Instruct

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-130.3tok/sno data48.6msr_xr4qdv1hgf2
chat-longllama.cpp-122.7tok/sno data489msr_xr4qdv1hgf2
concurrent-decodellama.cpp-131.4tok/sno datano datar_xr4qdv1hgf2
agent-tracellama.cpp-122.8tok/s20,315.4tok/s111msr_xr4qdv1hgf2
chat-shortllama.cpp-133.3tok/sno data55.9msr_tj9bu7gvnvh

Llama-3.1-8B-Instruct

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-229.4tok/sno data35.6msr_qr4srge34da
chat-longllama.cpp-211.4tok/sno data266msr_qr4srge34da
concurrent-decodellama.cpp-223.0tok/sno datano datar_qr4srge34da
agent-tracellama.cpp-210.3tok/s36,720.3tok/s60.8msr_qr4srge34da
chat-shortllama.cpp-232.2tok/sno data33.8msr_kfrkg-vn376

Qwen2.5-7B-Instruct

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-232.7tok/sno data37.0msr_1shiviswt3d
chat-longllama.cpp-232.4tok/sno data239msr_1shiviswt3d
concurrent-decodellama.cpp-240.7tok/sno datano datar_1shiviswt3d
agent-tracellama.cpp-232.5tok/s38,007.7tok/s57.1msr_1shiviswt3d
chat-shortllama.cpp-246.7tok/sno data33.9msr_3yn-4321hp-

Qwen3-32B

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-66.51tok/sno data158msr_-txe_hiq44n
chat-longllama.cpp-62.30tok/sno data1,067msr_-txe_hiq44n
concurrent-decodellama.cpp-66.64tok/sno datano datar_-txe_hiq44n
agent-tracellama.cpp-64.34tok/s8,394.1tok/s259msr_-txe_hiq44n
chat-shortllama.cpp-69.45tok/sno data327msr_phvxm9dcak0

phi-4

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-139.1tok/sno data51.1msr_k1u_k1j_1i2
chat-longllama.cpp-133.7tok/sno data433msr_k1u_k1j_1i2
concurrent-decodellama.cpp-140.2tok/sno datano datar_k1u_k1j_1i2
agent-tracellama.cpp-124.8tok/s21,162.4tok/s102msr_k1u_k1j_1i2
chat-shortllama.cpp-140.9tok/sno data56.7msr_e-k4aea8ipr

gemma-2-9b-it

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-69.45tok/sno data325msr_1_xl4zb5-xj
chat-longllama.cpp-69.42tok/sno data1,044msr_1_xl4zb5-xj
concurrent-decodellama.cpp-68.57tok/sno datano datar_1_xl4zb5-xj
agent-tracellama.cpp-68.46tok/s4,816.8tok/s420msr_1_xl4zb5-xj
chat-shortllama.cpp-152.7tok/sno data58.9msr__b_bzmmab_8

Qwen2.5-Coder-32B-Instruct

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-67.41tok/sno data384msr_v983y0y3r2u
chat-longllama.cpp-69.15tok/sno data1,251msr_v983y0y3r2u
concurrent-decodellama.cpp-70.96tok/sno datano datar_v983y0y3r2u
agent-tracellama.cpp-68.56tok/s4,677.1tok/s414msr_v983y0y3r2u
chat-shortllama.cpp-71.91tok/sno data71.0msr_nkbs6d3-d21

Qwen2.5-Coder-14B-Instruct

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-140.0tok/sno data42.1msr_opuj21f13-_
chat-longllama.cpp-123.0tok/sno data457msr_opuj21f13-_
concurrent-decodellama.cpp-133.8tok/sno datano datar_opuj21f13-_
agent-tracellama.cpp-130.5tok/s21,985.9tok/s104msr_opuj21f13-_
chat-shortllama.cpp-136.0tok/sno data51.3msr_p_f63tcgans

Qwen2.5-Coder-7B-Instruct

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-255.3tok/sno data35.4msr_2b9o6y_49mi
chat-longllama.cpp-244.0tok/sno data228msr_2b9o6y_49mi
concurrent-decodellama.cpp-254.0tok/sno datano datar_2b9o6y_49mi
agent-tracellama.cpp-229.9tok/s38,735.2tok/s57.4msr_2b9o6y_49mi
chat-shortllama.cpp-244.9tok/sno data36.1msr_mln72x5zbis

Qwen3-Coder-30B-A3B-Instruct

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-68.41tok/sno data334msr_pm_a1uf2ufc
chat-longllama.cpp-70.55tok/sno data1,204msr_pm_a1uf2ufc
concurrent-decodellama.cpp-68.04tok/sno datano datar_pm_a1uf2ufc
agent-tracellama.cpp-66.09tok/s4,816.7tok/s451msr_pm_a1uf2ufc
chat-shortllama.cpp-259.9tok/sno data218msr_c7qyvvmmsv1

Codestral-22B-v0.1

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-93.72tok/sno data68.6msr_4q040m4scic
chat-longllama.cpp-87.36tok/sno data849msr_4q040m4scic
concurrent-decodellama.cpp-100.3tok/sno datano datar_4q040m4scic
agent-tracellama.cpp-93.44tok/s10,351.0tok/s191msr_4q040m4scic
chat-shortllama.cpp-69.95tok/sno data199msr_sqr8liqh4ii

Qwen3.6-35B-A3B-Q4_K_M.gguf

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-223.3tok/sno data263msr_dp6sr2_iwcf
chat-shortllama.cpp-224.0tok/sno data167msr_a56-wxl21lk
chat-shortllama.cpp-216.5tok/sno data185msr_k070lz99uzi
chat-shortllama.cpp-221.6tok/sno data207msr_dqelw_a8f2c

gemma-4-31B-it-Q4_K_M.gguf

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-67.37tok/sno data180msr_uut6m_v6ui9
chat-shortllama.cpp-67.27tok/sno data344msr_23fireoga9y
chat-shortllama.cpp-67.33tok/sno data156msr_1ofpvf4m7p5
chat-shortllama.cpp-67.31tok/sno data160msr_wwq2l7lmy6d

Qwen3.6-27B-Q4_K_M.gguf

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-72.38tok/sno data167msr_yluotk909p8
chat-shortllama.cpp-72.48tok/sno data172msr_v2vrkr4uah1
chat-shortllama.cpp-69.56tok/sno data227msr_u4wa_y_y3vt
chat-shortllama.cpp-72.57tok/sno data172msr_l-wg5a6o-vg
chat-shortllama.cpp-69.56tok/sno data174msr_w482rf72v6z
chat-shortllama.cpp-72.32tok/sno data290msr_ercjdbdw2gi
chat-shortllama.cpp-69.60tok/sno data382msr_aj808r0dw53
chat-shortllama.cpp-72.31tok/sno data198msr_4upad7ubcpi
chat-shortllama.cpp-68.00tok/sno data241msr_qiq8q_cqfk5

Models measured on RTX 5090 (32GB)

Common questions about RTX 5090 (32GB)

Direct Q&A drawn from the runs above: fastest LLM, supported model classes, backend rankings, quantization guidance.

Read the RTX 5090 (32GB) FAQ โ†’