Skip to content
llm-speed
Leaderboard/models/qwen2-5-14b-instruct

Qwen2.5-14B-Instruct-4bit

7 workload results across 3 hardware configurations.

Fastest local config

133.3 decode tok/s

on RTX 5090 (32GB) + AMD Ryzen 7 9850X3D 8-Core Processor (8c) + 30GB via llama.cpp. see full run

Local runs (7 runs)

Runs from contributors' own machines via MLX, llama.cpp, vLLM, exllamav2, or ollama. Signed on the submitter's hardware.

RTX 5090 (32GB) + AMD Ryzen 7 9850X3D 8-Core Processor (8c) + 30GBRTX 5090 (32GB) + AMD Ryzen 7 9850X3D 8-Core Processor (8c) + 30GB

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-130.3tok/sno data48.6msr_xr4qdv1hgf2
chat-longllama.cpp-122.7tok/sno data489msr_xr4qdv1hgf2
concurrent-decodellama.cpp-131.4tok/sno datano datar_xr4qdv1hgf2
agent-tracellama.cpp-122.8tok/s20,315.4tok/s111msr_xr4qdv1hgf2
chat-shortllama.cpp-133.3tok/sno data55.9msr_tj9bu7gvnvh

M3 Pro (18-core GPU) + 36GB unifiedM3 Pro (18-core GPU) + 36GB unified

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortmlx@0.31.34bit14.41tok/s117.9tok/s1,111msr_ia73dzeue0b

M3 Ultra (60-core GPU) + 96GB unifiedM3 Ultra (60-core GPU) + 96GB unified

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortmlx@0.31.34bit70.85tok/s301.7tok/s434msr_v4bq1sviz4o

Qwen2.5-14B-Instruct-4bit on hardware