Skip to content
llm-speed
Leaderboard/models/stable-code-instruct-3b

stable-code-instruct-3b-4bit

7 workload results across 3 hardware configurations.

Fastest local config

356.1 decode tok/s

on RTX 5090 (32GB) + AMD Ryzen 7 9850X3D 8-Core Processor (8c) + 30GB via llama.cpp. see full run

Local runs (7 workload results)

Runs from contributors' own machines via MLX, llama.cpp, vLLM, exllamav2, or ollama. Signed on the submitter's hardware.

RTX 5090 (32GB) + AMD Ryzen 7 9850X3D 8-Core Processor (8c) + 30GBRTX 5090 (32GB) + AMD Ryzen 7 9850X3D 8-Core Processor (8c) + 30GB

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-341.9tok/sno data175msr_q9f15lz6831
chat-longllama.cpp-289.1tok/sno data232msr_q9f15lz6831
concurrent-decodellama.cpp-356.1tok/sno datano datar_q9f15lz6831
agent-tracellama.cpp-292.8tok/s44,387.5tok/s42.7msr_q9f15lz6831
chat-shortllama.cpp-331.0tok/sno data36.7msr_8l57cim1i10

M3 Ultra (60-core GPU) + 96GB unifiedM3 Ultra (60-core GPU) + 96GB unified

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortmlx@0.31.3-192.5tok/s560.7tok/s226msr_y2_5y8oo97d

M3 Pro (18-core GPU) + 36GB unifiedM3 Pro (18-core GPU) + 36GB unified

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortmlx@0.31.3-19.37tok/s131.3tok/s967msr_pqjsvd-cub4

stable-code-instruct-3b-4bit on hardware