Skip to content
llm-speed
Leaderboard/models/stable-code-instruct-3b

stable-code-instruct-3b-4bit

7 workload results across 3 hardware configurations.

Fastest local config

356.1 decode tok/s

on RTX 5090 (32GB) + AMD Ryzen 7 9850X3D 8-Core Processor (8c) + 30GB via llama.cpp. see full run

Local runs (7 runs)

Runs from contributors' own machines via MLX, llama.cpp, vLLM, exllamav2, or ollama. Signed on the submitter's hardware.

RTX 5090 (32GB) + AMD Ryzen 7 9850X3D 8-Core Processor (8c) + 30GBRTX 5090 (32GB) + AMD Ryzen 7 9850X3D 8-Core Processor (8c) + 30GB

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-341.9tok/sno data175msr_q9f15lz6831
chat-longllama.cpp-289.1tok/sno data232msr_q9f15lz6831
concurrent-decodellama.cpp-356.1tok/sno datano datar_q9f15lz6831
agent-tracellama.cpp-292.8tok/s44,387.5tok/s42.7msr_q9f15lz6831
chat-shortllama.cpp-331.0tok/sno data36.7msr_8l57cim1i10

M3 Ultra (60-core GPU) + 96GB unifiedM3 Ultra (60-core GPU) + 96GB unified

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortmlx@0.31.3-192.5tok/s560.7tok/s226msr_y2_5y8oo97d

M3 Pro (18-core GPU) + 36GB unifiedM3 Pro (18-core GPU) + 36GB unified

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortmlx@0.31.3-19.37tok/s131.3tok/s967msr_pqjsvd-cub4

stable-code-instruct-3b-4bit on hardware