Skip to content
llm-speed
Leaderboard/models/deepseek-r1-0528-qwen3-8b

R1-0528-Qwen3-8B-MLX-4bit

4 workload results across 1 hardware configuration.

Fastest local config

116.8 decode tok/s

on M3 Ultra (60-core GPU) + 96GB unified via mlx. see full run

Local runs (4 runs)

Runs from contributors' own machines via MLX, llama.cpp, vLLM, exllamav2, or ollama. Signed on the submitter's hardware.

M3 Ultra (60-core GPU) + 96GB unifiedM3 Ultra (60-core GPU) + 96GB unified

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortmlx@0.31.3-116.8tok/s424.5tok/s247msr_yy_6jfx70jq
chat-longmlx@0.31.3-100.5tok/s1,104.0tok/s2,846msr_yy_6jfx70jq
concurrent-decodemlx@0.31.3-110.6tok/sno datano datar_yy_6jfx70jq
agent-tracemlx@0.31.3-107.2tok/s1,108.9tok/s1,884msr_yy_6jfx70jq

R1-0528-Qwen3-8B-MLX-4bit on hardware