Skip to content
llm-speed
Leaderboard/models/qwen3-0-6b

Qwen3-0.6B-4bit

4 workload results across 1 hardware configuration.

Fastest local config

429.2 decode tok/s

on M3 Ultra (60-core GPU) + 96GB unified via mlx. see full run

Local runs (4 runs)

Runs from contributors' own machines via MLX, llama.cpp, vLLM, exllamav2, or ollama. Signed on the submitter's hardware.

M3 Ultra (60-core GPU) + 96GB unifiedM3 Ultra (60-core GPU) + 96GB unified

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortmlx@0.31.3-429.2tok/s1,185.2tok/s92.8msr_6rgao6ao735
chat-longmlx@0.31.3-334.3tok/s6,893.3tok/s457msr_6rgao6ao735
concurrent-decodemlx@0.31.3-368.7tok/sno datano datar_6rgao6ao735
agent-tracemlx@0.31.3-368.5tok/s8,617.7tok/s233msr_6rgao6ao735

Qwen3-0.6B-4bit on hardware