Skip to content
llm-speed
Leaderboard/models/qwen3-6-agent-q6k-ctx128k

qwen3.6-agent-q6k-ctx128k

1 workload result across 1 hardware configuration.

Fastest local config

88.3 decode tok/s

on M5 Max (40-core GPU) + 48GB unified via ollama (Q6_K). see full run

Local runs (1 run)

Runs from contributors' own machines via MLX, llama.cpp, vLLM, exllamav2, or ollama. Signed on the submitter's hardware.

M5 Max (40-core GPU) + 48GB unifiedM5 Max (40-core GPU) + 48GB unified

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortollama@0.32.1Q6_K88.29tok/s16.20tok/s6,915msr_udwgba7udqu

qwen3.6-agent-q6k-ctx128k on hardware