Skip to content
llm-speed
Leaderboard/hardware/m4-max-40-core-gpu

M4 Max (40-core GPU) LLM benchmark

The fastest LLM measured on the M4 Max (40-core GPU) is qwen3-coder-bench-32k at 113.3 decode tok/s via ollama (signed run). Across 17 reproducible runs on 2 models, this page lists decode tok/s, prefill, and TTFT for each, every number linking to the run it came from.

Fastest known config on M4 Max (40-core GPU)

113.3 decode tok/s

qwen3-coder-bench-32k via ollama (Q4_K_M). see full run

qwen3-coder-bench-32k

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortollama@0.30.11Q4_K_M113.3tok/s84.12tok/s1,308msr_roktphpc--8
chat-longollama@0.30.11Q4_K_M97.40tok/s1,342.8tok/s2,344msr_roktphpc--8
concurrent-decodeollama@0.30.11Q4_K_M109.7tok/sno datano datar_roktphpc--8
agent-traceollama@0.30.11Q4_K_M103.2tok/s3,371.6tok/s477msr_roktphpc--8

qwen3-coder

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortollama@0.30.11Q4_K_M94.51tok/s65.06tok/s1,691msr_r0di2hkku1h
chat-longollama@0.30.11Q4_K_M97.35tok/s1,397.3tok/s2,252msr_r0di2hkku1h
concurrent-decodeollama@0.30.11Q4_K_M109.9tok/sno datano datar_r0di2hkku1h
agent-traceollama@0.30.11Q4_K_Mno datano datano datar_r0di2hkku1h
chat-shortollama@0.30.11Q4_K_M55.45tok/s675.2tok/s163msr_1o8q4lhgj88
chat-longollama@0.30.11Q4_K_M57.86tok/s28,422.4tok/s111msr_1o8q4lhgj88
concurrent-decodeollama@0.30.11Q4_K_M67.01tok/sno datano datar_1o8q4lhgj88
agent-traceollama@0.30.11Q4_K_Mno datano datano datar_1o8q4lhgj88
chat-shortollama@0.30.11Q4_K_M92.70tok/s719.0tok/s153msr_40h1dznuznk
chat-longollama@0.30.11Q4_K_M94.61tok/s1,396.5tok/s2,253msr_40h1dznuznk
concurrent-decodeollama@0.30.11Q4_K_M109.1tok/sno datano datar_40h1dznuznk
agent-traceollama@0.30.11Q4_K_Mno datano datano datar_40h1dznuznk
chat-shortollama@0.30.11Q4_K_M93.17tok/s13.30tok/s8,270msr_txvkjgoyyxs

Models measured on M4 Max (40-core GPU)

Common questions about M4 Max (40-core GPU)

Direct Q&A drawn from the runs above: fastest LLM, supported model classes, backend rankings, quantization guidance.

Read the M4 Max (40-core GPU) FAQ →