Skip to content
llm-speed
Leaderboard/models/yi-coder-9b-chat

Yi-Coder-9B-Chat-4bit

6 workload results across 2 hardware configurations.

Fastest local config

199.3 decode tok/s

on RTX 5090 (32GB) + AMD Ryzen 7 9850X3D 8-Core Processor (8c) + 30GB via llama.cpp. see full run

Local runs (6 workload results)

Runs from contributors' own machines via MLX, llama.cpp, vLLM, exllamav2, or ollama. Signed on the submitter's hardware.

RTX 5090 (32GB) + AMD Ryzen 7 9850X3D 8-Core Processor (8c) + 30GBRTX 5090 (32GB) + AMD Ryzen 7 9850X3D 8-Core Processor (8c) + 30GB

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortllama.cpp-66.79tok/sno data317msr_zlh6az5q0o_
chat-longllama.cpp-69.60tok/sno data1,195msr_zlh6az5q0o_
concurrent-decodellama.cpp-70.99tok/sno datano datar_zlh6az5q0o_
agent-tracellama.cpp-71.76tok/s4,478.0tok/s397msr_zlh6az5q0o_
chat-shortllama.cpp-199.3tok/sno data36.2msr_u4iojm6-ekg

M3 Ultra (60-core GPU) + 96GB unifiedM3 Ultra (60-core GPU) + 96GB unified

WorkloadBackendQuantdecode tok/sprefill tok/sTTFTRun
chat-shortmlx@0.31.3-103.5tok/s390.9tok/s307msr_3hvui9a1yuc

Yi-Coder-9B-Chat-4bit on hardware