LLM tokens per second — live multi-provider benchmark

Real inference speed, measured continuously. Every row is a live model from Ollama, OpenCode Zen, or OpenCode Go — sorted by tokens per second, benchmarked every ~10 minutes on Ollama Pro, every ~60 minutes on Ollama Free and OpenCode Zen, and every ~30 minutes on OpenCode Go.

Independent & vendor-neutral — no paid placement. TokenDyno is not affiliated with any provider it benchmarks and receives no payment for ranking or favorable coverage. Read the independence policy →

● live — last benchmark 2m ago
Trend
GPT-OSS 120B Ollama Free 262.6 165.5 383ms 100% 12.3 58m ago
Gemma4 31B Ollama Pro 253.5 314.4 343ms 100% 15.4 7m ago
Gemma4 31B Ollama Free 209.5 287.5 347ms 100% 15.4 4m ago
GPT-OSS 120B Ollama Pro 203.5 163.8 386ms 100% 12.3 2m ago
Nemotron 3 Nano 30B (non-reasoning) Ollama Pro 197.9 216.7 472ms 100% 6.8 10m ago
Nemotron 3 Nano 30B (non-reasoning) Ollama Free 179.9 115.2 546ms 100% 6.8 50m ago
DeepSeek V4 Flash OpenCode Go 179.4 184.5 1.3s 100% 34.5 2m ago
DeepSeek V4.1 Flash OpenCode Go 178.3 193.0 1.1s 100% 39.5 22m ago
DeepSeek V4 Flash Vision Exp OpenCode Go 175.4 197.2 873ms 100% 35 14m ago
DeepSeek Flash OpenCode Go 172.6 186.1 1.3s 100% 34.5 12m ago
DeepSeek V4 Flash 0731 Ollama Pro 164.4 190.1 528ms 100% 34.5 8m ago
Muse Spark 1.2 Contributor OpenCode Go 157.4 565.4 3.7s 94% 39.8 31m ago
DeepSeek V4.1 Flash Ollama Pro 135.7 69.3 761ms 100% 39.5 11m ago
DeepSeek V4 Pro 0813 Ollama Pro 134.2 143.8 486ms 100% 36.3 11m ago
GLM 5.3 Ollama Pro 127.0 104.3 1.1s 99% 44.9 3m ago
GPT 5.6 Luna OpenCode Go 116.8 124.6 1.3s 50% 37.5 1h ago
GLM 5.3 Flash Ollama Pro 110.8 123.2 1.0s 100% 41.9 10m ago
Muse Spark 1.3 Contributor OpenCode Go 110.2 72.1 4.6s 85% 48.2 31m ago
Kimi K2.7 Code Ollama Pro 101.2 135.2 939ms 100% 26.3 8m ago
GLM 5.2 Ollama Pro 97.4 130.1 655ms 100% 34 5m ago
MiniMax M3 OpenCode Go 96.0 87.9 910ms 100% 29.6 21m ago
Qwen3.7 Max OpenCode Go 96.0 98.8 1.3s 100% n=4 29.9 3h ago
Kimi K3 Ollama Pro 93.1 76.5 1.3s 100% n=6 43.8 3h ago
Qwen3.5 397B Ollama Pro 91.8 96.2 877ms 100% 19.1 9m ago
GPT-OSS 20B Ollama Pro 89.6 77.9 561ms 100% 9 2m ago
GPT-OSS 20B Ollama Free 89.5 100.6 532ms 96% 9 58m ago
Hy3 OpenCode Go 85.3 126.9 2.3s 98% 25.8 6m ago
GLM 5.3 OpenCode Go 84.3 84.3 1.0s 100% n=4 44.9 5h ago
Omen Alpha OpenCode Go 82.9 163.4 903ms 100% 21m ago
GLM 5.1 Ollama Pro 82.7 64.0 1.2s 100% 26.4 7m ago
Hy4 Preview OpenCode Go 81.7 76.5 2.8s 100% 15m ago
Qwen3.7 Plus OpenCode Go 81.6 83.2 1.4s 50% n=4 25.8 9h ago
GLM 5.3 Flash OpenCode Go 80.4 153.0 897ms 100% 41.9 25m ago
Nemotron 3 Super Ollama Pro 79.8 114.3 503ms 100% 13.6 9m ago
GLM 5.2 OpenCode Go 79.7 89.1 846ms 100% 34 9m ago
Grok 4.6 OpenCode Go 79.4 97.2 65.4s 75% n=4 44.4 11h ago
Nemotron 3 Super Ollama Free 79.3 80.4 493ms 100% 13.6 40m ago
GLM 5.1 OpenCode Go 76.6 67.9 876ms 100% 26.4 12m ago
MiniMax M3 Ollama Pro 74.7 87.9 1.2s 100% 29.6 10m ago
Mistral Large 3 675B (non-reasoning) Ollama Pro 71.6 51.7 665ms 100% 9.7 11m ago
Kimi K3 OpenCode Go 69.9 95.9 1.8s 100% n=4 43.8 30m ago
DeepSeek V4 Pro OpenCode Go 65.6 111.9 1.5s 100% 36.3 29m ago
Kimi K2.7 Code OpenCode Go 61.0 94.1 1.2s 100% 26.3 21m ago
Qwen3.8 Flash OpenCode Go 59.0 63.5 1.6s 100% 39.9 19m ago
Qwen3.6 Plus OpenCode Go 58.8 58.8 849ms 25% n=4 27 9h ago
MiniMax M2.7 OpenCode Go 56.4 45.7 1.3s 100% 23.2 21m ago
MiniMax M2.7 Ollama Pro 56.0 57.4 851ms 100% 23.2 2m ago
Longcat 2.0 OpenCode Go 54.8 53.9 1.7s 100% 19.7 26m ago
MiniMax M2.5 OpenCode Go 54.0 47.5 1.0s 100% 22.8 22m ago
Kimi K2.6 Ollama Pro 46.3 47.4 1.6s 100% 27.5 3m ago
MiMo V2.5 OpenCode Go 45.2 34.7 1.2s 100% 22.3 9m ago
Nemotron 3 Ultra Ollama Free 44.8 22.0 1.2s 100% 23.4 24m ago
Nemotron 3 Ultra Ollama Pro 43.0 8.7 818ms 99% 23.4 7m ago
Qwen3.8 Max OpenCode Go 39.8 43.1 1.6s 100% n=4 45.4 3h ago
MiMo V2.5 Pro OpenCode Go 38.1 48.6 2.2s 100% 26.4 28m ago
Kimi K2.6 OpenCode Go 36.3 35.9 1.5s 100% 27.5 5m ago

Intelligence Index scores from Artificial Analysis.

Ollama Free and OpenCode Zen are sampled about hourly to avoid burning through their plan balances. OpenCode Go is sampled about every 30 minutes, with its most expensive models every 6 hours. Ollama Pro is sampled about every 10 minutes.

7 models unavailable or stale

Frequently asked questions

What is the best LLM tokens per second leaderboard?

There is no single "best" leaderboard because different tools measure different things. TokenDyno is a live tokens-per-second tracker: it re-benchmarks Ollama Pro, Ollama Free, OpenCode Zen, and OpenCode Go models on a fixed schedule — about every 10 minutes on Ollama Pro, about every 60 minutes on Ollama Free and OpenCode Zen, and about every 30 minutes on OpenCode Go — using the same prompt and measurement method across providers, so speed numbers are directly comparable. For a capability-only score, see LiveBench; for a combined capability-speed-price view, see Artificial Analysis. See the /vs page for a factual side-by-side.

What is TokenDyno's benchmark methodology?

TokenDyno sends a fixed streaming chat-completion request (max_tokens capped at 300) to each provider and measures generation throughput using a hybrid method: inter-token timing when a response streams smoothly (≥8 chunks, mean gap >50ms), or a wall-clock fallback for burst/chunked delivery. Time-to-first-token, error taxonomy, and reliability are also recorded. Full detail is on the /methodology page.

How often is TokenDyno's data refreshed?

The worker benchmarks continuously using a round-robin priority queue. Cadence follows how each provider bills: our Ollama Pro key is a legacy flat-rate subscription, so it is sampled about every 10 minutes. Ollama Free and OpenCode Zen run on capped plans where every sample spends budget, so they are sampled about every 60 minutes. OpenCode Go is sampled about every 30 minutes, except for its most expensive models, which are sampled about every 6 hours. The leaderboard also polls the API roughly every 60 seconds client-side to keep cells current without a full page reload.