LLM tokens per second — live multi-provider benchmark
Real inference speed, measured continuously. Every row is a live model from Ollama, OpenCode Zen, or OpenCode Go — sorted by tokens per second, benchmarked every ~10 minutes on Ollama Pro, every ~60 minutes on Ollama Free and OpenCode Zen, and every ~30 minutes on OpenCode Go.
Independent & vendor-neutral — no paid placement. TokenDyno is not affiliated with any provider it benchmarks and receives no payment for ranking or favorable coverage. Read the independence policy →
| Trend | ||||||||
|---|---|---|---|---|---|---|---|---|
| GPT-OSS 120B | Ollama Free | 262.6 | 165.5 | 383ms | 100% | 12.3 | | 58m ago |
| Gemma4 31B | Ollama Pro | 253.5 | 314.4 | 343ms | 100% | 15.4 | | 7m ago |
| Gemma4 31B | Ollama Free | 209.5 | 287.5 | 347ms | 100% | 15.4 | | 4m ago |
| GPT-OSS 120B | Ollama Pro | 203.5 | 163.8 | 386ms | 100% | 12.3 | | 2m ago |
| Nemotron 3 Nano 30B (non-reasoning) | Ollama Pro | 197.9 | 216.7 | 472ms | 100% | 6.8 | | 10m ago |
| Nemotron 3 Nano 30B (non-reasoning) | Ollama Free | 179.9 | 115.2 | 546ms | 100% | 6.8 | | 50m ago |
| DeepSeek V4 Flash | OpenCode Go | 179.4 | 184.5 | 1.3s | 100% | 34.5 | | 2m ago |
| DeepSeek V4.1 Flash | OpenCode Go | 178.3 | 193.0 | 1.1s | 100% | 39.5 | | 22m ago |
| DeepSeek V4 Flash Vision Exp | OpenCode Go | 175.4 | 197.2 | 873ms | 100% | 35 | | 14m ago |
| DeepSeek Flash | OpenCode Go | 172.6 | 186.1 | 1.3s | 100% | 34.5 | | 12m ago |
| DeepSeek V4 Flash 0731 | Ollama Pro | 164.4 | 190.1 | 528ms | 100% | 34.5 | | 8m ago |
| Muse Spark 1.2 Contributor | OpenCode Go | 157.4 | 565.4 | 3.7s | 94% | 39.8 | | 31m ago |
| DeepSeek V4.1 Flash | Ollama Pro | 135.7 | 69.3 | 761ms | 100% | 39.5 | | 11m ago |
| DeepSeek V4 Pro 0813 | Ollama Pro | 134.2 | 143.8 | 486ms | 100% | 36.3 | | 11m ago |
| GLM 5.3 | Ollama Pro | 127.0 | 104.3 | 1.1s | 99% | 44.9 | | 3m ago |
| GPT 5.6 Luna | OpenCode Go | 116.8 | 124.6 | 1.3s | 50% | 37.5 | | 1h ago |
| GLM 5.3 Flash | Ollama Pro | 110.8 | 123.2 | 1.0s | 100% | 41.9 | | 10m ago |
| Muse Spark 1.3 Contributor | OpenCode Go | 110.2 | 72.1 | 4.6s | 85% | 48.2 | | 31m ago |
| Kimi K2.7 Code | Ollama Pro | 101.2 | 135.2 | 939ms | 100% | 26.3 | | 8m ago |
| GLM 5.2 | Ollama Pro | 97.4 | 130.1 | 655ms | 100% | 34 | | 5m ago |
| MiniMax M3 | OpenCode Go | 96.0 | 87.9 | 910ms | 100% | 29.6 | | 21m ago |
| Qwen3.7 Max | OpenCode Go | 96.0 | 98.8 | 1.3s | 100% n=4 | 29.9 | | 3h ago |
| Kimi K3 | Ollama Pro | 93.1 | 76.5 | 1.3s | 100% n=6 | 43.8 | | 3h ago |
| Qwen3.5 397B | Ollama Pro | 91.8 | 96.2 | 877ms | 100% | 19.1 | | 9m ago |
| GPT-OSS 20B | Ollama Pro | 89.6 | 77.9 | 561ms | 100% | 9 | | 2m ago |
| GPT-OSS 20B | Ollama Free | 89.5 | 100.6 | 532ms | 96% | 9 | | 58m ago |
| Hy3 | OpenCode Go | 85.3 | 126.9 | 2.3s | 98% | 25.8 | | 6m ago |
| GLM 5.3 | OpenCode Go | 84.3 | 84.3 | 1.0s | 100% n=4 | 44.9 | | 5h ago |
| Omen Alpha | OpenCode Go | 82.9 | 163.4 | 903ms | 100% | — | | 21m ago |
| GLM 5.1 | Ollama Pro | 82.7 | 64.0 | 1.2s | 100% | 26.4 | | 7m ago |
| Hy4 Preview | OpenCode Go | 81.7 | 76.5 | 2.8s | 100% | — | | 15m ago |
| Qwen3.7 Plus | OpenCode Go | 81.6 | 83.2 | 1.4s | 50% n=4 | 25.8 | | 9h ago |
| GLM 5.3 Flash | OpenCode Go | 80.4 | 153.0 | 897ms | 100% | 41.9 | | 25m ago |
| Nemotron 3 Super | Ollama Pro | 79.8 | 114.3 | 503ms | 100% | 13.6 | | 9m ago |
| GLM 5.2 | OpenCode Go | 79.7 | 89.1 | 846ms | 100% | 34 | | 9m ago |
| Grok 4.6 | OpenCode Go | 79.4 | 97.2 | 65.4s | 75% n=4 | 44.4 | | 11h ago |
| Nemotron 3 Super | Ollama Free | 79.3 | 80.4 | 493ms | 100% | 13.6 | | 40m ago |
| GLM 5.1 | OpenCode Go | 76.6 | 67.9 | 876ms | 100% | 26.4 | | 12m ago |
| MiniMax M3 | Ollama Pro | 74.7 | 87.9 | 1.2s | 100% | 29.6 | | 10m ago |
| Mistral Large 3 675B (non-reasoning) | Ollama Pro | 71.6 | 51.7 | 665ms | 100% | 9.7 | | 11m ago |
| Kimi K3 | OpenCode Go | 69.9 | 95.9 | 1.8s | 100% n=4 | 43.8 | | 30m ago |
| DeepSeek V4 Pro | OpenCode Go | 65.6 | 111.9 | 1.5s | 100% | 36.3 | | 29m ago |
| Kimi K2.7 Code | OpenCode Go | 61.0 | 94.1 | 1.2s | 100% | 26.3 | | 21m ago |
| Qwen3.8 Flash | OpenCode Go | 59.0 | 63.5 | 1.6s | 100% | 39.9 | | 19m ago |
| Qwen3.6 Plus | OpenCode Go | 58.8 | 58.8 | 849ms | 25% n=4 | 27 | | 9h ago |
| MiniMax M2.7 | OpenCode Go | 56.4 | 45.7 | 1.3s | 100% | 23.2 | | 21m ago |
| MiniMax M2.7 | Ollama Pro | 56.0 | 57.4 | 851ms | 100% | 23.2 | | 2m ago |
| Longcat 2.0 | OpenCode Go | 54.8 | 53.9 | 1.7s | 100% | 19.7 | | 26m ago |
| MiniMax M2.5 | OpenCode Go | 54.0 | 47.5 | 1.0s | 100% | 22.8 | | 22m ago |
| Kimi K2.6 | Ollama Pro | 46.3 | 47.4 | 1.6s | 100% | 27.5 | | 3m ago |
| MiMo V2.5 | OpenCode Go | 45.2 | 34.7 | 1.2s | 100% | 22.3 | | 9m ago |
| Nemotron 3 Ultra | Ollama Free | 44.8 | 22.0 | 1.2s | 100% | 23.4 | | 24m ago |
| Nemotron 3 Ultra | Ollama Pro | 43.0 | 8.7 | 818ms | 99% | 23.4 | | 7m ago |
| Qwen3.8 Max | OpenCode Go | 39.8 | 43.1 | 1.6s | 100% n=4 | 45.4 | | 3h ago |
| MiMo V2.5 Pro | OpenCode Go | 38.1 | 48.6 | 2.2s | 100% | 26.4 | | 28m ago |
| Kimi K2.6 | OpenCode Go | 36.3 | 35.9 | 1.5s | 100% | 27.5 | | 5m ago |
| Muse Spark 1.3 Contributor (Free) | OpenCode Zen | — | 54.4 | 6.3s | 0% n=1 | 48.2 | | 1d ago |
| MiMo V2.5 (Free) | OpenCode Zen | — | 13.7 | 2.1s | 0% n=2 | 22.3 | | 3d ago |
| Big Pickle | OpenCode Zen | — | 50.3 | 697ms | 0% n=2 | — | | 3d ago |
| Ling 3.0 Flash Fin (Free) | OpenCode Zen | — | 400.4 | 1.1s | 0% n=1 | 23 | | 1d ago |
| Nemotron 3.5 Lightning (Free) | OpenCode Zen | — | 57.0 | 651ms | 0% n=1 | 13.6 | | 1d ago |
| Nemotron 3 Ultra (Free) | OpenCode Zen | — | 65.9 | 881ms | 0% n=1 | 23.4 | | 2d ago |
| MiniMax M3 | Ollama Free | — | 82.2 | 1.0s | 0% n=1 | 29.6 | | 20d ago |
No models match your filter.
Intelligence Index scores from Artificial Analysis.
Ollama Free and OpenCode Zen are sampled about hourly to avoid burning through their plan balances. OpenCode Go is sampled about every 30 minutes, with its most expensive models every 6 hours. Ollama Pro is sampled about every 10 minutes.
Frequently asked questions
What is the best LLM tokens per second leaderboard?
There is no single "best" leaderboard because different tools measure different things. TokenDyno is a live tokens-per-second tracker: it re-benchmarks Ollama Pro, Ollama Free, OpenCode Zen, and OpenCode Go models on a fixed schedule — about every 10 minutes on Ollama Pro, about every 60 minutes on Ollama Free and OpenCode Zen, and about every 30 minutes on OpenCode Go — using the same prompt and measurement method across providers, so speed numbers are directly comparable. For a capability-only score, see LiveBench; for a combined capability-speed-price view, see Artificial Analysis. See the /vs page for a factual side-by-side.
What is TokenDyno's benchmark methodology?
TokenDyno sends a fixed streaming chat-completion request (max_tokens capped at 300) to each provider and measures generation throughput using a hybrid method: inter-token timing when a response streams smoothly (≥8 chunks, mean gap >50ms), or a wall-clock fallback for burst/chunked delivery. Time-to-first-token, error taxonomy, and reliability are also recorded. Full detail is on the /methodology page.
How often is TokenDyno's data refreshed?
The worker benchmarks continuously using a round-robin priority queue. Cadence follows how each provider bills: our Ollama Pro key is a legacy flat-rate subscription, so it is sampled about every 10 minutes. Ollama Free and OpenCode Zen run on capped plans where every sample spends budget, so they are sampled about every 60 minutes. OpenCode Go is sampled about every 30 minutes, except for its most expensive models, which are sampled about every 6 hours. The leaderboard also polls the API roughly every 60 seconds client-side to keep cells current without a full page reload.