LLM tokens per second — live multi-provider benchmark
Real inference speed, measured continuously. Every row is a live model from Ollama, OpenCode Zen, or OpenCode Go — sorted by tokens per second, benchmarked every ~10 minutes on Ollama Pro, every ~60 minutes on Ollama Free and OpenCode Zen, and every ~30 minutes on OpenCode Go.
Independent & vendor-neutral — no paid placement. TokenDyno is not affiliated with any provider it benchmarks and receives no payment for ranking or favorable coverage. Read the independence policy →
| Trend | ||||||||
|---|---|---|---|---|---|---|---|---|
| GPT-OSS 120B | Ollama Free | 279.8 | 355.3 | 339ms | 100% | 11.6 | | 33m ago |
| Gemma4 31B | Ollama Pro | 271.1 | 298.4 | 348ms | 100% | 19 | | 2m ago |
| Gemma4 31B | Ollama Free | 222.1 | 148.4 | 325ms | 100% | 19 | | 38m ago |
| GPT-OSS 120B | Ollama Pro | 217.4 | 223.7 | 375ms | 100% | 11.6 | | 5m ago |
| Nemotron 3 Nano 30B (non-reasoning) | Ollama Free | 191.3 | 285.2 | 312ms | 100% | 6.8 | | 26m ago |
| DeepSeek V4.1 Flash | OpenCode Go | 185.3 | 174.8 | 1.1s | 100% | 39.5 | | 27m ago |
| Nemotron 3 Nano 30B (non-reasoning) | Ollama Pro | 184.6 | 129.1 | 801ms | 100% | 6.8 | | 4m ago |
| DeepSeek V4 Flash 0731 | Ollama Pro | 184.4 | 186.0 | 529ms | 100% | 34.3 | | 3m ago |
| DeepSeek Flash | OpenCode Go | 183.8 | 185.7 | 1.3s | 100% | 34.3 | | 8m ago |
| DeepSeek V4 Flash Vision Exp | OpenCode Go | 183.1 | 202.0 | 1.1s | 100% | 34.8 | | 18m ago |
| DeepSeek V4 Flash | OpenCode Go | 179.0 | 173.9 | 1.1s | 100% | 34.3 | | 5m ago |
| DeepSeek V4.1 Flash | Ollama Pro | 175.9 | 275.6 | 366ms | 99% | 39.5 | | 4m ago |
| GPT 5.6 Luna | OpenCode Go | 149.2 | 156.6 | 1.8s | 44% | 37.3 | | 1h ago |
| DeepSeek V4 Pro 0813 | Ollama Pro | 140.2 | 115.3 | 652ms | 100% | 36 | | 5m ago |
| GLM 5.3 | Ollama Pro | 134.1 | 92.8 | 730ms | 100% | 44.8 | | 7m ago |
| GLM 5.3 Flash | Ollama Pro | 117.4 | 93.0 | 710ms | 100% | 41.8 | | 3m ago |
| Kimi K2.7 Code | Ollama Pro | 116.2 | 104.8 | 1.1s | 100% | 25.8 | | 2m ago |
| Hy3 | OpenCode Go | 111.2 | 146.2 | 1.6s | 100% | 25.3 | | 8m ago |
| Qwen3.7 Max | OpenCode Go | 111.2 | 117.2 | 1.5s | 100% n=4 | 29.5 | | 3h ago |
| GPT-OSS 20B | Ollama Free | 108.7 | 102.4 | 458ms | 100% | 9 | | 32m ago |
| Hy4 Preview | OpenCode Go | 107.7 | 94.0 | 3.2s | 100% | — | | 20m ago |
| GPT-OSS 20B | Ollama Pro | 107.1 | 87.5 | 12.6s | 100% | 9 | | 5m ago |
| GLM 5.2 | Ollama Pro | 106.2 | 166.0 | 651ms | 100% | 33.7 | | 7m ago |
| Grok 4.6 | OpenCode Go | 100.5 | 96.7 | 108.6s | 75% n=4 | 44.3 | | 5h ago |
| Omen Alpha | OpenCode Go | 98.6 | 164.7 | 918ms | 100% | — | | 22m ago |
| Muse Spark 1.2 Contributor | OpenCode Go | 94.3 | 140.4 | 1.7s | 92% | 39.6 | | 1m ago |
| Qwen3.5 397B | Ollama Pro | 91.6 | 95.0 | 1.0s | 99% | 18.4 | | 3m ago |
| MiniMax M3 | OpenCode Go | 91.0 | 101.8 | 2.0s | 100% | 29.2 | | 22m ago |
| Nemotron 3 Super | Ollama Free | 91.0 | 63.1 | 541ms | 100% | 12.8 | | 15m ago |
| GLM 5.3 Flash | OpenCode Go | 90.4 | 217.3 | 589ms | 100% | 41.8 | | 29m ago |
| GLM 5.1 | Ollama Pro | 90.0 | 102.1 | 1.0s | 100% | 26.1 | | 2m ago |
| GLM 5.3 | OpenCode Go | 88.0 | 90.2 | 824ms | 100% n=4 | 44.8 | | 4h ago |
| Nemotron 3 Super | Ollama Pro | 86.5 | 80.4 | 576ms | 99% | 12.8 | | 3m ago |
| GLM 5.2 | OpenCode Go | 84.2 | 78.1 | 762ms | 100% | 33.7 | | 8m ago |
| MiniMax M3 | Ollama Pro | 83.2 | 93.8 | 689ms | 99% | 29.2 | | 4m ago |
| GLM 5.1 | OpenCode Go | 82.9 | 77.9 | 833ms | 100% | 26.1 | | 8m ago |
| Kimi K3 | Ollama Pro | 81.0 | 77.2 | 853ms | 100% n=6 | 43.6 | | 2h ago |
| DeepSeek V4 Pro | OpenCode Go | 77.8 | 94.1 | 1.8s | 100% | 36 | | 30m ago |
| Mistral Large 3 675B (non-reasoning) | Ollama Pro | 72.5 | 77.2 | 719ms | 100% | 9.3 | | 4m ago |
| Kimi K3 | OpenCode Go | 71.5 | 82.7 | 2.2s | 100% n=4 | 43.6 | | 9m ago |
| MiniMax M2.7 | Ollama Pro | 64.1 | 70.9 | 1.1s | 100% | 22.8 | | 5m ago |
| Muse Spark 1.3 Contributor | OpenCode Go | 63.6 | 83.4 | 3.5s | 81% | 48.1 | | 1m ago |
| MiniMax M2.7 | OpenCode Go | 61.8 | 58.3 | 1.2s | 100% | 22.8 | | 26m ago |
| MiniMax M2.5 | OpenCode Go | 60.9 | 64.8 | 983ms | 98% | 22.8 | | 27m ago |
| Qwen3.8 Flash | OpenCode Go | 60.3 | 42.7 | 1.2s | 100% | 39.8 | | 22m ago |
| Kimi K2.7 Code | OpenCode Go | 57.1 | 113.5 | 980ms | 100% | 25.8 | | 22m ago |
| Longcat 2.0 | OpenCode Go | 53.1 | 68.6 | 2.7s | 100% | 19.1 | | 29m ago |
| Qwen3.7 Plus | OpenCode Go | 50.6 | 80.5 | 1.1s | 50% n=4 | 25.2 | | 3h ago |
| Kimi K2.6 | Ollama Pro | 45.2 | 41.8 | 1.7s | 100% | 27 | | 6m ago |
| Qwen3.6 Plus | OpenCode Go | 44.5 | 15.7 | 1.0s | 75% n=4 | 27 | | 3h ago |
| Nemotron 3 Ultra | Ollama Free | 44.1 | 4.7 | 9.6s | 100% | 22.9 | | 59m ago |
| MiMo V2.5 Pro | OpenCode Go | 40.6 | 46.9 | 2.1s | 96% | 26 | | 29m ago |
| Nemotron 3 Ultra | Ollama Pro | 40.5 | 64.7 | 568ms | 99% | 22.9 | | 10m ago |
| Qwen3.8 Max | OpenCode Go | 40.3 | 37.5 | 1.5s | 100% n=4 | 45.4 | | 3h ago |
| Kimi K2.6 | OpenCode Go | 38.0 | 35.8 | 4.5s | 100% | 27 | | 7m ago |
| MiMo V2.5 | OpenCode Go | 37.6 | 35.5 | 1.1s | 100% | 25.2 | | 8m ago |
| Nemotron 3 Ultra (Free) | OpenCode Zen | — | 65.9 | 881ms | 0% n=1 | 22.9 | | 3d ago |
| Nemotron 3.5 Lightning (Free) | OpenCode Zen | — | 57.0 | 651ms | 0% n=1 | 12.9 | | 2d ago |
| MiMo V2.5 (Free) | OpenCode Zen | — | 13.7 | 2.1s | 0% n=2 | 25.2 | | 4d ago |
| Big Pickle | OpenCode Zen | — | 50.3 | 697ms | 0% n=2 | — | | 4d ago |
| Ling 3.0 Flash Fin (Free) | OpenCode Zen | — | 400.4 | 1.1s | 0% n=1 | 22.6 | | 2d ago |
| Muse Spark 1.3 Contributor (Free) | OpenCode Zen | — | 54.4 | 6.3s | 0% n=1 | 48.1 | | 2d ago |
| MiniMax M3 | Ollama Free | — | 82.2 | 1.0s | 0% n=1 | 29.2 | | 21d ago |
No models match your filter.
Intelligence Index scores from Artificial Analysis.
Ollama Free and OpenCode Zen are sampled about hourly to avoid burning through their plan balances. OpenCode Go is sampled about every 30 minutes, with its most expensive models every 6 hours. Ollama Pro is sampled about every 10 minutes.
Frequently asked questions
What is the best LLM tokens per second leaderboard?
There is no single "best" leaderboard because different tools measure different things. TokenDyno is a live tokens-per-second tracker: it re-benchmarks Ollama Pro, Ollama Free, OpenCode Zen, and OpenCode Go models on a fixed schedule — about every 10 minutes on Ollama Pro, about every 60 minutes on Ollama Free and OpenCode Zen, and about every 30 minutes on OpenCode Go — using the same prompt and measurement method across providers, so speed numbers are directly comparable. For a capability-only score, see LiveBench; for a combined capability-speed-price view, see Artificial Analysis. See the /vs page for a factual side-by-side.
What is TokenDyno's benchmark methodology?
TokenDyno sends a fixed streaming chat-completion request (max_tokens capped at 300) to each provider and measures generation throughput using a hybrid method: inter-token timing when a response streams smoothly (≥8 chunks, mean gap >50ms), or a wall-clock fallback for burst/chunked delivery. Time-to-first-token, error taxonomy, and reliability are also recorded. Full detail is on the /methodology page.
How often is TokenDyno's data refreshed?
The worker benchmarks continuously using a round-robin priority queue. Cadence follows how each provider bills: our Ollama Pro key is a legacy flat-rate subscription, so it is sampled about every 10 minutes. Ollama Free and OpenCode Zen run on capped plans where every sample spends budget, so they are sampled about every 60 minutes. OpenCode Go is sampled about every 30 minutes, except for its most expensive models, which are sampled about every 6 hours. The leaderboard also polls the API roughly every 60 seconds client-side to keep cells current without a full page reload.