LLM tokens per second — live multi-provider benchmark

Real inference speed, measured continuously. Every row is a live model from Ollama, OpenCode Zen, or OpenCode Go — sorted by tokens per second, benchmarked every ~10 minutes on Ollama Pro, every ~60 minutes on Ollama Free and OpenCode Zen, and every ~30 minutes on OpenCode Go.

Independent & vendor-neutral — no paid placement. TokenDyno is not affiliated with any provider it benchmarks and receives no payment for ranking or favorable coverage. Read the independence policy →

● live — last benchmark 1m ago
Trend
GPT-OSS 120B Ollama Free 279.8 355.3 339ms 100% 11.6 33m ago
Gemma4 31B Ollama Pro 271.1 298.4 348ms 100% 19 2m ago
Gemma4 31B Ollama Free 222.1 148.4 325ms 100% 19 38m ago
GPT-OSS 120B Ollama Pro 217.4 223.7 375ms 100% 11.6 5m ago
Nemotron 3 Nano 30B (non-reasoning) Ollama Free 191.3 285.2 312ms 100% 6.8 26m ago
DeepSeek V4.1 Flash OpenCode Go 185.3 174.8 1.1s 100% 39.5 27m ago
Nemotron 3 Nano 30B (non-reasoning) Ollama Pro 184.6 129.1 801ms 100% 6.8 4m ago
DeepSeek V4 Flash 0731 Ollama Pro 184.4 186.0 529ms 100% 34.3 3m ago
DeepSeek Flash OpenCode Go 183.8 185.7 1.3s 100% 34.3 8m ago
DeepSeek V4 Flash Vision Exp OpenCode Go 183.1 202.0 1.1s 100% 34.8 18m ago
DeepSeek V4 Flash OpenCode Go 179.0 173.9 1.1s 100% 34.3 5m ago
DeepSeek V4.1 Flash Ollama Pro 175.9 275.6 366ms 99% 39.5 4m ago
GPT 5.6 Luna OpenCode Go 149.2 156.6 1.8s 44% 37.3 1h ago
DeepSeek V4 Pro 0813 Ollama Pro 140.2 115.3 652ms 100% 36 5m ago
GLM 5.3 Ollama Pro 134.1 92.8 730ms 100% 44.8 7m ago
GLM 5.3 Flash Ollama Pro 117.4 93.0 710ms 100% 41.8 3m ago
Kimi K2.7 Code Ollama Pro 116.2 104.8 1.1s 100% 25.8 2m ago
Hy3 OpenCode Go 111.2 146.2 1.6s 100% 25.3 8m ago
Qwen3.7 Max OpenCode Go 111.2 117.2 1.5s 100% n=4 29.5 3h ago
GPT-OSS 20B Ollama Free 108.7 102.4 458ms 100% 9 32m ago
Hy4 Preview OpenCode Go 107.7 94.0 3.2s 100% 20m ago
GPT-OSS 20B Ollama Pro 107.1 87.5 12.6s 100% 9 5m ago
GLM 5.2 Ollama Pro 106.2 166.0 651ms 100% 33.7 7m ago
Grok 4.6 OpenCode Go 100.5 96.7 108.6s 75% n=4 44.3 5h ago
Omen Alpha OpenCode Go 98.6 164.7 918ms 100% 22m ago
Muse Spark 1.2 Contributor OpenCode Go 94.3 140.4 1.7s 92% 39.6 1m ago
Qwen3.5 397B Ollama Pro 91.6 95.0 1.0s 99% 18.4 3m ago
MiniMax M3 OpenCode Go 91.0 101.8 2.0s 100% 29.2 22m ago
Nemotron 3 Super Ollama Free 91.0 63.1 541ms 100% 12.8 15m ago
GLM 5.3 Flash OpenCode Go 90.4 217.3 589ms 100% 41.8 29m ago
GLM 5.1 Ollama Pro 90.0 102.1 1.0s 100% 26.1 2m ago
GLM 5.3 OpenCode Go 88.0 90.2 824ms 100% n=4 44.8 4h ago
Nemotron 3 Super Ollama Pro 86.5 80.4 576ms 99% 12.8 3m ago
GLM 5.2 OpenCode Go 84.2 78.1 762ms 100% 33.7 8m ago
MiniMax M3 Ollama Pro 83.2 93.8 689ms 99% 29.2 4m ago
GLM 5.1 OpenCode Go 82.9 77.9 833ms 100% 26.1 8m ago
Kimi K3 Ollama Pro 81.0 77.2 853ms 100% n=6 43.6 2h ago
DeepSeek V4 Pro OpenCode Go 77.8 94.1 1.8s 100% 36 30m ago
Mistral Large 3 675B (non-reasoning) Ollama Pro 72.5 77.2 719ms 100% 9.3 4m ago
Kimi K3 OpenCode Go 71.5 82.7 2.2s 100% n=4 43.6 9m ago
MiniMax M2.7 Ollama Pro 64.1 70.9 1.1s 100% 22.8 5m ago
Muse Spark 1.3 Contributor OpenCode Go 63.6 83.4 3.5s 81% 48.1 1m ago
MiniMax M2.7 OpenCode Go 61.8 58.3 1.2s 100% 22.8 26m ago
MiniMax M2.5 OpenCode Go 60.9 64.8 983ms 98% 22.8 27m ago
Qwen3.8 Flash OpenCode Go 60.3 42.7 1.2s 100% 39.8 22m ago
Kimi K2.7 Code OpenCode Go 57.1 113.5 980ms 100% 25.8 22m ago
Longcat 2.0 OpenCode Go 53.1 68.6 2.7s 100% 19.1 29m ago
Qwen3.7 Plus OpenCode Go 50.6 80.5 1.1s 50% n=4 25.2 3h ago
Kimi K2.6 Ollama Pro 45.2 41.8 1.7s 100% 27 6m ago
Qwen3.6 Plus OpenCode Go 44.5 15.7 1.0s 75% n=4 27 3h ago
Nemotron 3 Ultra Ollama Free 44.1 4.7 9.6s 100% 22.9 59m ago
MiMo V2.5 Pro OpenCode Go 40.6 46.9 2.1s 96% 26 29m ago
Nemotron 3 Ultra Ollama Pro 40.5 64.7 568ms 99% 22.9 10m ago
Qwen3.8 Max OpenCode Go 40.3 37.5 1.5s 100% n=4 45.4 3h ago
Kimi K2.6 OpenCode Go 38.0 35.8 4.5s 100% 27 7m ago
MiMo V2.5 OpenCode Go 37.6 35.5 1.1s 100% 25.2 8m ago

Intelligence Index scores from Artificial Analysis.

Ollama Free and OpenCode Zen are sampled about hourly to avoid burning through their plan balances. OpenCode Go is sampled about every 30 minutes, with its most expensive models every 6 hours. Ollama Pro is sampled about every 10 minutes.

7 models unavailable or stale

Frequently asked questions

What is the best LLM tokens per second leaderboard?

There is no single "best" leaderboard because different tools measure different things. TokenDyno is a live tokens-per-second tracker: it re-benchmarks Ollama Pro, Ollama Free, OpenCode Zen, and OpenCode Go models on a fixed schedule — about every 10 minutes on Ollama Pro, about every 60 minutes on Ollama Free and OpenCode Zen, and about every 30 minutes on OpenCode Go — using the same prompt and measurement method across providers, so speed numbers are directly comparable. For a capability-only score, see LiveBench; for a combined capability-speed-price view, see Artificial Analysis. See the /vs page for a factual side-by-side.

What is TokenDyno's benchmark methodology?

TokenDyno sends a fixed streaming chat-completion request (max_tokens capped at 300) to each provider and measures generation throughput using a hybrid method: inter-token timing when a response streams smoothly (≥8 chunks, mean gap >50ms), or a wall-clock fallback for burst/chunked delivery. Time-to-first-token, error taxonomy, and reliability are also recorded. Full detail is on the /methodology page.

How often is TokenDyno's data refreshed?

The worker benchmarks continuously using a round-robin priority queue. Cadence follows how each provider bills: our Ollama Pro key is a legacy flat-rate subscription, so it is sampled about every 10 minutes. Ollama Free and OpenCode Zen run on capped plans where every sample spends budget, so they are sampled about every 60 minutes. OpenCode Go is sampled about every 30 minutes, except for its most expensive models, which are sampled about every 6 hours. The leaderboard also polls the API roughly every 60 seconds client-side to keep cells current without a full page reload.