Speed · tracked daily
The fastest AI models right now
The fastest AI model right now is OpenAI: gpt-oss-120b at 777 tokens/second via Cerebras. Speed is tracked daily, not benchmarked once - providers re-provision constantly, so a static "fastest model" table goes stale within days.
- #1 OpenAI: gpt-oss-120b - 777 tok/s via Cerebras
- #2 Google: Gemma 4 31B (free) - 279 tok/s via Cerebras
- #3 MiniMax: MiniMax M2.7 - 215 tok/s via Groq
- #4 NVIDIA: Nemotron 3 Super (free) - 183 tok/s via Nebius
- #5 Poolside: Laguna XS 2.1 (free) - 156 tok/s via Poolside
- #6 OpenAI: GPT-5.6 Luna Pro (batch) - 154 tok/s via OpenAI
- #7 Google: Gemini 2.5 Flash Lite (batch) - 139 tok/s via Google AI Studio
- #8 StepFun: Step 3.7 Flash - 137 tok/s via DeepInfra
- #9 NVIDIA: Nemotron 3 Ultra (free) - 130 tok/s via BaseTen
- #10 Google: Gemini 3.6 Flash (batch) - 129 tok/s via Google AI Studio
- #11 MiniMax: MiniMax M3 (batch) - 123 tok/s via Parasail
- #12 DeepSeek: DeepSeek V4 Pro - 122 tok/s via BaseTen
- #13 Z.ai: GLM 5.2 (batch) - 115 tok/s via Friendli
- #14 OpenAI: GPT-5.6 Luna (batch) - 104 tok/s via Amazon Bedrock
- #15 Google: Gemini 2.5 Flash (batch) - 100 tok/s via Google
| # | Model | Fastest provider | Throughput | Latency p50 | Quality | Quality per $ |
|---|---|---|---|---|---|---|
| 01 | OpenAI: gpt-oss-120b | Cerebras | 777 tok/s | 215ms | 24.1 | 343.1 pts/$ |
| 02 | Google: Gemma 4 31B (free) | Cerebras | 279 tok/s | 686ms | 29.7 | 185.6 pts/$ |
| 03 | MiniMax: MiniMax M2.7 | Groq | 215 tok/s | 353ms | 38.9 | 74.1 pts/$ |
| 04 | NVIDIA: Nemotron 3 Super (free) | Nebius | 183 tok/s | 1405ms | 25.7 | 57.1 pts/$ |
| 05 | Poolside: Laguna XS 2.1 (free) | Poolside | 156 tok/s | 235ms | - | - |
| 06 | OpenAI: GPT-5.6 Luna Pro (batch) | OpenAI | 154 tok/s | 7041ms | - | - |
| 07 | Google: Gemini 2.5 Flash Lite (batch) | Google AI Studio | 139 tok/s | 307ms | - | - |
| 08 | StepFun: Step 3.7 Flash | DeepInfra | 137 tok/s | 1016ms | 30.9 | 70.6 pts/$ |
| 09 | NVIDIA: Nemotron 3 Ultra (free) | BaseTen | 130 tok/s | 443ms | 38.3 | 28.4 pts/$ |
| 10 | Google: Gemini 3.6 Flash (batch) | Google AI Studio | 129 tok/s | 1622ms | 51.6 | 17.2 pts/$ |
| 11 | MiniMax: MiniMax M3 (batch) | Parasail | 123 tok/s | 690ms | 45.4 | 86.5 pts/$ |
| 12 | DeepSeek: DeepSeek V4 Pro | BaseTen | 122 tok/s | 506ms | 45.3 | 83.3 pts/$ |
| 13 | Z.ai: GLM 5.2 (batch) | Friendli | 115 tok/s | 702ms | 52.6 | 489.3 pts/$ |
| 14 | OpenAI: GPT-5.6 Luna (batch) | Amazon Bedrock | 104 tok/s | 1762ms | 52.3 | 232.4 pts/$ |
| 15 | Google: Gemini 2.5 Flash (batch) | 100 tok/s | 407ms | - | - | |
| 16 | OpenAI: GPT-5 Mini (batch) | OpenAI | 96 tok/s | 1548ms | 25.8 | 37.5 pts/$ |
| 17 | Poolside: Laguna S 2.1 (free) | Poolside | 95 tok/s | 544ms | - | - |
| 18 | DeepSeek: DeepSeek V4 Flash 0423 | DeepSeek | 80 tok/s | 767ms | 51.8 | 460.4 pts/$ |
| 19 | Google: Gemma 4 26B A4B (free) | Cloudflare | 77 tok/s | 515ms | 26.1 | 189.8 pts/$ |
| 20 | Xiaomi: MiMo-V2.5 | DeepInfra | 75 tok/s | 682ms | 38 | 217.1 pts/$ |
| 21 | Google: Gemini 3.1 Flash Lite (batch) | Google AI Studio | 75 tok/s | 548ms | - | - |
| 22 | Anthropic: Claude Haiku 4.5 (batch) | 74 tok/s | 457ms | 29.9 | 14.9 pts/$ | |
| 23 | inclusionAI: Ling-2.6-flash | Novita | 71 tok/s | 594ms | 14.2 | 946.7 pts/$ |
| 24 | OpenAI: GPT-5.6 Terra (batch) | Azure | 69 tok/s | 2931ms | 56.6 | 25.2 pts/$ |
| 25 | Anthropic: Claude Sonnet 5 (batch) | Azure | 68 tok/s | 3445ms | 55.3 | 13.8 pts/$ |
| 26 | Claude Opus 5 (batch) | Anthropic | 66 tok/s | 3460ms | 63.1 | 6.3 pts/$ |
| 27 | Anthropic: Claude Opus 4.8 (batch) | 66 tok/s | 2178ms | 57.3 | 5.7 pts/$ | |
| 28 | Google: Gemini 3 Flash Preview (batch) | Google AI Studio | 60 tok/s | 1021ms | - | - |
| 29 | MoonshotAI: Kimi K3 | Modal | 60 tok/s | 2277ms | 59.7 | 10.0 pts/$ |
| 30 | Xiaomi: MiMo-V2.5-Pro | DeepInfra | 59 tok/s | 687ms | 42.9 | 78.9 pts/$ |
| 31 | Tencent: Hy3 | DeepInfra | 59 tok/s | 463ms | - | - |
| 32 | Anthropic: Claude Opus 4.7 (batch) | 59 tok/s | 1048ms | 55 | 5.5 pts/$ | |
| 33 | Mistral: Mistral Nemo | DeepInfra | 50 tok/s | 333ms | - | - |
| 34 | SpaceXAI: Grok 4.5 | xAI | 50 tok/s | 840ms | 55.8 | 18.6 pts/$ |
| 35 | Anthropic: Claude Fable 5 (batch) | Anthropic | 48 tok/s | 4983ms | 62.1 | 3.1 pts/$ |
| 36 | Qwen: Qwen3.8 Max | Alibaba | 43 tok/s | 2026ms | 58.1 | 19.4 pts/$ |
| 37 | Anthropic: Claude Sonnet 4.6 (batch) | 42 tok/s | 1383ms | 48.4 | 8.1 pts/$ | |
| 38 | OpenAI: GPT-5.6 Sol (batch) | OpenAI | 41 tok/s | 2190ms | 60.9 | 5.4 pts/$ |
| 39 | OpenAI: GPT-4o-mini (batch) | OpenAI | 40 tok/s | 534ms | - | - |
| 40 | DeepSeek: DeepSeek V3.2 | Alibaba | 40 tok/s | 743ms | 32.6 | 108.0 pts/$ |
Top 5, speed over time
| # | Model | Tokens/second |
|---|---|---|
| 01 | OpenAI: gpt-oss-120b | 777 |
| 02 | Google: Gemma 4 31B (free) | 279 |
| 03 | MiniMax: MiniMax M2.7 | 215 |
| 04 | NVIDIA: Nemotron 3 Super (free) | 183 |
| 05 | Poolside: Laguna XS 2.1 (free) | 156 |
Daily tracking began Aug 9- this becomes a live chart once there's a third day to plot.
Frequently asked questions
What is the fastest AI model?
As of the latest data, OpenAI: gpt-oss-120b is the fastest widely available AI model at 777 tokens/second via Cerebras.
How fast is OpenAI: gpt-oss-120b in tokens per second?
OpenAI: gpt-oss-120b generates approximately 777 tokens per second on its fastest available provider (Cerebras), measured directly from OpenRouter's endpoint data.
