Speed · tracked daily
The fastest AI models right now
The fastest AI model right now is OpenAI: gpt-oss-120b at 622 tokens/second via Cerebras. Speed is tracked daily, not benchmarked once - providers re-provision constantly, so a static "fastest model" table goes stale within days.
- #1 OpenAI: gpt-oss-120b - 622 tok/s via Cerebras
- #2 OpenAI: gpt-oss-20b (batch) - 453 tok/s via Groq
- #3 Google: Gemma 4 31B (free) - 304 tok/s via Cerebras
- #4 MiniMax: MiniMax M2.7 - 228 tok/s via Groq
- #5 Z.ai: GLM 5.2 (free) - 182 tok/s via Decart
- #6 Thinking Machines: Inkling (free) - 164 tok/s via BaseTen
- #7 Qwen: Qwen3.6 35B A3B - 158 tok/s via CoreWeave
- #8 DeepSeek: DeepSeek V4.1 Flash (batch) - 154 tok/s via Together
- #9 Google: Gemini 3.7 Flash (batch) - 144 tok/s via Google AI Studio
- #10 MiniMax: MiniMax M3 - 136 tok/s via Mara
- #11 Z.ai: GLM 5.3 (batch) - 134 tok/s via Decart
- #12 inclusionAI: Ling 3.0 Flash Fin (free) - 132 tok/s via DeepInfra
- #13 Google: Gemini 3.5 Flash (batch) - 131 tok/s via Google
- #14 NVIDIA: Nemotron 3 Ultra (free) - 130 tok/s via BaseTen
- #15 OpenAI: GPT-5.6 Luna (batch) - 128 tok/s via Amazon Bedrock
| # | Model | Fastest provider | Throughput | Latency p50 | Quality | Quality per $ |
|---|---|---|---|---|---|---|
| 01 | OpenAI: gpt-oss-120b | Cerebras | 622 tok/s | 219ms | 11.6 | 44.2 pts/$ |
| 02 | OpenAI: gpt-oss-20b (batch) | Groq | 453 tok/s | 546ms | 9 | 250.0 pts/$ |
| 03 | Google: Gemma 4 31B (free) | Cerebras | 304 tok/s | 244ms | 15.4 | 101.0 pts/$ |
| 04 | MiniMax: MiniMax M2.7 | Groq | 228 tok/s | 267ms | 22.8 | 43.4 pts/$ |
| 05 | Z.ai: GLM 5.2 (free) | Decart | 182 tok/s | 712ms | 33.7 | 33.8 pts/$ |
| 06 | Thinking Machines: Inkling (free) | BaseTen | 164 tok/s | 333ms | 25 | 14.2 pts/$ |
| 07 | Qwen: Qwen3.6 35B A3B | CoreWeave | 158 tok/s | 978ms | 18.2 | 50.2 pts/$ |
| 08 | DeepSeek: DeepSeek V4.1 Flash (batch) | Together | 154 tok/s | 333ms | 39.5 | 197.5 pts/$ |
| 09 | Google: Gemini 3.7 Flash (batch) | Google AI Studio | 144 tok/s | 1588ms | 39.1 | 26.1 pts/$ |
| 10 | MiniMax: MiniMax M3 | Mara | 136 tok/s | 1330ms | 29.2 | 55.6 pts/$ |
| 11 | Z.ai: GLM 5.3 (batch) | Decart | 134 tok/s | 640ms | 44.8 | 34.7 pts/$ |
| 12 | inclusionAI: Ling 3.0 Flash Fin (free) | DeepInfra | 132 tok/s | 711ms | 22.6 | 251.1 pts/$ |
| 13 | Google: Gemini 3.5 Flash (batch) | 131 tok/s | 1513ms | 32.6 | 9.7 pts/$ | |
| 14 | NVIDIA: Nemotron 3 Ultra (free) | BaseTen | 130 tok/s | 279ms | 22.9 | 21.8 pts/$ |
| 15 | OpenAI: GPT-5.6 Luna (batch) | Amazon Bedrock | 128 tok/s | 549ms | 37.3 | 82.9 pts/$ |
| 16 | OpenAI: GPT-6 Luna (batch) | Azure | 128 tok/s | 3716ms | 37.3 | 186.5 pts/$ |
| 17 | Meta: Muse Spark 1.2 Contributor | Meta | 126 tok/s | 2473ms | - | - |
| 18 | Google: Gemini 2.5 Flash Lite (batch) | Google AI Studio | 118 tok/s | 744ms | - | - |
| 19 | Poolside: Laguna XS 2.1 (free) | Poolside | 114 tok/s | 268ms | - | - |
| 20 | Qwen: Qwen3.8 Flash | Makora | 112 tok/s | 1011ms | - | - |
| 21 | DeepSeek: DeepSeek V3.2 | Mara | 108 tok/s | 1261ms | - | - |
| 22 | Meta: Muse Spark 1.2 | Meta | 105 tok/s | 2525ms | 39.6 | 19.8 pts/$ |
| 23 | inclusionAI: Ling-2.6-flash | Novita | 101 tok/s | 630ms | - | - |
| 24 | NVIDIA: Nemotron 3.5 Lightning (free) | CoreWeave | 99 tok/s | 187ms | 12.9 | 125.9 pts/$ |
| 25 | OpenAI: GPT-5.6 Luna Pro (batch) | Azure | 99 tok/s | 15729ms | - | - |
| 26 | OpenAI: GPT-5 Mini (batch) | Azure | 99 tok/s | 3867ms | 16.8 | 24.4 pts/$ |
| 27 | StepFun: Step 3.7 Flash | DeepInfra | 96 tok/s | 410ms | - | - |
| 28 | NVIDIA: Nemotron 3 Super (free) | DeepInfra | 96 tok/s | 5286ms | 12.8 | 74.2 pts/$ |
| 29 | Nex AGI: Nex-N2-Mini | Nex AGI | 94 tok/s | 534ms | - | - |
| 30 | OpenAI: GPT-5.6 Terra (batch) | Amazon Bedrock | 94 tok/s | 1550ms | 42.1 | 9.4 pts/$ |
| 31 | Google: Gemini 3.8 Flash (batch) | Google AI Studio | 89 tok/s | 1833ms | 40.9 | 27.3 pts/$ |
| 32 | Tencent: Hy3 | AtlasCloud | 88 tok/s | 1966ms | - | - |
| 33 | DeepSeek: DeepSeek V4 Flash Vision Exp | SiliconFlow | 88 tok/s | 1925ms | - | - |
| 34 | Meta: Muse Spark 1.3 Contributor | Meta | 87 tok/s | 4408ms | - | - |
| 35 | Qwen: Qwen3.8 27B (free) | Venice | 84 tok/s | 824ms | 33.7 | 31.6 pts/$ |
| 36 | DeepSeek: DeepSeek V4 Flash 0423 | Alibaba | 84 tok/s | 892ms | 34.3 | 180.5 pts/$ |
| 37 | Z.ai: GLM 5.3 Flash (batch) | Together | 84 tok/s | 648ms | 41.8 | 176.0 pts/$ |
| 38 | OpenAI: GPT-5.6 Sol (batch) | Amazon Bedrock | 80 tok/s | 2890ms | 47 | 11.7 pts/$ |
| 39 | Google: Gemini 2.5 Flash (batch) | 78 tok/s | 820ms | - | - | |
| 40 | Anthropic: Claude Opus 5 (batch) | Azure | 75 tok/s | 3608ms | 50.8 | 5.1 pts/$ |
Top 5, speed over time
- OpenAI: gpt-oss-120b
- OpenAI: gpt-oss-20b (batch)
- Google: Gemma 4 31B (free)
- MiniMax: MiniMax M2.7
- Z.ai: GLM 5.2 (free)
Frequently asked questions
What is the fastest AI model?
As of the latest data, OpenAI: gpt-oss-120b is the fastest widely available AI model at 622 tokens/second via Cerebras.
How fast is OpenAI: gpt-oss-120b in tokens per second?
OpenAI: gpt-oss-120b generates approximately 622 tokens per second on its fastest available provider (Cerebras), measured directly from OpenRouter's endpoint data.
