SmophyAI

Published daily · Next update 02:00 UTC

Speed · tracked daily

The fastest AI models right now

The fastest AI model right now is OpenAI: gpt-oss-120b at 622 tokens/second via Cerebras. Speed is tracked daily, not benchmarked once - providers re-provision constantly, so a static "fastest model" table goes stale within days.

  1. #1 OpenAI: gpt-oss-120b - 622 tok/s via Cerebras
  2. #2 OpenAI: gpt-oss-20b (batch) - 453 tok/s via Groq
  3. #3 Google: Gemma 4 31B (free) - 304 tok/s via Cerebras
  4. #4 MiniMax: MiniMax M2.7 - 228 tok/s via Groq
  5. #5 Z.ai: GLM 5.2 (free) - 182 tok/s via Decart
  6. #6 Thinking Machines: Inkling (free) - 164 tok/s via BaseTen
  7. #7 Qwen: Qwen3.6 35B A3B - 158 tok/s via CoreWeave
  8. #8 DeepSeek: DeepSeek V4.1 Flash (batch) - 154 tok/s via Together
  9. #9 Google: Gemini 3.7 Flash (batch) - 144 tok/s via Google AI Studio
  10. #10 MiniMax: MiniMax M3 - 136 tok/s via Mara
  11. #11 Z.ai: GLM 5.3 (batch) - 134 tok/s via Decart
  12. #12 inclusionAI: Ling 3.0 Flash Fin (free) - 132 tok/s via DeepInfra
  13. #13 Google: Gemini 3.5 Flash (batch) - 131 tok/s via Google
  14. #14 NVIDIA: Nemotron 3 Ultra (free) - 130 tok/s via BaseTen
  15. #15 OpenAI: GPT-5.6 Luna (batch) - 128 tok/s via Amazon Bedrock
Top 40 models by real throughput
#ModelFastest providerThroughputLatency p50QualityQuality per $
01OpenAI: gpt-oss-120bCerebras622 tok/s219ms11.644.2 pts/$
02OpenAI: gpt-oss-20b (batch)Groq453 tok/s546ms9250.0 pts/$
03Google: Gemma 4 31B (free)Cerebras304 tok/s244ms15.4101.0 pts/$
04MiniMax: MiniMax M2.7Groq228 tok/s267ms22.843.4 pts/$
05Z.ai: GLM 5.2 (free)Decart182 tok/s712ms33.733.8 pts/$
06Thinking Machines: Inkling (free)BaseTen164 tok/s333ms2514.2 pts/$
07Qwen: Qwen3.6 35B A3BCoreWeave158 tok/s978ms18.250.2 pts/$
08DeepSeek: DeepSeek V4.1 Flash (batch)Together154 tok/s333ms39.5197.5 pts/$
09Google: Gemini 3.7 Flash (batch)Google AI Studio144 tok/s1588ms39.126.1 pts/$
10MiniMax: MiniMax M3Mara136 tok/s1330ms29.255.6 pts/$
11Z.ai: GLM 5.3 (batch)Decart134 tok/s640ms44.834.7 pts/$
12inclusionAI: Ling 3.0 Flash Fin (free)DeepInfra132 tok/s711ms22.6251.1 pts/$
13Google: Gemini 3.5 Flash (batch)Google131 tok/s1513ms32.69.7 pts/$
14NVIDIA: Nemotron 3 Ultra (free)BaseTen130 tok/s279ms22.921.8 pts/$
15OpenAI: GPT-5.6 Luna (batch)Amazon Bedrock128 tok/s549ms37.382.9 pts/$
16OpenAI: GPT-6 Luna (batch)Azure128 tok/s3716ms37.3186.5 pts/$
17Meta: Muse Spark 1.2 ContributorMeta126 tok/s2473ms--
18Google: Gemini 2.5 Flash Lite (batch)Google AI Studio118 tok/s744ms--
19Poolside: Laguna XS 2.1 (free)Poolside114 tok/s268ms--
20Qwen: Qwen3.8 FlashMakora112 tok/s1011ms--
21DeepSeek: DeepSeek V3.2Mara108 tok/s1261ms--
22Meta: Muse Spark 1.2Meta105 tok/s2525ms39.619.8 pts/$
23inclusionAI: Ling-2.6-flashNovita101 tok/s630ms--
24NVIDIA: Nemotron 3.5 Lightning (free)CoreWeave99 tok/s187ms12.9125.9 pts/$
25OpenAI: GPT-5.6 Luna Pro (batch)Azure99 tok/s15729ms--
26OpenAI: GPT-5 Mini (batch)Azure99 tok/s3867ms16.824.4 pts/$
27StepFun: Step 3.7 FlashDeepInfra96 tok/s410ms--
28NVIDIA: Nemotron 3 Super (free)DeepInfra96 tok/s5286ms12.874.2 pts/$
29Nex AGI: Nex-N2-MiniNex AGI94 tok/s534ms--
30OpenAI: GPT-5.6 Terra (batch)Amazon Bedrock94 tok/s1550ms42.19.4 pts/$
31Google: Gemini 3.8 Flash (batch)Google AI Studio89 tok/s1833ms40.927.3 pts/$
32Tencent: Hy3AtlasCloud88 tok/s1966ms--
33DeepSeek: DeepSeek V4 Flash Vision ExpSiliconFlow88 tok/s1925ms--
34Meta: Muse Spark 1.3 ContributorMeta87 tok/s4408ms--
35Qwen: Qwen3.8 27B (free)Venice84 tok/s824ms33.731.6 pts/$
36DeepSeek: DeepSeek V4 Flash 0423Alibaba84 tok/s892ms34.3180.5 pts/$
37Z.ai: GLM 5.3 Flash (batch)Together84 tok/s648ms41.8176.0 pts/$
38OpenAI: GPT-5.6 Sol (batch)Amazon Bedrock80 tok/s2890ms4711.7 pts/$
39Google: Gemini 2.5 Flash (batch)Google78 tok/s820ms--
40Anthropic: Claude Opus 5 (batch)Azure75 tok/s3608ms50.85.1 pts/$

Top 5, speed over time

147511067373690Tokens/secondAug 9Aug 31Sep 23
  • OpenAI: gpt-oss-120b
  • OpenAI: gpt-oss-20b (batch)
  • Google: Gemma 4 31B (free)
  • MiniMax: MiniMax M2.7
  • Z.ai: GLM 5.2 (free)

Frequently asked questions

What is the fastest AI model?

As of the latest data, OpenAI: gpt-oss-120b is the fastest widely available AI model at 622 tokens/second via Cerebras.

How fast is OpenAI: gpt-oss-120b in tokens per second?

OpenAI: gpt-oss-120b generates approximately 622 tokens per second on its fastest available provider (Cerebras), measured directly from OpenRouter's endpoint data.