SmophyAI

Published daily · Next update 02:00 UTC

Themed ranking

Fastest and most reliable

Ranked by real measured throughput (tokens/sec) at each model's best-performing provider, tracked daily.

As of August 9, 2026, OpenAI: gpt-oss-120b ranks #1 for fastest and most reliable at throughput (tok/s) 777 tok/s.

  1. #1 OpenAI: gpt-oss-120b - Throughput (tok/s) 777 tok/s
  2. #2 Google: Gemma 4 31B (free) - Throughput (tok/s) 279 tok/s
  3. #3 MiniMax: MiniMax M2.7 - Throughput (tok/s) 215 tok/s
  4. #4 NVIDIA: Nemotron 3 Super (free) - Throughput (tok/s) 183 tok/s
  5. #5 Poolside: Laguna XS 2.1 (free) - Throughput (tok/s) 156 tok/s
  6. #6 OpenAI: GPT-5.6 Luna Pro (batch) - Throughput (tok/s) 154 tok/s
  7. #7 Google: Gemini 2.5 Flash Lite (batch) - Throughput (tok/s) 139 tok/s
  8. #8 StepFun: Step 3.7 Flash - Throughput (tok/s) 137 tok/s
  9. #9 NVIDIA: Nemotron 3 Ultra (free) - Throughput (tok/s) 130 tok/s
  10. #10 Google: Gemini 3.6 Flash (batch) - Throughput (tok/s) 129 tok/s
40 eligible models, sorted by throughput (tok/s)
#ModelThroughput (tok/s)
01OpenAI: gpt-oss-120b777 tok/s
02Google: Gemma 4 31B (free)279 tok/s
03MiniMax: MiniMax M2.7215 tok/s
04NVIDIA: Nemotron 3 Super (free)183 tok/s
05Poolside: Laguna XS 2.1 (free)156 tok/s
06OpenAI: GPT-5.6 Luna Pro (batch)154 tok/s
07Google: Gemini 2.5 Flash Lite (batch)139 tok/s
08StepFun: Step 3.7 Flash137 tok/s
09NVIDIA: Nemotron 3 Ultra (free)130 tok/s
10Google: Gemini 3.6 Flash (batch)129 tok/s
11MiniMax: MiniMax M3 (batch)123 tok/s
12DeepSeek: DeepSeek V4 Pro122 tok/s
13Z.ai: GLM 5.2 (batch)115 tok/s
14OpenAI: GPT-5.6 Luna (batch)104 tok/s
15Google: Gemini 2.5 Flash (batch)100 tok/s
16OpenAI: GPT-5 Mini (batch)96 tok/s
17Poolside: Laguna S 2.1 (free)95 tok/s
18DeepSeek: DeepSeek V4 Flash 042380 tok/s
19Google: Gemma 4 26B A4B (free)77 tok/s
20Xiaomi: MiMo-V2.575 tok/s
21Google: Gemini 3.1 Flash Lite (batch)75 tok/s
22Anthropic: Claude Haiku 4.5 (batch)74 tok/s
23inclusionAI: Ling-2.6-flash71 tok/s
24OpenAI: GPT-5.6 Terra (batch)69 tok/s
25Anthropic: Claude Sonnet 5 (batch)68 tok/s
26Claude Opus 5 (batch)66 tok/s
27Anthropic: Claude Opus 4.8 (batch)66 tok/s
28Google: Gemini 3 Flash Preview (batch)60 tok/s
29MoonshotAI: Kimi K360 tok/s
30Xiaomi: MiMo-V2.5-Pro59 tok/s
31Tencent: Hy359 tok/s
32Anthropic: Claude Opus 4.7 (batch)59 tok/s
33Mistral: Mistral Nemo50 tok/s
34SpaceXAI: Grok 4.550 tok/s
35Anthropic: Claude Fable 5 (batch)48 tok/s
36Qwen: Qwen3.8 Max43 tok/s
37Anthropic: Claude Sonnet 4.6 (batch)42 tok/s
38OpenAI: GPT-5.6 Sol (batch)41 tok/s
39OpenAI: GPT-4o-mini (batch)40 tok/s
40DeepSeek: DeepSeek V3.240 tok/s

Source: OpenRouter (openrouter.ai/rankings), as of August 9, 2026.

Benchmark scores: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings).

Methodology: smophy.ai/benchmark/methodology

Token counts originate from each provider's own tokenizer and are not directly comparable across providers.