SmophyAI

Published daily · Next update 02:00 UTC

Themed ranking

Lowest latency

Ranked by real measured median (p50) response latency at each model's best-performing provider, tracked daily. Lower is faster to first meaningful output.

As of August 9, 2026, OpenAI: gpt-oss-120b ranks #1 for lowest latency at latency p50 215ms.

  1. #1 OpenAI: gpt-oss-120b - Latency p50 215ms
  2. #2 Poolside: Laguna XS 2.1 (free) - Latency p50 235ms
  3. #3 Google: Gemini 2.5 Flash Lite (batch) - Latency p50 307ms
  4. #4 Mistral: Mistral Nemo - Latency p50 333ms
  5. #5 MiniMax: MiniMax M2.7 - Latency p50 353ms
  6. #6 Google: Gemini 2.5 Flash (batch) - Latency p50 407ms
  7. #7 NVIDIA: Nemotron 3 Ultra (free) - Latency p50 443ms
  8. #8 Anthropic: Claude Haiku 4.5 (batch) - Latency p50 457ms
  9. #9 Tencent: Hy3 - Latency p50 463ms
  10. #10 DeepSeek: DeepSeek V4 Pro - Latency p50 506ms
40 eligible models, sorted by latency p50
#ModelLatency p50
01OpenAI: gpt-oss-120b215ms
02Poolside: Laguna XS 2.1 (free)235ms
03Google: Gemini 2.5 Flash Lite (batch)307ms
04Mistral: Mistral Nemo333ms
05MiniMax: MiniMax M2.7353ms
06Google: Gemini 2.5 Flash (batch)407ms
07NVIDIA: Nemotron 3 Ultra (free)443ms
08Anthropic: Claude Haiku 4.5 (batch)457ms
09Tencent: Hy3463ms
10DeepSeek: DeepSeek V4 Pro506ms
11Google: Gemma 4 26B A4B (free)515ms
12OpenAI: GPT-4o-mini (batch)534ms
13Poolside: Laguna S 2.1 (free)544ms
14Google: Gemini 3.1 Flash Lite (batch)548ms
15inclusionAI: Ling-2.6-flash594ms
16Xiaomi: MiMo-V2.5682ms
17Google: Gemma 4 31B (free)686ms
18Xiaomi: MiMo-V2.5-Pro687ms
19MiniMax: MiniMax M3 (batch)690ms
20Z.ai: GLM 5.2 (batch)702ms
21DeepSeek: DeepSeek V3.2743ms
22DeepSeek: DeepSeek V4 Flash 0423767ms
23SpaceXAI: Grok 4.5840ms
24StepFun: Step 3.7 Flash1016ms
25Google: Gemini 3 Flash Preview (batch)1021ms
26Anthropic: Claude Opus 4.7 (batch)1048ms
27Anthropic: Claude Sonnet 4.6 (batch)1383ms
28NVIDIA: Nemotron 3 Super (free)1405ms
29OpenAI: GPT-5 Mini (batch)1548ms
30Google: Gemini 3.6 Flash (batch)1622ms
31OpenAI: GPT-5.6 Luna (batch)1762ms
32Qwen: Qwen3.8 Max2026ms
33Anthropic: Claude Opus 4.8 (batch)2178ms
34OpenAI: GPT-5.6 Sol (batch)2190ms
35MoonshotAI: Kimi K32277ms
36OpenAI: GPT-5.6 Terra (batch)2931ms
37Anthropic: Claude Sonnet 5 (batch)3445ms
38Claude Opus 5 (batch)3460ms
39Anthropic: Claude Fable 5 (batch)4983ms
40OpenAI: GPT-5.6 Luna Pro (batch)7041ms

Source: OpenRouter (openrouter.ai/rankings), as of August 9, 2026.

Benchmark scores: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings).

Methodology: smophy.ai/benchmark/methodology

Token counts originate from each provider's own tokenizer and are not directly comparable across providers.