SmophyAI

Published daily · Next update 02:00 UTC

Themed ranking

Lowest latency

Ranked by real measured median (p50) response latency at each model's best-performing provider, tracked daily. Lower is faster to first meaningful output.

As of September 23, 2026, NVIDIA: Nemotron 3.5 Lightning (free) ranks #1 for lowest latency at latency p50 187ms.

  1. #1 NVIDIA: Nemotron 3.5 Lightning (free) - Latency p50 187ms
  2. #2 OpenAI: gpt-oss-120b - Latency p50 219ms
  3. #3 Google: Gemma 4 31B (free) - Latency p50 244ms
  4. #4 MiniMax: MiniMax M2.7 - Latency p50 267ms
  5. #5 Poolside: Laguna XS 2.1 (free) - Latency p50 268ms
  6. #6 NVIDIA: Nemotron 3 Ultra (free) - Latency p50 279ms
  7. #7 Thinking Machines: Inkling (free) - Latency p50 333ms
  8. #8 DeepSeek: DeepSeek V4.1 Flash (batch) - Latency p50 333ms
  9. #9 Poolside: Laguna S 2.1 (free) - Latency p50 380ms
  10. #10 Mistral: Mistral Nemo - Latency p50 405ms
60 eligible models, sorted by latency p50
#ModelLatency p50
01NVIDIA: Nemotron 3.5 Lightning (free)187ms
02OpenAI: gpt-oss-120b219ms
03Google: Gemma 4 31B (free)244ms
04MiniMax: MiniMax M2.7267ms
05Poolside: Laguna XS 2.1 (free)268ms
06NVIDIA: Nemotron 3 Ultra (free)279ms
07Thinking Machines: Inkling (free)333ms
08DeepSeek: DeepSeek V4.1 Flash (batch)333ms
09Poolside: Laguna S 2.1 (free)380ms
10Mistral: Mistral Nemo405ms
11StepFun: Step 3.7 Flash410ms
12OpenAI: GPT-4o-mini (batch)430ms
13DeepSeek: DeepSeek V4 Pro 0423447ms
14Nex AGI: Nex-N2-Mini534ms
15Google: Gemini 3.5 Flash Lite (batch)542ms
16OpenAI: gpt-oss-20b (batch)546ms
17OpenAI: GPT-5.6 Luna (batch)549ms
18inclusionAI: Ling-2.6-flash630ms
19Z.ai: GLM 5.3 (batch)640ms
20Qwen: Qwen3.7 Flash647ms
21Z.ai: GLM 5.3 Flash (batch)648ms
22inclusionAI: Ling 3.0 Flash Fin (free)711ms
23Z.ai: GLM 5.2 (free)712ms
24Google: Gemini 2.5 Flash Lite (batch)744ms
25SpaceXAI: Grok 4.6793ms
26Google: Gemini 2.5 Flash (batch)820ms
27Qwen: Qwen3.8 27B (free)824ms
28Anthropic: Claude Haiku 4.5 (batch)888ms
29DeepSeek: DeepSeek V4 Flash 0423892ms
30Qwen: Qwen3.6 35B A3B978ms
31Qwen: Qwen3.8 Flash1011ms
32SpaceXAI: Grok 4.51020ms
33DeepSeek: DeepSeek V3.21261ms
34MiniMax: MiniMax M31330ms
35Google: Gemini 3.5 Flash (batch)1513ms
36OpenAI: GPT-5.6 Terra (batch)1550ms
37Google: Gemini 3.7 Flash (batch)1588ms
38MoonshotAI: Kimi K3 (batch)1665ms
39Google: Gemini 3.8 Flash (batch)1833ms
40Anthropic: Claude Opus 4.7 (batch)1846ms
41DeepSeek: DeepSeek V4 Flash Vision Exp1925ms
42Tencent: Hy31966ms
43OpenAI: GPT-5.5 (batch)2012ms
44Google: Gemini 3.1 Pro Preview (batch)2372ms
45Meta: Muse Spark 1.2 Contributor2473ms
46Meta: Muse Spark 1.22525ms
47Z.ai: GLM 5.3 FlashX2889ms
48OpenAI: GPT-5.6 Sol (batch)2890ms
49Anthropic: Claude Sonnet 5 (batch)2973ms
50OpenAI: GPT-5.4 (batch)3227ms
51Anthropic: Claude Opus 5 (batch)3608ms
52OpenAI: GPT-6 Luna (batch)3716ms
53OpenAI: GPT-5 Mini (batch)3867ms
54Meta: Muse Spark 1.3 Contributor4408ms
55Anthropic: Claude Fable 5 (batch)4494ms
56Meta: Muse Spark 1.35242ms
57NVIDIA: Nemotron 3 Super (free)5286ms
58Google: Gemini 3.6 Flash (batch)8322ms
59Anthropic: Claude Opus 4.8 (batch)11441ms
60OpenAI: GPT-5.6 Luna Pro (batch)15729ms

Source: OpenRouter (openrouter.ai/rankings), as of September 23, 2026.

Benchmark scores: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings).

Methodology: www.smophy.ai/benchmark/methodology

Token counts originate from each provider's own tokenizer and are not directly comparable across providers.