Themed ranking
Lowest latency
Ranked by real measured median (p50) response latency at each model's best-performing provider, tracked daily. Lower is faster to first meaningful output.
As of August 9, 2026, OpenAI: gpt-oss-120b ranks #1 for lowest latency at latency p50 215ms.
- #1 OpenAI: gpt-oss-120b - Latency p50 215ms
- #2 Poolside: Laguna XS 2.1 (free) - Latency p50 235ms
- #3 Google: Gemini 2.5 Flash Lite (batch) - Latency p50 307ms
- #4 Mistral: Mistral Nemo - Latency p50 333ms
- #5 MiniMax: MiniMax M2.7 - Latency p50 353ms
- #6 Google: Gemini 2.5 Flash (batch) - Latency p50 407ms
- #7 NVIDIA: Nemotron 3 Ultra (free) - Latency p50 443ms
- #8 Anthropic: Claude Haiku 4.5 (batch) - Latency p50 457ms
- #9 Tencent: Hy3 - Latency p50 463ms
- #10 DeepSeek: DeepSeek V4 Pro - Latency p50 506ms
Source: OpenRouter (openrouter.ai/rankings), as of August 9, 2026.
Benchmark scores: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings).
Methodology: smophy.ai/benchmark/methodology
Token counts originate from each provider's own tokenizer and are not directly comparable across providers.
