Price-band ranking
Best AI models $2-10 / 1M tokens
As of September 23, 2026, Anthropic: Claude Opus 5.5 (batch) is the top-quality model priced $2-10 / 1m tokens, scoring 57.6 on the Artificial Analysis Intelligence Index among 20 eligible models in this price tier.
- #1 Anthropic: Claude Opus 5.5 (batch) - Quality 57.6 · $8.00/1M
- #2 Qwen: Qwen3.8 Max - Quality 53.4 · $3.00/1M
- #3 OpenAI: GPT-6 Sol (batch) - Quality 47.5 · $4.00/1M
- #4 OpenAI: GPT-5.6 Sol (batch) - Quality 47 · $4.00/1M
- #5 SpaceXAI: Grok 4.7 - Quality 46.4 · $2.40/1M
- #6 SpaceXAI: Grok 4.6 - Quality 44.3 · $3.00/1M
- #7 MoonshotAI: Kimi K3 (batch) - Quality 43.6 · $6.00/1M
- #8 OpenAI: GPT-5.6 Terra (batch) - Quality 42.1 · $4.50/1M
| # | Model | Quality | Price/1M |
|---|---|---|---|
| 01 | Anthropic: Claude Opus 5.5 (batch) | 57.6 | $8.00 |
| 02 | Qwen: Qwen3.8 Max | 53.4 | $3.00 |
| 03 | OpenAI: GPT-6 Sol (batch) | 47.5 | $4.00 |
| 04 | OpenAI: GPT-5.6 Sol (batch) | 47 | $4.00 |
| 05 | SpaceXAI: Grok 4.7 | 46.4 | $2.40 |
| 06 | SpaceXAI: Grok 4.6 | 44.3 | $3.00 |
| 07 | MoonshotAI: Kimi K3 (batch) | 43.6 | $6.00 |
| 08 | OpenAI: GPT-5.6 Terra (batch) | 42.1 | $4.50 |
| 09 | Qwen: Qwen3.8 2.4T A95B | 39.9 | $3.00 |
| 10 | Meta: Muse Spark 1.2 | 39.6 | $2.00 |
| 11 | SpaceXAI: Grok 4.5 | 38.8 | $3.00 |
| 12 | Anthropic: Claude Sonnet 5 (batch) | 38.2 | $4.00 |
| 13 | Meta: Muse Spark 1.1 | 33.7 | $2.00 |
| 14 | Google: Gemini 3.5 Flash (batch) | 32.6 | $3.38 |
| 15 | Anthropic: Claude Sonnet 4.6 (batch) | 30.1 | $6.00 |
| 16 | Google: Gemini 3.1 Pro Preview (batch) | 29.7 | $4.50 |
| 17 | Qwen: Qwen3.7 Max | 29.5 | $2.21 |
| 18 | Anthropic: Claude Sonnet 4.5 (batch) | 20.7 | $6.00 |
| 19 | Anthropic: Claude Haiku 4.5 (batch) | 16.9 | $2.00 |
| 20 | Google: Gemini 2.5 Pro (batch) | 16.1 | $3.44 |
Source: OpenRouter (openrouter.ai/rankings), as of September 23, 2026.
Benchmark scores: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings).
Methodology: www.smophy.ai/benchmark/methodology
Token counts originate from each provider's own tokenizer and are not directly comparable across providers.
