Общий зачёт: пять способностей сведены в один балл, чтобы модели можно было сравнить целиком, а не по одной задаче. Считается по слепым сравнениям живых людей, то есть отвечает на вопрос, чей ответ чаще предпочитают, а не сколько задач решено. Если нужен один конкретный навык, точнее смотреть отдельную подборку.
| # | Модель | Разработчик | Сводный балл | Вход$ / 1M | Выход$ / 1M | Контексттокенов | код25 % | язык20 % | математика15 % | знания20 % | рассуждения20 % |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 99,55 94–100 | $5 | $25 | 1 000K | 99,9 | 100 | 100 | 97,9 | 100 |
| 2 | Claude Opus 4.6 ≈ | Anthropic | 98,43 97–99 | $5 | $25 | 1 000K | 100 | 99,2 | 93,2 | 100 | 98,1 |
| 3 | Claude Fable 5 ≈ | Anthropic | 97,79 95–99 | $10 | $50 | 1 000K | 97 | 99,6 | 98,1 | 98,2 | 96,4 |
| 4 | Claude Opus 4.7 ≈ | Anthropic | 95,23 94–97 | $5 | $25 | 1 000K | 96,5 | 97,1 | 89,6 | 97,5 | 93,7 |
| 5 | Gemini 3.5 Flash ≈ | Google DeepMind | 94,6 92–97 | $1,5 | $9 | 1 049K | 91,9 | 99,3 | 96,2 | 95,3 | 91,3 |
| 6 | Gemini 3.6 Flash ≈ | Google DeepMind | 93,42 90–97 | $1,5 | $7,5 | 1 049K | 92,6 | 95,7 | 93,3 | 94,2 | 91,6 |
| 7 | Kimi K3 ≈ | Moonshot AI (Kimi) | 93,25 89–97 | $2 | $8 | 1 049K | 93,4 | 95,5 | — | 92,9 | 91,2 |
| 8 | Muse Spark 1.1 ≈ | Meta AI | 92,52 90–95 | $1,25 | $4,25 | 1 049K | 92,6 | 99,5 | 86,3 | 91,3 | 91,4 |
| 9 | Gemini 3.1 Pro Preview ≈ | Google DeepMind | 92,29 91–93 | $2 | $12 | 1 049K | 90,4 | 98,7 | 89,7 | 91,4 | 91,1 |
| 10 | MiMo V2.5 Pro ≈ | Xiaomi | 91,64 90–93 | $0,44 | $0,87 | 1 050K | 93,1 | 90,5 | 87,6 | 94,3 | 91,3 |
| 11 | Gemini 3 Pro ≈ | Google DeepMind | 91,55 90–93 | $1,6 | $9,6 | 1 049K | 90,2 | 98,6 | 87,3 | 90,3 | 90,7 |
| 12 | GPT-5.6 Terra ≈ | OpenAI | 90,96 88–94 | $2 | $12 | 1 050K | 91,3 | 92,7 | 86,6 | 94,7 | 88,4 |
| 13 | Claude Sonnet 4.6 ≈ | Anthropic | 90,88 90–92 | $3 | $15 | 1 000K | 93,9 | 88,6 | 84,5 | 93,9 | 91,2 |
| 14 | GLM 5.1 ≈ | Zhipu AI / Z.ai | 90,85 89–93 | $0,06 | $0,22 | 205K | 92,1 | 93 | 87,8 | 90,9 | 89,5 |
| 15 | ERNIE 5.1 ≈ | Baidu (Ernie) | 90,77 89–92 | $0,75 | $3 | 119K | 91,3 | 92,1 | 87,8 | 91,4 | 90,4 |
| 16 | GPT-5.6 Sol ≈ | OpenAI | 90,49 87–94 | $5 | $30 | 1 050K | 90,8 | 92,5 | 83 | 94,6 | 89,6 |
| 17 | Claude Opus 4.8 ≈ | Anthropic | 90,33 89–92 | $5 | $25 | 1 000K | 90,7 | 93,2 | 85,5 | 91,8 | 89,1 |
| 18 | Claude 4.5 Opus ≈ | Anthropic | 90,05 89–91 | $5 | $25 | 200K | 93,1 | 90 | 84,2 | 91,4 | 89,4 |
| 19 | Kimi K2.6 ≈ | Moonshot AI (Kimi) | 89,8 88–91 | $0,22 | $1,14 | 262K | 91 | 89,8 | 87 | 92 | 88,4 |
| 20 | Grok 4.5 ≈ | xAI | 89,49 87–92 | $2 | $6 | 500K | 89,5 | 91,8 | 88,8 | 89,9 | 87,3 |
| 21 | GLM 5.2 ≈ | Zhipu AI / Z.ai | 89,26 87–91 | $0,42 | $1,32 | 1 049K | 89,2 | 92,6 | 86,4 | 88,5 | 88,9 |
| 22 | Qwen3.7 Plus ≈ | Alibaba (Qwen) | 89,21 87–91 | $0,5 | $3 | 1 000K | 90 | 93,4 | 86 | 88,3 | 87,3 |
| 23 | Claude Sonnet 5 ≈ | Anthropic | 89,15 87–92 | $2 | $10 | 1 000K | 90,7 | 88,8 | 84,8 | 93 | 87 |
| 24 | Gemini 3 Flash ≈ | Google DeepMind | 88,77 87–91 | $0,4 | $2,4 | 1 049K | 86,4 | 95,8 | 86,9 | 87,4 | 87,5 |
| 25 | Qwen3.6 Max Preview ≈ | Alibaba (Qwen) | 87,48 84–91 | $1,3 | $7,8 | 262K | 87,3 | 89,7 | 84,7 | 89,2 | 85,9 |
| 26 | Hy3 ≈ | Tencent (Hunyuan) | 87,48 83–92 | $0,13 | $0,53 | 262K | 87,3 | 91 | — | 87,1 | 84,6 |
| 27 | Kimi K2.5 Thinking TEE ≈ | Moonshot AI (Kimi) | 87,4 86–89 | $0,3 | $1,9 | 256K | 88,5 | 88,2 | 86,3 | 87,9 | 85,6 |
| 28 | Inkling ≈ | Thinking Machines Lab | 87,24 84–91 | $1,87 | $4,68 | 1 049K | 87,3 | 87,9 | 87,7 | 88,3 | 85,1 |
| 29 | DeepSeek V4 Pro ≈ | DeepSeek | 87,11 86–89 | $0,44 | $0,87 | 1 049K | 87,9 | 90,5 | 81 | 87,6 | 86,8 |
| 30 | MiMo V2 Pro ≈ | Xiaomi | 87,03 85–89 | $0,44 | $0,87 | 1 049K | 89 | 86,1 | 82 | 90 | 86,3 |
| 31 | Claude Sonnet 4.5 ≈ | Anthropic | 87,01 86–88 | $3 | $15 | 1 000K | 90,7 | 88 | 77,1 | 89 | 87 |
| 32 | GPT-5.6 Luna ≈ | OpenAI | 86,66 84–90 | $0,2 | $1,2 | 1 050K | 88,1 | 85,6 | 82,4 | 90,3 | 85,4 |
| 33 | Gemma 4 31B ≈ | Google DeepMind | 86,46 83–90 | $0,14 | $0,4 | 262K | 85 | 92,6 | 85,4 | 85,4 | 84 |
| 34 | Gemini 2.5 Pro ≈ | Google DeepMind | 86,34 85–87 | $1,25 | $10 | 1 049K | 84,5 | 92,5 | 82,5 | 86 | 85,7 |
| 35 | MiniMax M3 ≈ | MiniMax | 86,25 84–88 | $0,3 | $1,2 | 1 049K | 88,3 | 87,2 | 80,9 | 88,4 | 84,6 |
| 36 | Grok 4.20 (Reasoning) ≈ | xAI | 86,15 85–87 | $2 | $6 | 2 000K | 85,7 | 92,4 | 83,7 | 83,3 | 85,2 |
| 37 | Qwen3.5 397B-A17B ≈ | Alibaba (Qwen) | 86,14 85–87 | $0,6 | $3,6 | 262K | 87 | 87,6 | 82,2 | 88,1 | 84,7 |
| 38 | Qwen3.6 Plus ≈ | Alibaba (Qwen) | 85,92 84–87 | $0,5 | $3 | 1 000K | 87 | 88 | 82,6 | 86,4 | 84,5 |
| 39 | Seed 2.0 Pro ≈ | ByteDance (Doubao) | 85,92 85–87 | $0,5 | $3 | 131K | 88 | 90,3 | 80,3 | 83,6 | 85,6 |
| 40 | Grok 4.20 Multi Agent Beta 0309 ≈ | xAI | 85,67 84–87 | $2 | $6 | 2 000K | 85,5 | 92,1 | 80,4 | 84,5 | 84,6 |
| 41 | GLM 5 ≈ | Zhipu AI / Z.ai | 85,42 84–87 | $0,48 | $1,9 | 205K | 86 | 88,1 | 80,2 | 86,3 | 85,1 |
| 42 | GLM 5V Turbo ≈ | Zhipu AI / Z.ai | 85,34 82–88 | $0,7 | $3,1 | 203K | 87,3 | 86,3 | 83,2 | 85,1 | 83,7 |
| 43 | Qwen3 Max Preview ≈ | Alibaba (Qwen) | 85,11 83–87 | $1,2 | $6 | 256K | 85,4 | 85,5 | 82,4 | 86,9 | 84,6 |
| 44 | Gemma 4 26B-A4B ≈ | Google DeepMind | 85,03 81–89 | $0,05 | $0,29 | 262K | 82,9 | 89,6 | 85,5 | 84,9 | 82,9 |
| 45 | MiMo V2.5 ≈ | Xiaomi | 84,52 83–86 | $0,14 | $0,28 | 1 050K | 87,7 | 80,7 | 80,5 | 87,2 | 84,8 |
| 46 | GPT-5.2 Chat ≈ | OpenAI | 83,97 82–86 | $1,75 | $14 | 128K | 83,4 | 88,8 | 79,4 | 83,3 | 84 |
| 47 | DeepSeek V4 Flash ≈ | DeepSeek | 83,97 82–85 | $0,14 | $0,28 | 1 049K | 85,2 | 86,9 | 78,2 | 84,1 | 83,7 |
| 48 | MiMo V2 Omni ≈ | Xiaomi | 83,74 82–86 | $0,14 | $0,28 | 262K | 86,9 | 82,9 | 79 | 84,3 | 83,6 |
| 49 | Claude 4.1 Opus ≈ | Anthropic | 83,63 82–85 | $15 | $75 | 200K | 88,4 | 85,7 | 77,1 | 80,9 | 83,2 |
| 50 | Gemini 3.5 Flash Lite ≈ | Google DeepMind | 83,6 80–87 | $0,3 | $2,5 | 1 049K | 85,1 | 88,9 | 75,8 | 82,6 | 83,3 |
| 51 | DeepSeek V3.2 ≈ | DeepSeek | 82,99 82–84 | $0,28 | $0,4 | 164K | 83,8 | 86 | 79,8 | 82,6 | 81,8 |
| 52 | GLM 4.6 ≈ | Zhipu AI / Z.ai | 82,98 81–85 | $0,29 | $1,14 | 205K | 83,9 | 85,1 | 79,1 | 82,5 | 83,1 |
| 53 | GLM 4.7 ≈ | Zhipu AI / Z.ai | 82,97 80–86 | $0,15 | $0,8 | 205K | 85,1 | 86,7 | 77,4 | 80 | 83,7 |
| 54 | Longcat Flash Chat ≈ | Meituan | 82,85 80–86 | — | — | 131K | 87,4 | 79,6 | 80,7 | 83,2 | 81,7 |
| 55 | Mistral Medium 3.5 ≈ | Mistral AI | 82,84 80–86 | $1,5 | $7,5 | 262K | 86 | 82,3 | 79,3 | 82,5 | 82,4 |
| 56 | Qwen3 235B A22B Instruct 2507 ≈ | Alibaba (Qwen) | 82,54 81–84 | $0,1 | $0,1 | 262K | 83,1 | 83,7 | 78,9 | 84,2 | 81,8 |
| 57 | Qwen3 VL 235B A22B Instruct ≈ | Alibaba (Qwen) | 81,85 79–85 | $0,4 | $1,6 | 262K | 82,2 | 82,3 | 77,9 | 84,6 | 81,2 |
| 58 | Grok 4.1 ≈ | xAI | 81,74 80–83 | $2 | $10 | 200K | 83 | 86,4 | 76,3 | 79 | 82,3 |
| 59 | Kimi K2 Thinking Turbo ≈ | Moonshot AI (Kimi) | 81,71 80–83 | $1,15 | $8 | 262K | 84,7 | 80,1 | 78,5 | 83,1 | 80,7 |
| 60 | GLM 4.5 ≈ | Zhipu AI / Z.ai | 81,31 79–84 | $0,2 | $0,8 | 131K | 80,9 | 84,5 | 78,1 | 81,4 | 80,9 |
| 61 | GPT-5.5 Instant ≈ | OpenAI | 81,31 79–83 | $5 | $30 | 400K | 81,1 | 87,3 | 77,4 | 79,2 | 80,6 |
| 62 | Mistral Large 3 ≈ | Mistral AI | 81,11 80–82 | $0,5 | $1,5 | 256K | 82,9 | 83,8 | 75,9 | 80 | 81,2 |
| 63 | Qwen3 Next 80B A3B Instruct ≈ | Alibaba (Qwen) | 80,95 79–83 | $0,15 | $1,2 | 262K | 82,4 | 81,9 | 80,9 | 78,4 | 80,8 |
| 64 | Qwen3 Max 2025-09-23 ≈ | Alibaba (Qwen) | 80,86 78–84 | $0,86 | $3,43 | 258K | 82 | 85,2 | 80,3 | 76,2 | 80,2 |
| 65 | MiniMax M2.7 ≈ | MiniMax | 80,79 79–82 | $0,3 | $1,2 | 205K | 84,3 | 78,2 | 76,8 | 83,1 | 79,7 |
| 66 | Qwen3.5 122B-A10B ≈ | Alibaba (Qwen) | 80,78 79–83 | $0,4 | $3,2 | 262K | 81,4 | 81,3 | 78,4 | 82,5 | 79,6 |
| 67 | Qwen3 235B A22B Thinking-2507 ≈ | Alibaba (Qwen) | 80,34 77–84 | $0,1 | $0,1 | 262K | 79,1 | 81,5 | 75,5 | 86,2 | 78,5 |
| 68 | Mistral Medium 3.1 ≈ | Mistral AI | 80,13 79–81 | $0,4 | $2 | 262K | 81,2 | 84,1 | 75 | 78,2 | 80,6 |
| 69 | Gemini 2.5 Flash ≈ | Google DeepMind | 80,11 79–81 | $0,3 | $2,5 | 1 049K | 79,1 | 84,9 | 75 | 80,9 | 79,8 |
| 70 | Claude Haiku 4.5 ≈ | Anthropic | 79,94 79–81 | $1 | $5 | 200K | 84,2 | 77,7 | 71,7 | 84,1 | 78,9 |
| 71 | DeepSeek V3.2 Exp ≈ | DeepSeek | 79,91 77–83 | $0,22 | $0,33 | 164K | 80,9 | 82,4 | 77,6 | 76,7 | 81,1 |
| 72 | Qwen3.5 27B ≈ | Alibaba (Qwen) | 79,55 78–81 | $0,3 | $2,4 | 262K | 79,3 | 80,1 | 79,3 | 80,9 | 78,1 |
| 73 | MiMo V2 Flash ≈ | Xiaomi | 79,4 78–81 | $0,14 | $0,28 | 262K | 82,4 | 79,4 | 72,3 | 81,2 | 79,3 |
| 74 | ChatGPT 4o Latest ≈ | OpenAI | 79,21 78–80 | $5 | $15 | 128K | 77,4 | 87,1 | 74,1 | 76,5 | 80,2 |
| 75 | DeepSeek R1 0528 ≈ | DeepSeek | 79,17 77–82 | $0,25 | $0,25 | 164K | 79,7 | 86,2 | 73,8 | 76,1 | 78,5 |
| 76 | Step 3.5 Flash ≈ | StepFun | 79,11 78–80 | $0,1 | $0,3 | 262K | 81,6 | 79,5 | 74,3 | 80,6 | 77,8 |
| 77 | Grok 4 ≈ | xAI | 78,89 77–81 | $3 | $15 | 256K | 76,3 | 84,1 | 77,6 | 79,6 | 77,2 |
| 78 | DeepSeek V3.1 ≈ | DeepSeek | 78,39 76–81 | $0,2 | $0,7 | 164K | 77,4 | 81,9 | 77 | 77,1 | 78,4 |
| 79 | Gemini 3.1 Flash Lite Preview ≈ | Google DeepMind | 78,21 77–80 | $0,25 | $1,5 | 1 049K | 74,6 | 85,5 | 78,9 | 76,3 | 76,9 |
| 80 | DeepSeek V3.1 Terminus ≈ | DeepSeek | 78,17 74–83 | $0,21 | $0,79 | 164K | 75,9 | 86,5 | 72,8 | — | 76,7 |
| 81 | 2025) ≈ | Google DeepMind | 78,11 76–80 | $0,3 | $2,5 | 1 049K | 75 | 81,6 | 76,1 | 80,9 | 77,3 |
| 82 | o3 2025-04-16 ≈ | OpenAI | 77,86 76–79 | $2 | $8 | 200K | 76,2 | 83,3 | 77,6 | 76,6 | 76 |
| 83 | Qwen3 VL 235B A22B Thinking ≈ | Alibaba (Qwen) | 77,72 74–81 | $0,4 | $4 | 262K | 79,9 | 74,8 | 75,8 | 80,1 | 77,1 |
| 84 | Grok 4 Fast Reasoning ≈ | xAI | 77,42 75–80 | $0,2 | $0,5 | 2 000K | 78,1 | 80,1 | 73,7 | 77,9 | 76,2 |
| 85 | Qwen3.5 Flash ≈ | Alibaba (Qwen) | 77,27 76–79 | $0,09 | $0,36 | 1 000K | 77,2 | 78,9 | 74,8 | 78,5 | 76,4 |
| 86 | GPT 5 Chat ≈ | OpenAI | 77,26 75–79 | $1,25 | $10 | 128K | 74,7 | 82,5 | 74,7 | 77,8 | 76,6 |
| 87 | GPT 4.5 Preview ≈ | OpenAI | 77,18 74–80 | $75 | $150 | 128K | 74,1 | 85 | 75,3 | 75,5 | 76,3 |
| 88 | Grok 4.1 Fast Reasoning ≈ | xAI | 76,9 76–78 | $0,2 | $0,5 | 2 000K | 76,9 | 79 | 74 | 76,8 | 77,1 |
| 89 | Grok 4.3 ≈ | xAI | 76,7 75–78 | $1,25 | $2,5 | 1 000K | 77,6 | 83 | 71,4 | 74,4 | 75,6 |
| 90 | Qwen3.5 35B A3B ≈ | Alibaba (Qwen) | 76,48 75–78 | $0,25 | $2 | 262K | 76,4 | 77,9 | 74 | 77,8 | 75,7 |
| 91 | GPT-5.3 Chat (latest) ≈ | OpenAI | 76,13 74–78 | $1,75 | $14 | 128K | 75,8 | 82,1 | 70,2 | 76 | 75,1 |
| 92 | MiMo V2 Flash (Thinking) ≈ | Xiaomi | 75,94 73–79 | $0,1 | $0,31 | 256K | 77,9 | 76,9 | 69,1 | 77,1 | 76,5 |
| 93 | Qwen3 30B A3B Instruct 2507 ≈ | Alibaba (Qwen) | 75,41 73–78 | $0,05 | $0,19 | 262K | 77,9 | 75,3 | 72,1 | 75,1 | 75,2 |
| 94 | Hunyuan T1 ≈ | Tencent (Hunyuan) | 75,14 70–80 | — | — | 131K | 72,3 | 79,3 | 74,9 | 74,5 | 75,4 |
| 95 | Kimi K2 0905 Preview ≈ | Moonshot AI (Kimi) | 73,58 71–77 | $0,6 | $2,5 | 262K | 74,6 | 77 | 72,6 | 70,9 | 72,4 |
| 96 | NVIDIA Nemotron 3 Super 120B A12B ≈ | NVIDIA | 73,46 70–77 | $0,15 | $0,65 | 262K | 75,8 | 70,7 | 69,8 | 76,1 | 73,5 |
| 97 | Nemotron 3 Super ≈ | NVIDIA | 73,46 70–77 | $0,2 | $0,8 | 1 000K | 75,8 | 70,7 | 69,8 | 76,1 | 73,5 |
| 98 | GLM 4.5 Air ≈ | Zhipu AI / Z.ai | 73,23 71–75 | $0,11 | $0,29 | 131K | 74 | 76,3 | 72,6 | 71,3 | 71,6 |
| 99 | Claude 4 Opus ≈ | Anthropic | 73,2 72–75 | $15 | $75 | 200K | 75 | 78,4 | 68,1 | 71,6 | 71,2 |
| 100 | GPT 4.1 2025-04-14 ≈ | OpenAI | 72,21 71–74 | $2 | $8 | 1 048K | 72,8 | 77,1 | 67 | 70,3 | 72,4 |
Таблицу можно прокрутить вбок: колонки помещаются не все.
Колонки справа — слагаемые балла, приведённые к общей шкале 0–100 по фактическому разбросу среди измеренных моделей. Сложенные с указанными весами, они и дают число в основной колонке: по ним видно, на чём именно одна модель обошла другую. Прочерк означает «не измерено», а не ноль.
Цена — минимальная среди поставщиков модели, базовый тариф, без батчевых и льготных ставок. Вход и выход показаны раздельно намеренно: у большинства моделей выход дороже входа в несколько раз, и от того, чего в задаче больше, зависит итоговый счёт.
Знаком ≈ отмечены модели, у которых доверительный интервал пересекается с интервалом строки выше. Таких здесь 99 моделей — их порядок между собой по имеющимся данным не определён.
Доверительный интервал у половины моделей шире 3,6 пункта — это около 13 соседних строк таблицы. Внутри такой группы порядок задан не данными, а тем, кто в этот раз проголосовал; разницу между началом и концом списка данные выдерживают, соседство мест — нет.