Тот же сводный балл, что и в общем зачёте, но только среди моделей с открытыми весами — тех, что можно скачать и запустить на своём железе. Подборка показывает, насколько открытые модели отстают от закрытых и в каких задачах не отстают вовсе.
| # | Модель | Разработчик | Сводный балл | Вход$ / 1M | Выход$ / 1M | Контексттокенов | код25 % | язык20 % | знания20 % | рассуждения20 % | математика15 % |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Kimi K3 | Moonshot AI (Kimi) | 99,62 95–100 | $2 | $8 | 1 049K | 100 | 100 | 98,5 | 99,9 | — |
| 2 | MiMo V2.5 Pro ≈ | Xiaomi | 98,85 97–99 | $0,44 | $0,87 | 1 050K | 99,7 | 94,8 | 100 | 100 | 99,8 |
| 3 | GLM 5.1 ≈ | Zhipu AI / Z.ai | 97,9 96–99 | $0,06 | $0,22 | 205K | 98,6 | 97,3 | 96,2 | 97,9 | 100 |
| 4 | Kimi K2.6 ≈ | Moonshot AI (Kimi) | 96,72 95–98 | $0,22 | $1,14 | 262K | 97,2 | 93,9 | 97,4 | 96,6 | 99 |
| 5 | GLM 5.2 ≈ | Zhipu AI / Z.ai | 96,06 94–98 | $0,42 | $1,32 | 1 049K | 95,1 | 97 | 93,5 | 97,2 | 98,2 |
| 6 | Inkling ≈ | Thinking Machines Lab | 93,82 90–97 | $1,87 | $4,68 | 1 049K | 93 | 92 | 93,3 | 92,7 | 99,9 |
| 7 | DeepSeek V4 Pro ≈ | DeepSeek | 93,5 92–95 | $0,44 | $0,87 | 1 049K | 93,7 | 94,7 | 92,6 | 94,7 | 91,3 |
| 8 | MiMo V2 Pro ≈ | Xiaomi | 93,5 91–96 | $0,44 | $0,87 | 1 049K | 94,9 | 90,1 | 95,2 | 94,1 | 92,6 |
| 9 | Hy3 ≈ | Tencent (Hunyuan) | 93,05 88–98 | $0,13 | $0,53 | 262K | 93 | 95,2 | 91,9 | 92,1 | — |
| 10 | Gemma 4 31B ≈ | Google DeepMind | 92,79 89–96 | $0,14 | $0,4 | 262K | 90,3 | 96,9 | 90,1 | 91,4 | 96,9 |
| 11 | MiniMax M3 ≈ | MiniMax | 92,54 90–95 | $0,3 | $1,2 | 1 049K | 94,1 | 91,2 | 93,4 | 92,1 | 91,2 |
| 12 | Qwen3.5 397B-A17B ≈ | Alibaba (Qwen) | 92,43 91–94 | $0,6 | $3,6 | 262K | 92,6 | 91,6 | 93 | 92,2 | 92,8 |
| 13 | Qwen3.6 Plus ≈ | Alibaba (Qwen) | 92,2 90–94 | $0,5 | $3 | 1 000K | 92,6 | 92,1 | 91,2 | 92 | 93,3 |
| 14 | GLM 5 ≈ | Zhipu AI / Z.ai | 91,58 90–94 | $0,48 | $1,9 | 205K | 91,5 | 92,1 | 91,1 | 92,7 | 90,2 |
| 15 | GLM 5V Turbo ≈ | Zhipu AI / Z.ai | 91,58 88–95 | $0,7 | $3,1 | 203K | 93 | 90,3 | 89,7 | 91 | 94,2 |
| 16 | Gemma 4 26B-A4B ≈ | Google DeepMind | 91,19 87–95 | $0,05 | $0,29 | 262K | 87,9 | 93,8 | 89,4 | 90,1 | 97 |
| 17 | MiMo V2.5 ≈ | Xiaomi | 90,68 89–92 | $0,14 | $0,28 | 1 050K | 93,4 | 84,3 | 92 | 92,3 | 90,6 |
| 18 | DeepSeek V4 Flash ≈ | DeepSeek | 89,89 88–92 | $0,14 | $0,28 | 1 049K | 90,5 | 90,9 | 88,6 | 91 | 87,7 |
| 19 | MiMo V2 Omni ≈ | Xiaomi | 89,72 87–92 | $0,14 | $0,28 | 262K | 92,5 | 86,7 | 88,8 | 90,9 | 88,7 |
| 20 | DeepSeek V3.2 ≈ | DeepSeek | 88,8 87–90 | $0,28 | $0,4 | 164K | 88,9 | 89,9 | 86,9 | 88,7 | 89,7 |
| 21 | GLM 4.6 ≈ | Zhipu AI / Z.ai | 88,79 87–91 | $0,29 | $1,14 | 205K | 89,1 | 89 | 86,7 | 90,2 | 88,9 |
| 22 | GLM 4.7 ≈ | Zhipu AI / Z.ai | 88,74 86–92 | $0,15 | $0,8 | 205K | 90,5 | 90,7 | 84 | 91 | 86,6 |
| 23 | Mistral Medium 3.5 ≈ | Mistral AI | 88,68 85–92 | $1,5 | $7,5 | 262K | 91,4 | 86,1 | 86,8 | 89,4 | 89,1 |
| 24 | Qwen3 235B A22B Instruct 2507 ≈ | Alibaba (Qwen) | 88,29 87–90 | $0,1 | $0,1 | 262K | 88,1 | 87,5 | 88,7 | 88,8 | 88,6 |
| 25 | Qwen3 VL 235B A22B Instruct ≈ | Alibaba (Qwen) | 87,49 84–91 | $0,4 | $1,6 | 262K | 87,1 | 86,1 | 89,1 | 88 | 87,2 |
| 26 | Kimi K2 Thinking Turbo ≈ | Moonshot AI (Kimi) | 87,4 86–89 | $1,15 | $8 | 262K | 89,9 | 83,7 | 87,5 | 87,4 | 88 |
| 27 | GLM 4.5 ≈ | Zhipu AI / Z.ai | 86,85 84–89 | $0,2 | $0,8 | 131K | 85,6 | 88,4 | 85,5 | 87,7 | 87,5 |
| 28 | Qwen3 Next 80B A3B Instruct ≈ | Alibaba (Qwen) | 86,56 84–89 | $0,15 | $1,2 | 262K | 87,3 | 85,6 | 82,1 | 87,6 | 91,2 |
| 29 | MiniMax M2.7 ≈ | MiniMax | 86,33 85–88 | $0,3 | $1,2 | 205K | 89,5 | 81,7 | 87,4 | 86,3 | 85,9 |
| 30 | Qwen3.5 122B-A10B ≈ | Alibaba (Qwen) | 86,29 84–88 | $0,4 | $3,2 | 262K | 86,2 | 85 | 86,7 | 86,1 | 87,9 |
| 31 | Qwen3 235B A22B Thinking-2507 ≈ | Alibaba (Qwen) | 85,68 82–90 | $0,1 | $0,1 | 262K | 83,5 | 85,2 | 91 | 84,8 | 84,2 |
| 32 | DeepSeek V3.2 Exp ≈ | DeepSeek | 85,29 82–89 | $0,22 | $0,33 | 164K | 85,6 | 86,2 | 80,3 | 88 | 86,8 |
| 33 | Qwen3.5 27B ≈ | Alibaba (Qwen) | 84,91 83–87 | $0,3 | $2,4 | 262K | 83,7 | 83,7 | 85 | 84,4 | 89 |
| 34 | MiMo V2 Flash ≈ | Xiaomi | 84,62 83–86 | $0,14 | $0,28 | 262K | 87,3 | 83 | 85,3 | 85,8 | 80 |
| 35 | Step 3.5 Flash ≈ | StepFun | 84,31 83–86 | $0,1 | $0,3 | 262K | 86,3 | 83,1 | 84,6 | 83,9 | 82,7 |
| 36 | DeepSeek R1 0528 ≈ | DeepSeek | 84,27 81–87 | $0,25 | $0,25 | 164K | 84,2 | 90,2 | 79,6 | 84,9 | 81,9 |
| 37 | DeepSeek V3.1 ≈ | DeepSeek | 83,52 80–87 | $0,2 | $0,7 | 164K | 81,5 | 85,6 | 80,7 | 84,7 | 86,2 |
| 38 | DeepSeek V3.1 Terminus ≈ | DeepSeek | 83,34 78–89 | $0,21 | $0,79 | 164K | 79,8 | 90,5 | — | 82,7 | 80,7 |
| 39 | Qwen3 VL 235B A22B Thinking ≈ | Alibaba (Qwen) | 82,83 79–87 | $0,4 | $4 | 262K | 84,4 | 78,1 | 84 | 83,1 | 84,6 |
| 40 | Qwen3.5 35B A3B ≈ | Alibaba (Qwen) | 81,3 79–83 | $0,25 | $2 | 262K | 80,3 | 81,4 | 81,5 | 81,5 | 82,3 |
| 41 | Qwen3 30B A3B Instruct 2507 ≈ | Alibaba (Qwen) | 80,1 78–83 | $0,05 | $0,19 | 262K | 82,1 | 78,7 | 78,4 | 80,9 | 79,8 |
| 42 | Kimi K2 0905 Preview ≈ | Moonshot AI (Kimi) | 77,96 74–82 | $0,6 | $2,5 | 262K | 78,3 | 80,4 | 73,7 | 77,6 | 80,4 |
| 43 | NVIDIA Nemotron 3 Super 120B A12B ≈ | NVIDIA | 77,87 74–82 | $0,15 | $0,65 | 262K | 79,6 | 73,8 | 79,6 | 78,8 | 76,9 |
| 44 | Nemotron 3 Super ≈ | NVIDIA | 77,87 74–82 | $0,2 | $0,8 | 1 000K | 79,6 | 73,8 | 79,6 | 78,8 | 76,9 |
| 45 | GLM 4.5 Air ≈ | Zhipu AI / Z.ai | 77,56 75–80 | $0,11 | $0,29 | 131K | 77,5 | 79,7 | 74,2 | 76,6 | 80,5 |
| 46 | Qwen3 Next 80B A3B Thinking ≈ | Alibaba (Qwen) | 75,71 72–79 | $0,15 | $1,2 | 262K | 76,5 | 74 | 74,1 | 74,9 | 79,9 |
| 47 | Qwen3 Coder 480B A35B ≈ | Alibaba (Qwen) | 75,52 73–78 | $1,5 | $7,5 | 262K | 81 | 78,4 | 68 | 75,3 | 72,8 |
| 48 | MiniMax M2.5 ≈ | MiniMax | 75,21 73–77 | $0,3 | $1,2 | 1 000K | 73,6 | 76,9 | 75,1 | 74,7 | 76,5 |
| 49 | GLM 4.6V ≈ | Zhipu AI / Z.ai | 75,18 70–80 | $0,14 | $0,42 | 131K | 76,6 | 74,5 | — | 74,1 | — |
| 50 | Qwen 3 235b A22B ≈ | Alibaba (Qwen) | 74,25 72–77 | $0,7 | $2,8 | 131K | 75,2 | 74 | 70,1 | 73,1 | 79,9 |
| 51 | GPT OSS 120B ≈ | OpenAI | 74,16 72–76 | $0,03 | $0,14 | 131K | 74,1 | 74,1 | 72 | 73,5 | 78,2 |
| 52 | DeepSeek Chat 0324 ≈ | DeepSeek | 74,08 72–76 | $0,2 | $0,6 | 164K | 71,5 | 80,3 | 70,8 | 73,9 | 74,7 |
| 53 | DeepSeek Reasoner ≈ | DeepSeek | 73,5 71–76 | $0,55 | $2,19 | 164K | 72,2 | 76,9 | 68 | 72,9 | 79,2 |
| 54 | Kimi K2 0711 ≈ | Moonshot AI (Kimi) | 73,34 71–76 | $0,6 | $2,5 | 131K | 73,5 | 76,7 | 69,7 | 73,7 | 73,1 |
| 55 | GLM 4.7 Flash ≈ | Zhipu AI / Z.ai | 73,07 70–76 | $0,04 | $0,3 | 203K | 74,6 | 73,9 | 72,7 | 72,3 | 70,8 |
| 56 | Nemotron 3 Nano 30B A3B ≈ | NVIDIA | 71,82 69–75 | $0,05 | $0,2 | 262K | 74 | 66,4 | 73,9 | 70,5 | 74,5 |
| 57 | Trinity Large Thinking ≈ | Arcee AI | 71,39 69–74 | $0,22 | $0,85 | 262K | 69,4 | 74,3 | 72,5 | 68,7 | 73 |
| 58 | Qwen3 32B ≈ | Alibaba (Qwen) | 71,16 66–77 | $0,7 | $2,8 | 131K | 69,2 | 68,9 | 72,8 | 67,1 | 80,6 |
| 59 | INTELLECT 3 ≈ | Prime Intellect | 71,14 66–76 | $0,2 | $1,1 | 128K | 71,5 | 73,7 | 64,6 | 70,4 | 76,8 |
| 60 | Trinity Large Preview ≈ | Arcee AI | 70,97 69–73 | — | — | 131K | 74,1 | 71,9 | 70,7 | 70,6 | 65,5 |
| 61 | MiniMax M2 ≈ | MiniMax | 70,48 66–75 | $0,3 | $1,2 | 205K | 72,6 | 72,2 | 65,1 | 72,4 | 69,2 |
| 62 | Llama 3.3 Nemotron Super 49B v1.5 ≈ | Meta AI | 69,28 63–75 | $0,05 | $0,25 | 131K | 68,9 | — | 64,7 | 66,6 | 79,6 |
| 63 | MiniMax M1 ≈ | MiniMax | 68,85 67–71 | $0,13 | $1,25 | 1 000K | 69,4 | 71,6 | 63,8 | 68,2 | 71,8 |
| 64 | GLM 4.5V ≈ | Zhipu AI / Z.ai | 68,29 63–74 | $0,29 | $0,86 | 128K | 67,3 | 66,1 | 71,7 | 67,6 | 69,2 |
| 65 | Mistral Small 3.2 ≈ | Mistral AI | 67,44 65–70 | $0,1 | $0,3 | 128K | 70,2 | 71,9 | 60 | 67,4 | 66,9 |
| 66 | Qwen: QwQ 32B ≈ | Alibaba (Qwen) | 66,03 64–68 | $0,18 | $0,2 | 131K | 64,1 | 65,7 | 65,6 | 65,3 | 71,2 |
| 67 | Gemma 3 27B ≈ | Google DeepMind | 65,46 64–67 | $0,03 | $0,11 | 131K | 61,5 | 76,1 | 61,4 | 68,2 | 59,6 |
| 68 | Qwen3 30B A3B ≈ | Alibaba (Qwen) | 64,98 63–67 | $0,09 | $0,2 | 131K | 64,9 | 64,8 | 63,6 | 62,8 | 70,1 |
| 69 | Llama 3.1 Nemotron Ultra 253B ≈ | Meta AI | 63,58 57–70 | $0,6 | $1,8 | 128K | 59,3 | 63,8 | — | 63 | 71,3 |
| 70 | DeepSeek V3 ≈ | DeepSeek | 63,51 61–66 | $0,27 | $1,1 | 164K | 62,1 | 71,2 | 61,9 | 62,2 | 59,5 |
| 71 | Command A ≈ | Cohere | 63,27 62–65 | $2,5 | $10 | 256K | 63,3 | 70 | 59,4 | 65,3 | 56,7 |
| 72 | Olmo 3 32B Think ≈ | Allen Institute for AI | 59,75 55–65 | $0,15 | $0,5 | 66K | 60,9 | 58,7 | 58,3 | 60 | 60,7 |
| 73 | Granite 4.1 8B ≈ | IBM | 59,74 54–65 | $0,05 | $0,1 | 131K | 59 | 57,9 | 63,1 | 58,4 | 60,8 |
| 74 | Gemma 3 12B IT ≈ | Google DeepMind | 59,13 53–65 | $0,05 | $0,1 | 131K | 52,6 | 73,6 | 50,8 | 61,6 | 58,6 |
| 75 | Llama 4 Maverick 17b 128e Instruct ≈ | Meta AI | 57,43 55–59 | $0,05 | $0,1 | 1 049K | 57,2 | 64,3 | 53,2 | 55,5 | 56,9 |
| 76 | GPT OSS 20B ≈ | OpenAI | 57,41 54–61 | $0,01 | $0,07 | 131K | 58,4 | 60,9 | 53,3 | 53,9 | 61,2 |
| 77 | Qwen2.5 72B Instruct ≈ | Alibaba (Qwen) | 54,35 53–56 | $1,4 | $5,6 | 131K | 55 | 60 | 50,3 | 53,1 | 52,7 |
| 78 | Gemma 3n E4b It ≈ | Google DeepMind | 53,79 51–56 | $0,02 | $0,04 | 33K | 49,9 | 66,4 | 50,4 | 56,1 | 45 |
| 79 | Llama 4 Scout 17B 16E Instruct ≈ | Meta AI | 53,77 51–56 | $0,05 | $0,1 | 10 000K | 53,6 | 60,2 | 49 | 52,4 | 53,6 |
| 80 | Llama 3.1 405B Instruct ≈ | Meta AI | 52,48 51–54 | $0,12 | $0,3 | 128K | 53,1 | 58,6 | 47,1 | 51,6 | 51,7 |
| 81 | Mistral Large 2407 ≈ | Mistral AI | 51,34 50–53 | $3 | $9 | 131K | 51,6 | 58,7 | 47,8 | 50 | 47,6 |
| 82 | Llama 3.1 Nemotron 70B Instruct ≈ | Meta AI | 51,13 47–55 | $0,6 | $0,6 | 128K | 50,5 | 53,1 | 49,7 | 52,2 | 49,9 |
| 83 | Llama 3.3 70B Instruct ≈ | Meta AI | 50,68 49–52 | $0,05 | $0,23 | 131K | 49,8 | 57,7 | 46,4 | 50,3 | 49,1 |
| 84 | Mistral Large ≈ | Mistral AI | 50,14 48–52 | $2 | $6 | 131K | 51,3 | 57,7 | 43,1 | 50,1 | 47,5 |
| 85 | Qwen2.5 Coder 32b Instruct ≈ | Alibaba (Qwen) | 49,15 45–53 | $0,06 | $0,2 | 128K | 51,4 | 53,4 | 45,5 | 48,9 | 45 |
| 86 | Gemma 3 4B IT ≈ | Google DeepMind | 48,9 43–55 | $0,04 | $0,08 | 131K | 41,5 | 65,8 | 46 | 49,1 | 42,2 |
| 87 | Llama 3.1 70B ≈ | Meta AI | 47,63 46–49 | $0,12 | $0,3 | 131K | 47,9 | 54,4 | 43,2 | 46,7 | 45,3 |
| 88 | Mistral: Mistral Small 3 ≈ | Mistral AI | 45,18 42–48 | $0,05 | $0,08 | 33K | 44,9 | 51,1 | 41,9 | 44,9 | 42,5 |
| 89 | Phi 4 ≈ | Microsoft | 43,77 41–46 | $0,06 | $0,14 | 128K | 41,7 | 49,8 | 42,1 | 41,9 | 43,8 |
| 90 | Google: Gemma 2 27B ≈ | Google DeepMind | 40,24 39–42 | $0,65 | $0,65 | 8K | 37,3 | 54,4 | 36,1 | 37,3 | 35,7 |
| 91 | Aya Expanse 32B ≈ | Cohere | 38,94 37–41 | — | — | 128K | 34,2 | 53,2 | 38,1 | 36,2 | 32,8 |
| 92 | Command R+ ≈ | Cohere | 37,35 34–41 | $2,5 | $10 | 128K | 32,1 | 53,2 | 36,5 | 34,5 | 29,9 |
| 93 | Ministral 8B (latest) ≈ | Mistral AI | 37,07 33–41 | $0,1 | $0,1 | 128K | 35,3 | 47,2 | 35,8 | 35,7 | 30 |
| 94 | Llama 3 70B Instruct ≈ | Meta AI | 36,38 35–38 | $0,12 | $0,3 | 8K | 36,3 | 40,5 | 31,8 | 36,5 | 37,1 |
| 95 | Llama 3.1 8B ≈ | Meta AI | 33,28 32–35 | $0,02 | $0,03 | 131K | 33,8 | 40,4 | 30,8 | 32,1 | 27,8 |
| 96 | Aya Expanse 8B ≈ | Cohere | 31,97 29–35 | — | — | 8K | 26,3 | 47,6 | 32,4 | 28 | 25,1 |
| 97 | Command R ≈ | Cohere | 30,89 28–34 | $0,15 | $0,6 | 128K | 28,3 | 43,3 | 29,6 | 29,8 | 21,9 |
| 98 | Phi-3-medium instruct (4k) ≈ | Microsoft | 25,57 23–28 | $0,17 | $0,68 | 4K | 19,7 | 37,9 | 23,9 | 21,6 | 26,4 |
| 99 | Meta: Llama 3 8B Instruct ≈ | Meta AI | 25,09 23–27 | $0,03 | $0,04 | 8K | 24,4 | 31,3 | 24,9 | 23 | 21,1 |
| 100 | Gemma 2 2b It | Google DeepMind | 21,11 19–23 | — | — | 128K | 15,8 | 32,9 | 21,6 | 18,5 | 17 |
Таблицу можно прокрутить вбок: колонки помещаются не все.
Колонки справа — слагаемые балла, приведённые к общей шкале 0–100 по фактическому разбросу среди измеренных моделей. Сложенные с указанными весами, они и дают число в основной колонке: по ним видно, на чём именно одна модель обошла другую. Прочерк означает «не измерено», а не ноль.
Цена — минимальная среди поставщиков модели, базовый тариф, без батчевых и льготных ставок. Вход и выход показаны раздельно намеренно: у большинства моделей выход дороже входа в несколько раз, и от того, чего в задаче больше, зависит итоговый счёт.
Знаком ≈ отмечены модели, у которых доверительный интервал пересекается с интервалом строки выше. Таких здесь 98 моделей — их порядок между собой по имеющимся данным не определён.
Доверительный интервал у половины моделей шире 4,8 пункта — это около 6 соседних строк таблицы. Внутри такой группы порядок задан не данными, а тем, кто в этот раз проголосовал; разницу между началом и концом списка данные выдерживают, соседство мест — нет.