Как модели отвечают именно по-русски: оценка собрана из слепых сравнений, где люди выбирали лучший ответ на русском языке. Это подборка про язык, а не про способности — сильная в общем зачёте модель может уступить здесь той, что лучше держит русскую формулировку.
| # | Модель | Разработчик | Arena Score, русский язык | Вход$ / 1M | Выход$ / 1M | Контексттокенов |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 1 503,36 1 463–1 544 | $5 | $25 | 1 000K |
| 2 | Claude Fable 5 ≈ | Anthropic | 1 501,01 1 485–1 517 | $10 | $50 | 1 000K |
| 3 | Muse Spark 1.1 ≈ | Meta AI | 1 500,61 1 482–1 519 | $1,25 | $4,25 | 1 049K |
| 4 | Gemini 3.5 Flash ≈ | Google DeepMind | 1 499,47 1 480–1 519 | $1,5 | $9 | 1 049K |
| 5 | Claude Opus 4.6 ≈ | Anthropic | 1 498,93 1 491–1 507 | $5 | $25 | 1 000K |
| 6 | Gemini 3.1 Pro Preview ≈ | Google DeepMind | 1 495,77 1 488–1 503 | $2 | $12 | 1 049K |
| 7 | Gemini 3 Pro ≈ | Google DeepMind | 1 495,34 1 486–1 505 | $1,6 | $9,6 | 1 049K |
| 8 | Claude Opus 4.7 ≈ | Anthropic | 1 487,11 1 478–1 496 | $5 | $25 | 1 000K |
| 9 | Gemini 3 Flash ≈ | Google DeepMind | 1 479,27 1 469–1 490 | $0,4 | $2,4 | 1 049K |
| 10 | Gemini 3.6 Flash ≈ | Google DeepMind | 1 478,84 1 454–1 504 | $1,5 | $7,5 | 1 049K |
| 11 | Kimi K3 ≈ | Moonshot AI (Kimi) | 1 477,9 1 448–1 508 | $2 | $8 | 1 049K |
| 12 | Qwen3.7 Plus ≈ | Alibaba (Qwen) | 1 465,72 1 454–1 478 | $0,5 | $3 | 1 000K |
| 13 | Claude Opus 4.8 ≈ | Anthropic | 1 464,49 1 454–1 475 | $5 | $25 | 1 000K |
| 14 | GLM 5.1 ≈ | Zhipu AI / Z.ai | 1 463,32 1 453–1 474 | $0,06 | $0,22 | 205K |
| 15 | GPT-5.6 Terra ≈ | OpenAI | 1 461,69 1 442–1 482 | $2 | $12 | 1 050K |
| 16 | GLM 5.2 ≈ | Zhipu AI / Z.ai | 1 461,6 1 448–1 475 | $0,42 | $1,32 | 1 049K |
| 17 | Gemma 4 31B ≈ | Google DeepMind | 1 461,39 1 439–1 484 | $0,14 | $0,4 | 262K |
| 18 | GPT-5.6 Sol ≈ | OpenAI | 1 460,87 1 441–1 481 | $5 | $30 | 1 050K |
| 19 | Gemini 2.5 Pro ≈ | Google DeepMind | 1 460,7 1 454–1 467 | $1,25 | $10 | 1 049K |
| 20 | Grok 4.20 (Reasoning) ≈ | xAI | 1 460,08 1 452–1 468 | $2 | $6 | 2 000K |
| 21 | Grok 4.20 Multi Agent Beta 0309 ≈ | xAI | 1 458,59 1 450–1 467 | $2 | $6 | 2 000K |
| 22 | ERNIE 5.1 ≈ | Baidu (Ernie) | 1 458,35 1 448–1 468 | $0,75 | $3 | 119K |
| 23 | Grok 4.5 ≈ | xAI | 1 456,76 1 439–1 475 | $2 | $6 | 500K |
| 24 | Hy3 ≈ | Tencent (Hunyuan) | 1 452,01 1 419–1 485 | $0,13 | $0,53 | 262K |
| 25 | MiMo V2.5 Pro ≈ | Xiaomi | 1 449,66 1 440–1 459 | $0,44 | $0,87 | 1 050K |
| 26 | DeepSeek V4 Pro ≈ | DeepSeek | 1 449,49 1 440–1 459 | $0,44 | $0,87 | 1 049K |
| 27 | Seed 2.0 Pro ≈ | ByteDance (Doubao) | 1 448,04 1 440–1 456 | $0,5 | $3 | 131K |
| 28 | Claude 4.5 Opus ≈ | Anthropic | 1 446,81 1 439–1 454 | $5 | $25 | 200K |
| 29 | Kimi K2.6 ≈ | Moonshot AI (Kimi) | 1 445,15 1 435–1 455 | $0,22 | $1,14 | 262K |
| 30 | Qwen3.6 Max Preview ≈ | Alibaba (Qwen) | 1 444,75 1 419–1 471 | $1,3 | $7,8 | 262K |
| 31 | Gemma 4 26B-A4B ≈ | Google DeepMind | 1 444,27 1 423–1 465 | $0,05 | $0,29 | 262K |
| 32 | Gemini 3.5 Flash Lite ≈ | Google DeepMind | 1 440,42 1 416–1 464 | $0,3 | $2,5 | 1 049K |
| 33 | Claude Sonnet 5 ≈ | Anthropic | 1 439,58 1 424–1 455 | $2 | $10 | 1 000K |
| 34 | GPT-5.2 Chat ≈ | OpenAI | 1 439,57 1 429–1 450 | $1,75 | $14 | 128K |
| 35 | Claude Sonnet 4.6 ≈ | Anthropic | 1 438,4 1 430–1 447 | $3 | $15 | 1 000K |
| 36 | Kimi K2.5 Thinking TEE ≈ | Moonshot AI (Kimi) | 1 436,38 1 429–1 444 | $0,3 | $1,9 | 256K |
| 37 | GLM 5 ≈ | Zhipu AI / Z.ai | 1 435,63 1 425–1 447 | $0,48 | $1,9 | 205K |
| 38 | Qwen3.6 Plus ≈ | Alibaba (Qwen) | 1 435,31 1 426–1 445 | $0,5 | $3 | 1 000K |
| 39 | Claude Sonnet 4.5 ≈ | Anthropic | 1 435,09 1 428–1 442 | $3 | $15 | 1 000K |
| 40 | Inkling ≈ | Thinking Machines Lab | 1 434,87 1 414–1 456 | $1,87 | $4,68 | 1 049K |
| 41 | Qwen3.5 397B-A17B ≈ | Alibaba (Qwen) | 1 432,76 1 425–1 441 | $0,6 | $3,6 | 262K |
| 42 | GPT-5.5 Instant ≈ | OpenAI | 1 431,42 1 420–1 443 | $5 | $30 | 400K |
| 43 | MiniMax M3 ≈ | MiniMax | 1 430,47 1 419–1 441 | $0,3 | $1,2 | 1 049K |
| 44 | ChatGPT 4o Latest ≈ | OpenAI | 1 430,05 1 423–1 437 | $5 | $15 | 128K |
| 45 | DeepSeek V4 Flash ≈ | DeepSeek | 1 428,97 1 420–1 438 | $0,14 | $0,28 | 1 049K |
| 46 | GLM 4.7 ≈ | Zhipu AI / Z.ai | 1 427,75 1 412–1 443 | $0,15 | $0,8 | 205K |
| 47 | DeepSeek V3.1 Terminus ≈ | DeepSeek | 1 426,56 1 393–1 460 | $0,21 | $0,79 | 164K |
| 48 | Grok 4.1 ≈ | xAI | 1 426,26 1 418–1 434 | $2 | $10 | 200K |
| 49 | GLM 5V Turbo ≈ | Zhipu AI / Z.ai | 1 425,62 1 406–1 445 | $0,7 | $3,1 | 203K |
| 50 | DeepSeek R1 0528 ≈ | DeepSeek | 1 425,06 1 409–1 441 | $0,25 | $0,25 | 164K |
| 51 | MiMo V2 Pro ≈ | Xiaomi | 1 424,61 1 413–1 436 | $0,44 | $0,87 | 1 049K |
| 52 | DeepSeek V3.2 ≈ | DeepSeek | 1 423,66 1 415–1 432 | $0,28 | $0,4 | 164K |
| 53 | Claude 4.1 Opus ≈ | Anthropic | 1 422,37 1 414–1 430 | $15 | $75 | 200K |
| 54 | GPT-5.6 Luna ≈ | OpenAI | 1 421,72 1 402–1 442 | $0,2 | $1,2 | 1 050K |
| 55 | Qwen3 Max Preview ≈ | Alibaba (Qwen) | 1 421,16 1 406–1 437 | $1,2 | $6 | 256K |
| 56 | Gemini 3.1 Flash Lite Preview ≈ | Google DeepMind | 1 420,97 1 413–1 429 | $0,25 | $1,5 | 1 049K |
| 57 | Qwen3 Max 2025-09-23 ≈ | Alibaba (Qwen) | 1 419,24 1 396–1 443 | $0,86 | $3,43 | 258K |
| 58 | GLM 4.6 ≈ | Zhipu AI / Z.ai | 1 418,83 1 408–1 430 | $0,29 | $1,14 | 205K |
| 59 | GPT 4.5 Preview ≈ | OpenAI | 1 418,24 1 403–1 434 | $75 | $150 | 128K |
| 60 | Gemini 2.5 Flash ≈ | Google DeepMind | 1 417,41 1 411–1 423 | $0,3 | $2,5 | 1 049K |
| 61 | GLM 4.5 ≈ | Zhipu AI / Z.ai | 1 415,53 1 399–1 432 | $0,2 | $0,8 | 131K |
| 62 | Mistral Medium 3.1 ≈ | Mistral AI | 1 413,13 1 406–1 420 | $0,4 | $2 | 262K |
| 63 | Grok 4 ≈ | xAI | 1 412,96 1 401–1 425 | $3 | $15 | 256K |
| 64 | Mistral Large 3 ≈ | Mistral AI | 1 411,63 1 403–1 420 | $0,5 | $1,5 | 256K |
| 65 | Qwen3 235B A22B Instruct 2507 ≈ | Alibaba (Qwen) | 1 410,72 1 404–1 417 | $0,1 | $0,1 | 262K |
| 66 | o3 2025-04-16 ≈ | OpenAI | 1 408,32 1 399–1 418 | $2 | $8 | 200K |
| 67 | Grok 4.3 ≈ | xAI | 1 406,98 1 398–1 416 | $1,25 | $2,5 | 1 000K |
| 68 | MiMo V2 Omni ≈ | Xiaomi | 1 406,4 1 393–1 420 | $0,14 | $0,28 | 262K |
| 69 | GPT 5 Chat ≈ | OpenAI | 1 404,07 1 390–1 419 | $1,25 | $10 | 128K |
| 70 | DeepSeek V3.2 Exp ≈ | DeepSeek | 1 403,49 1 384–1 423 | $0,22 | $0,33 | 164K |
| 71 | Qwen3 VL 235B A22B Instruct ≈ | Alibaba (Qwen) | 1 403,14 1 381–1 426 | $0,4 | $1,6 | 262K |
| 72 | Mistral Medium 3.5 ≈ | Mistral AI | 1 403,05 1 385–1 421 | $1,5 | $7,5 | 262K |
| 73 | GPT-5.3 Chat (latest) ≈ | OpenAI | 1 401,88 1 391–1 412 | $1,75 | $14 | 128K |
| 74 | DeepSeek V3.1 ≈ | DeepSeek | 1 400,62 1 380–1 421 | $0,2 | $0,7 | 164K |
| 75 | Qwen3 Next 80B A3B Instruct ≈ | Alibaba (Qwen) | 1 400,45 1 384–1 417 | $0,15 | $1,2 | 262K |
| 76 | 2025) ≈ | Google DeepMind | 1 398,71 1 387–1 411 | $0,3 | $2,5 | 1 049K |
| 77 | Qwen3 235B A22B Thinking-2507 ≈ | Alibaba (Qwen) | 1 398,06 1 372–1 425 | $0,1 | $0,1 | 262K |
| 78 | Qwen3.5 122B-A10B ≈ | Alibaba (Qwen) | 1 397 1 386–1 408 | $0,4 | $3,2 | 262K |
| 79 | MiMo V2.5 ≈ | Xiaomi | 1 393,51 1 384–1 403 | $0,14 | $0,28 | 1 050K |
| 80 | Grok 4 Fast Reasoning ≈ | xAI | 1 390,48 1 373–1 408 | $0,2 | $0,5 | 2 000K |
| 81 | Qwen3.5 27B ≈ | Alibaba (Qwen) | 1 390,39 1 379–1 402 | $0,3 | $2,4 | 262K |
| 82 | Kimi K2 Thinking Turbo ≈ | Moonshot AI (Kimi) | 1 390,37 1 383–1 398 | $1,15 | $8 | 262K |
| 83 | Longcat Flash Chat ≈ | Meituan | 1 387,66 1 366–1 409 | — | — | 131K |
| 84 | Step 3.5 Flash ≈ | StepFun | 1 387,15 1 379–1 395 | $0,1 | $0,3 | 262K |
| 85 | MiMo V2 Flash ≈ | Xiaomi | 1 386,22 1 378–1 395 | $0,14 | $0,28 | 262K |
| 86 | Hunyuan T1 ≈ | Tencent (Hunyuan) | 1 385,95 1 352–1 420 | — | — | 131K |
| 87 | Grok 4.1 Fast Reasoning ≈ | xAI | 1 383,93 1 376–1 392 | $0,2 | $0,5 | 2 000K |
| 88 | Qwen3.5 Flash ≈ | Alibaba (Qwen) | 1 383,64 1 375–1 392 | $0,09 | $0,36 | 1 000K |
| 89 | Claude 4 Opus ≈ | Anthropic | 1 380,6 1 369–1 392 | $15 | $75 | 200K |
| 90 | MiniMax M2.7 ≈ | MiniMax | 1 379,45 1 371–1 388 | $0,3 | $1,2 | 205K |
| 91 | Qwen3.5 35B A3B ≈ | Alibaba (Qwen) | 1 377,81 1 367–1 389 | $0,25 | $2 | 262K |
| 92 | Claude Haiku 4.5 ≈ | Anthropic | 1 376,88 1 370–1 383 | $1 | $5 | 200K |
| 93 | GPT 4.1 2025-04-14 ≈ | OpenAI | 1 373,25 1 363–1 384 | $2 | $8 | 1 048K |
| 94 | Kimi K2 0905 Preview ≈ | Moonshot AI (Kimi) | 1 372,56 1 351–1 394 | $0,6 | $2,5 | 262K |
| 95 | MiMo V2 Flash (Thinking) ≈ | Xiaomi | 1 372,25 1 356–1 388 | $0,1 | $0,31 | 256K |
| 96 | DeepSeek Chat 0324 ≈ | DeepSeek | 1 371,71 1 361–1 382 | $0,2 | $0,6 | 164K |
| 97 | Hunyuan TurboS ≈ | Tencent (Hunyuan) | 1 371,05 1 353–1 389 | — | — | 131K |
| 98 | GLM 4.5 Air ≈ | Zhipu AI / Z.ai | 1 368,75 1 354–1 383 | $0,11 | $0,29 | 131K |
| 99 | Gemini 2.5 Flash Lite Preview ≈ | Google DeepMind | 1 367,5 1 354–1 381 | $0,1 | $0,4 | 1 049K |
| 100 | Qwen3 30B A3B Instruct 2507 ≈ | Alibaba (Qwen) | 1 363,27 1 347–1 379 | $0,05 | $0,19 | 262K |
Таблицу можно прокрутить вбок: колонки помещаются не все.
Цена — минимальная среди поставщиков модели, базовый тариф, без батчевых и льготных ставок. Вход и выход показаны раздельно намеренно: у большинства моделей выход дороже входа в несколько раз, и от того, чего в задаче больше, зависит итоговый счёт.
Знаком ≈ отмечены модели, у которых доверительный интервал пересекается с интервалом строки выше. Таких здесь 99 моделей — их порядок между собой по имеющимся данным не определён.
Доверительный интервал у половины моделей шире 22,3 пункта — это около 16 соседних строк таблицы. Внутри такой группы порядок задан не данными, а тем, кто в этот раз проголосовал; разницу между началом и концом списка данные выдерживают, соседство мест — нет. Голосов на модель здесь — медиана 2 814: чем их меньше, тем шире интервал.
Arena (LMArena)
— лицензия CC-BY-4.0 · первоисточник
По данным Arena (LMArena)