Рейтинг ИИ

Лучшие нейросети для программирования

Сколько задач по программированию модель действительно решила на фиксированных наборах — проверяемый результат, а не мнение. У подборки есть второй взгляд, по слепым оценкам людей: порядок там другой, и расхождение между двумя списками само по себе говорит больше, чем каждый из них по отдельности.

Один вопрос, два способа на него ответить. Показатели меряют разное и в один балл не складываются.

41 модель в таблице
41 рассмотрено при расчёте
24 июля 2026 выпуск самой новой модели здесь
7 августа 2026 последний пересчёт

Здесь измерены не все модели. Из первой десятки вкладки «По оценкам людей» в этой таблице нет 3 — MiMo V2.5 Pro, Gemini 3.6 Flash, Muse Spark 1.1. Ни одной оценки на наборах заданий этой вкладки у них нет: пустое место означает «не измеряли», а не «выступила плохо». Самая новая модель, до которой набор дотянулся, вышла 24 июля 2026.

# Модель Разработчик Балл по задачам 0–100, с поправкой на охват Вход$ / 1M Выход$ / 1M Контексттокенов Aider Polyglot Terminal-Bench SWE-bench Verified GSO-Bench FrontierCode Наборовизмерено
1 Claude Opus 4.7 Anthropic 59,79 64,22 $5 $25 1 000K 90,2 83,5 44,1 38,5 5
2 Claude Opus 4.6 Anthropic 59,43 66,57 $5 $25 1 000K 79,8 78,7 41,2 3
3 GPT 5.4 2026-03-05 OpenAI 57,49 63,34 $2,5 $15 1 050K 81,8 76,9 31,4 3
4 Gemini 3.5 Flash Google DeepMind 56,64 64,57 $1,5 $9 1 049K 79,3 2
5 Claude Fable 5 Anthropic 55,96 63,2 $10 $50 1 000K 53,5 2
6 GLM 5 Zhipu AI / Z.ai 55,48 62,24 $0,48 $1,9 205K 52,4 72,1 2
7 Kimi K2.6 Moonshot AI (Kimi) 55,42 62,13 $0,22 $1,14 262K 76,7 2
8 Claude Opus 5 Anthropic 55,21 61,7 $5 $25 1 000K 53,4 2
9 Claude Sonnet 4.6 Anthropic 55,01 59,2 $3 $15 1 000K 53,4 75,2 3
10 o3 2025-04-16 OpenAI 53,98 56,61 $2 $8 200K 81,3 62,3 8,8 4
11 o1 2024-12-17 OpenAI 53,78 58,85 $15 $60 200K 61,7 2
12 GPT-5.6 Sol OpenAI 53,03 57,35 $5 $30 1 050K 47,5 2
13 Claude 4.5 Opus Anthropic 52,74 55,42 $5 $25 200K 63,1 76,7 26,5 3
14 GPT 5 2025-08-07 OpenAI 52,58 54,51 $1,25 $10 272K 88 49,6 73,6 6,9 4
15 Claude 4.1 Opus Anthropic 52,2 55,68 $15 $75 200K 38 73,4 2
16 Gemini 3 Pro Preview Google DeepMind 51,67 53,64 $2 $12 1 049K 69,4 72,9 18,6 3
17 Grok 4 xAI 51,06 53,4 $3 $15 256K 79,6 27,2 2
18 GLM 5.2 Zhipu AI / Z.ai 51,05 52,6 $0,42 $1,32 1 049K 78,7 24,5 3
19 Claude Opus 4.8 Anthropic 50,96 52,45 $5 $25 1 000K 47,1 46,5 3
20 Gemini 3.1 Pro Preview Google DeepMind 50,05 51,38 $2 $12 1 049K 80,2 22,6 2
21 Claude 4 Opus Anthropic 49,4 49,85 $15 $75 200K 72 70,7 6,9 3
22 Gemini 3 Flash Preview Google DeepMind 49,39 49,84 $0,5 $3 1 049K 64,3 75,4 9,8 3
23 Kimi K2.5 Moonshot AI (Kimi) 49,26 49,62 $0,35 $1,7 262K 43,2 73,8 3
24 GPT 5 Mini 2025-08-07 OpenAI 49,23 49,74 $0,25 $2 272K 34,8 64,7 2
25 DeepSeek V4 Pro DeepSeek 48,17 47,62 $0,44 $0,87 1 049K 77,6 17,6 2
26 GPT 4.1 2025-04-14 OpenAI 48,07 47,65 $2 $8 1 048K 52,4 48,5 3
27 Claude Sonnet 5 Anthropic 47,72 47,05 $2 $10 1 000K 37,3 42,7 3
28 o4 Mini 2025-04-16 OpenAI 47,01 45,87 $1,1 $4,4 200K 72 3,6 3
29 Gemini 2.5 Pro Google DeepMind 46,9 45,08 $1,25 $10 1 049K 32,6 57,6 2
30 Claude Sonnet 3.7 Anthropic 46,85 45,91 $3 $15 200K 64,9 61 3,8 4
31 Gemini 2.5 Pro Preview 0605 Google DeepMind 46,11 43,51 $1,13 $9 1 049K 83,1 3,9 2
32 Claude Sonnet 4.5 Anthropic 45,98 44,16 $3 $15 1 000K 46,5 71,3 14,7 3
33 o3 Mini 2025-01-31 OpenAI 42,63 38,57 $1,1 $4,4 200K 60,4 1,3 3
34 Claude 4 Sonnet Anthropic 40,91 33,1 $3 $15 1 000K 61,3 4,9 2
35 Claude 3.5 Sonnet 2024-10-22 Anthropic 40,33 34,73 $3 $15 200K 51,6 4,6 3
36 GPT OSS 120B OpenAI 39,48 30,25 $0,03 $0,14 131K 41,8 18,7 2
37 Claude 3.5 Haiku Anthropic 39,36 30 $0,25 $1,25 200K 28 2
38 Kimi K2 Instruct Moonshot AI (Kimi) 37,85 30,6 $0,1 $2 131K 59,1 27,8 4,9 3
39 GPT-4o (2024-08-06) OpenAI 36,63 24,55 $2,5 $10 128K 23,1 2
40 OpenAI GPT-4.1 Mini OpenAI 36,46 24,2 $0,4 $1,6 1 048K 32,4 2
41 GPT-4o (2024-11-20) OpenAI 29,32 16,4 $2,5 $10 128K 18,2 31 0 3

Таблицу можно прокрутить вбок: колонки помещаются не все.

Колонки справа — слагаемые балла, приведённые к общей шкале 0–100 по фактическому разбросу среди измеренных моделей. Сложенные с указанными весами, они и дают число в основной колонке: по ним видно, на чём именно одна модель обошла другую. Прочерк означает «не измерено», а не ноль. Показаны пять самых заполненных наборов задач из 7; остальные видны на карточке модели.

Что проверяет каждый набор задач
Aider Polyglot
правки кода на шести языках измерено моделей: 43
CadEval
построение CAD-моделей кодом измерено моделей: 13
CursorBench
правки в редакторе измерено моделей: 12
FrontierCode
патчи, пригодные к приёму в проект измерено моделей: 15
GSO-Bench
оптимизация кода измерено моделей: 24
SWE-bench Verified
исправление ошибок в репозиториях измерено моделей: 31
SWE-bench Verified, только через консоль
Terminal-Bench
работа в командной строке измерено моделей: 35

Колонка «наборов» — по скольким наборам задач посчитан балл этой модели. Чем их больше, тем надёжнее число: балл по двум наборам разбросан шире, чем по шести, и поправка на охват учитывает именно это.

Цена — минимальная среди поставщиков модели, базовый тариф, без батчевых и льготных ставок. Вход и выход показаны раздельно намеренно: у большинства моделей выход дороже входа в несколько раз, и от того, чего в задаче больше, зависит итоговый счёт.

Epoch AI — лицензия CC-BY · первоисточник
По данным Epoch AI