Лучшие нейросети
Сводный балл
-
1
Claude Opus 5
99,55
-
2
Claude Opus 4.6
98,43
-
3
Claude Fable 5
97,79
Общий зачёт: пять способностей сведены в один балл, чтобы модели можно было сравнить целиком, а не по одной задаче. Считается по слепым сравнениям живых людей, то есть отвечает на вопрос, чей ответ чаще предпочитают, а не сколько задач решено. Если нужен один конкретный навык, точнее смотреть отдельную подборку.
из 236 моделей
99 без значимой разницы
Нейросети для программирования
Балл по задачам
-
1
Claude Opus 4.7
59,79
-
2
Claude Opus 4.6
59,43
-
3
GPT 5.4 2026-03-05
57,49
Сколько задач по программированию модель действительно решила на фиксированных наборах — проверяемый результат, а не мнение. У подборки есть второй взгляд, по слепым оценкам людей: порядок там другой, и расхождение между двумя списками само по себе говорит больше, чем каждый из них по отдельности.
из 41 модели
Нейросети для логики
Балл по задачам
-
1
GPT-5.6 Sol
71,53
-
2
Claude Opus 5
65,91
-
3
Gemini 3.1 Pro Preview
64,89
Задачи на рассуждение, где ответ либо верный, либо нет: считается доля решённых, а не понравившихся. Рядом есть второй взгляд — по слепым оценкам людей. Логика как раз тот случай, где предпочтение и решённая задача расходятся сильнее всего: складно изложенное рассуждение нравится людям и при неверном ответе.
из 91 модели
Нейросети по знаниям
Балл по задачам
-
1
Gemini 3 Flash Preview
55,84
-
2
Qwen3.6 Max Preview
55,18
-
3
GPT-5.6 Sol
54,72
Проверка фактических знаний вопросами, у которых есть однозначный правильный ответ. От соседних подборок отличается тем, что здесь модель не рассуждает и не пишет код, а вспоминает. Второй взгляд на ту же тему — по слепым оценкам людей.
из 79 моделей
Нейросети для математики
Балл по задачам
-
1
Claude Fable 5
74,77
-
2
GPT-5.6 Sol
72,1
-
3
Claude Opus 5
71,39
Доля решённых математических задач, от олимпиадных до исследовательских. Проценты здесь ниже, чем в других разделах, и это свойство задач, а не моделей: сравнивать их с процентами из подборки по знаниям бессмысленно. Второй взгляд — по слепым оценкам людей.
из 88 моделей
Нейросети для агентских задач
Балл по задачам
-
1
Claude Opus 4.6
40,67
-
2
Claude 4.5 Opus
40,11
-
3
Claude Sonnet 4.5
39,89
Здесь модель не отвечает на вопрос, а выполняет работу: правит файлы в операционной системе, ведёт поиск, проходит задачи из рабочей среды. Поэтому проценты низкие даже у сильных моделей, и сопоставлять их с баллами из подборки по знаниям нельзя — это разная работа, а не разная сила.
из 32 моделей
Нейросети для русского языка
Arena Score, русский язык
-
1
Claude Opus 5
1 503,36
-
2
Claude Fable 5
1 501,01
-
3
Muse Spark 1.1
1 500,61
Как модели отвечают именно по-русски: оценка собрана из слепых сравнений, где люди выбирали лучший ответ на русском языке. Это подборка про язык, а не про способности — сильная в общем зачёте модель может уступить здесь той, что лучше держит русскую формулировку.
из 231 модели
99 без значимой разницы
Нейросети для английского языка
Arena Score, английский язык
-
1
Claude Opus 4.6
1 505,8
-
2
Claude Opus 5
1 500,16
-
3
Claude Fable 5
1 498,82
То же слепое сравнение ответов, но на английском языке. Полезнее всего рядом с русским срезом: разрыв между двумя местами одной модели показывает, сколько она теряет за пределами языка, на котором её учили больше всего.
из 233 моделей
99 без значимой разницы
Нейросети для французского языка
Arena Score, французский язык
-
1
Claude Opus 5
1 522,24
-
2
Claude Fable 5
1 519,66
-
3
GPT-5.6 Terra
1 503,02
Слепое сравнение ответов на французском языке. Отдельная подборка нужна потому, что порядок моделей заметно меняется от языка к языку: модель, обученная преимущественно на английском, на французском отвечает ровнее, чем на русском, и общий зачёт этой разницы не показывает.
из 185 моделей
99 без значимой разницы
Нейросети для испанского языка
Arena Score, испанский язык
-
1
Claude Opus 4.6
1 511,71
-
2
Claude Fable 5
1 504,09
-
3
Gemini 3.1 Pro Preview
1 479,93
Слепое сравнение ответов на испанском языке. Как и у остальных языковых срезов, интереснее не сам балл, а место модели относительно её же позиции в других языках: устойчивость от языка к языку говорит о модели больше, чем одна высокая строчка.
из 184 моделей
99 без значимой разницы
Самые дешёвые нейросети
Цена, $ за 1M токенов
-
1
Llama 3.2 1b Instruct
0,01
-
2
Ling 2.6 Flash
0,02
-
3
Google Gemma 2
0,02
Цена доступа по API за миллион токенов, в долларах, по самому дешёвому предложению среди поставщиков. Вход и выход сведены в одно число: выход обычно дороже в несколько раз, и сравнивать модели по одной входной цене — значит ставить наверх не самую дешёвую.
из 1508 моделей
Нейросети с большим контекстом
Контекст, токенов
-
1
Qwen Long 10M
10 000 000
-
2
Llama 4 Scout 17B 16E Instruct
10 000 000
-
3
Llama 4 Scout 17B 128e Instruct
10 000 000
Сколько текста модель принимает за один запрос. Число заявлено разработчиком и проверке у нас пока не поддаётся: на длинном окне качество обычно падает задолго до предела. Поэтому подборка отвечает на вопрос «влезет ли», а не «поймёт ли».
из 1666 моделей
Мультимодальные нейросети
Arena Score, изображения
-
1
Claude Fable 5
1 334,18
-
2
Claude Opus 5
1 328,68
-
3
Gemini 3.6 Flash
1 315,75
Насколько модель понимает изображение вместе с текстом: слепое сравнение ответов на запросы, где к вопросу приложена картинка. Не путать с генерацией изображений — там модель рисует, здесь смотрит.
из 90 моделей
84 без значимой разницы
Нейросети для генерации картинок
Arena Score, генерация
-
1
GPT Image 2
1 384,81
-
2
Mai Image 2.5
1 256,56
-
3
Nano Banana 2 Lite
1 249,66
Слепое сравнение готовых изображений: люди выбирают лучшую картинку, не зная, какая модель её нарисовала. Это оценка результата на глаз, а не проверка по заданию, поэтому у соседних мест разница чаще всего статистически незначима.
из 33 моделей
19 без значимой разницы
Нейросети для генерации видео
Arena Score, видео
-
1
Sora 2 Pro
1 365,62
-
2
Sora 2
1 337,11
-
3
Seedance v1.5 Pro
1 256,99
То же слепое сравнение, что и у картинок, но для видео. Моделей здесь на порядок меньше, чем в текстовых подборках, и первые места отделены от остальных заметнее — просто потому, что участников мало.
из 7 моделей
2 без значимой разницы
Нейросети для веб-разработки
Arena Score, веб
-
1
Claude Opus 5
1 704,67
-
2
Kimi K3
1 675,56
-
3
Claude Fable 5
1 630,02
Запросы про вёрстку и веб-приложения, оценённые людьми вслепую. От подборки по программированию отличается мерой: там считаются решённые задачи, здесь — чей результат предпочли. Для веба это ближе к делу, потому что оценивают в том числе то, как получилось на вид.
из 77 моделей
70 без значимой разницы
Нейросети для текстов
Arena Score, текст
-
1
Claude Opus 5
1 510,88
-
2
Claude Fable 5
1 498,96
-
3
Gemini 3 Pro
1 481,7
Художественные и свободные тексты, оценённые людьми вслепую: у такой работы нет правильного ответа, поэтому предпочтение здесь — самая честная из доступных мер. Есть и второй взгляд, по прогону заданий с проверкой; он меряет другое и даёт другой порядок.
из 236 моделей
99 без значимой разницы
Лучшие открытые нейросети
Сводный балл
-
1
Kimi K3
99,62
-
2
MiMo V2.5 Pro
98,85
-
3
GLM 5.1
97,9
Тот же сводный балл, что и в общем зачёте, но только среди моделей с открытыми весами — тех, что можно скачать и запустить на своём железе. Подборка показывает, насколько открытые модели отстают от закрытых и в каких задачах не отстают вовсе.
из 107 моделей
98 без значимой разницы