Ресурсы

Рейтинг нейросетей

Модели ИИ, цены их поставщиков и рейтинги по независимым замерам. Под каждой таблицей написано, откуда взято число, кто его измерил, когда и насколько ему можно верить.

2219моделей
144разработчиков
257поставщиков API
9источников данных

Последний пересчёт: 7 августа 2026

Лучшие нейросети

Сводный балл

  1. 1 Claude Opus 5 99,55
  2. 2 Claude Opus 4.6 98,43
  3. 3 Claude Fable 5 97,79

Общий зачёт: пять способностей сведены в один балл, чтобы модели можно было сравнить целиком, а не по одной задаче. Считается по слепым сравнениям живых людей, то есть отвечает на вопрос, чей ответ чаще предпочитают, а не сколько задач решено. Если нужен один конкретный навык, точнее смотреть отдельную подборку.

из 236 моделей 99 без значимой разницы

Нейросети для программирования

Балл по задачам

  1. 1 Claude Opus 4.7 59,79
  2. 2 Claude Opus 4.6 59,43
  3. 3 GPT 5.4 2026-03-05 57,49

Сколько задач по программированию модель действительно решила на фиксированных наборах — проверяемый результат, а не мнение. У подборки есть второй взгляд, по слепым оценкам людей: порядок там другой, и расхождение между двумя списками само по себе говорит больше, чем каждый из них по отдельности.

из 41 модели

Нейросети для логики

Балл по задачам

  1. 1 GPT-5.6 Sol 71,53
  2. 2 Claude Opus 5 65,91
  3. 3 Gemini 3.1 Pro Preview 64,89

Задачи на рассуждение, где ответ либо верный, либо нет: считается доля решённых, а не понравившихся. Рядом есть второй взгляд — по слепым оценкам людей. Логика как раз тот случай, где предпочтение и решённая задача расходятся сильнее всего: складно изложенное рассуждение нравится людям и при неверном ответе.

из 91 модели

Нейросети по знаниям

Балл по задачам

  1. 1 Gemini 3 Flash Preview 55,84
  2. 2 Qwen3.6 Max Preview 55,18
  3. 3 GPT-5.6 Sol 54,72

Проверка фактических знаний вопросами, у которых есть однозначный правильный ответ. От соседних подборок отличается тем, что здесь модель не рассуждает и не пишет код, а вспоминает. Второй взгляд на ту же тему — по слепым оценкам людей.

из 79 моделей

Нейросети для математики

Балл по задачам

  1. 1 Claude Fable 5 74,77
  2. 2 GPT-5.6 Sol 72,1
  3. 3 Claude Opus 5 71,39

Доля решённых математических задач, от олимпиадных до исследовательских. Проценты здесь ниже, чем в других разделах, и это свойство задач, а не моделей: сравнивать их с процентами из подборки по знаниям бессмысленно. Второй взгляд — по слепым оценкам людей.

из 88 моделей

Нейросети для агентских задач

Балл по задачам

  1. 1 Claude Opus 4.6 40,67
  2. 2 Claude 4.5 Opus 40,11
  3. 3 Claude Sonnet 4.5 39,89

Здесь модель не отвечает на вопрос, а выполняет работу: правит файлы в операционной системе, ведёт поиск, проходит задачи из рабочей среды. Поэтому проценты низкие даже у сильных моделей, и сопоставлять их с баллами из подборки по знаниям нельзя — это разная работа, а не разная сила.

из 32 моделей

Нейросети для русского языка

Arena Score, русский язык

  1. 1 Claude Opus 5 1 503,36
  2. 2 Claude Fable 5 1 501,01
  3. 3 Muse Spark 1.1 1 500,61

Как модели отвечают именно по-русски: оценка собрана из слепых сравнений, где люди выбирали лучший ответ на русском языке. Это подборка про язык, а не про способности — сильная в общем зачёте модель может уступить здесь той, что лучше держит русскую формулировку.

из 231 модели 99 без значимой разницы

Нейросети для английского языка

Arena Score, английский язык

  1. 1 Claude Opus 4.6 1 505,8
  2. 2 Claude Opus 5 1 500,16
  3. 3 Claude Fable 5 1 498,82

То же слепое сравнение ответов, но на английском языке. Полезнее всего рядом с русским срезом: разрыв между двумя местами одной модели показывает, сколько она теряет за пределами языка, на котором её учили больше всего.

из 233 моделей 99 без значимой разницы

Нейросети для французского языка

Arena Score, французский язык

  1. 1 Claude Opus 5 1 522,24
  2. 2 Claude Fable 5 1 519,66
  3. 3 GPT-5.6 Terra 1 503,02

Слепое сравнение ответов на французском языке. Отдельная подборка нужна потому, что порядок моделей заметно меняется от языка к языку: модель, обученная преимущественно на английском, на французском отвечает ровнее, чем на русском, и общий зачёт этой разницы не показывает.

из 185 моделей 99 без значимой разницы

Нейросети для испанского языка

Arena Score, испанский язык

  1. 1 Claude Opus 4.6 1 511,71
  2. 2 Claude Fable 5 1 504,09
  3. 3 Gemini 3.1 Pro Preview 1 479,93

Слепое сравнение ответов на испанском языке. Как и у остальных языковых срезов, интереснее не сам балл, а место модели относительно её же позиции в других языках: устойчивость от языка к языку говорит о модели больше, чем одна высокая строчка.

из 184 моделей 99 без значимой разницы

Самые дешёвые нейросети

Цена, $ за 1M токенов

  1. 1 Llama 3.2 1b Instruct 0,01
  2. 2 Ling 2.6 Flash 0,02
  3. 3 Google Gemma 2 0,02

Цена доступа по API за миллион токенов, в долларах, по самому дешёвому предложению среди поставщиков. Вход и выход сведены в одно число: выход обычно дороже в несколько раз, и сравнивать модели по одной входной цене — значит ставить наверх не самую дешёвую.

из 1508 моделей

Нейросети с большим контекстом

Контекст, токенов

  1. 1 Qwen Long 10M 10 000 000
  2. 2 Llama 4 Scout 17B 16E Instruct 10 000 000
  3. 3 Llama 4 Scout 17B 128e Instruct 10 000 000

Сколько текста модель принимает за один запрос. Число заявлено разработчиком и проверке у нас пока не поддаётся: на длинном окне качество обычно падает задолго до предела. Поэтому подборка отвечает на вопрос «влезет ли», а не «поймёт ли».

из 1666 моделей

Мультимодальные нейросети

Arena Score, изображения

  1. 1 Claude Fable 5 1 334,18
  2. 2 Claude Opus 5 1 328,68
  3. 3 Gemini 3.6 Flash 1 315,75

Насколько модель понимает изображение вместе с текстом: слепое сравнение ответов на запросы, где к вопросу приложена картинка. Не путать с генерацией изображений — там модель рисует, здесь смотрит.

из 90 моделей 84 без значимой разницы

Нейросети для генерации картинок

Arena Score, генерация

  1. 1 GPT Image 2 1 384,81
  2. 2 Mai Image 2.5 1 256,56
  3. 3 Nano Banana 2 Lite 1 249,66

Слепое сравнение готовых изображений: люди выбирают лучшую картинку, не зная, какая модель её нарисовала. Это оценка результата на глаз, а не проверка по заданию, поэтому у соседних мест разница чаще всего статистически незначима.

из 33 моделей 19 без значимой разницы

Нейросети для генерации видео

Arena Score, видео

  1. 1 Sora 2 Pro 1 365,62
  2. 2 Sora 2 1 337,11
  3. 3 Seedance v1.5 Pro 1 256,99

То же слепое сравнение, что и у картинок, но для видео. Моделей здесь на порядок меньше, чем в текстовых подборках, и первые места отделены от остальных заметнее — просто потому, что участников мало.

из 7 моделей 2 без значимой разницы

Нейросети для веб-разработки

Arena Score, веб

  1. 1 Claude Opus 5 1 704,67
  2. 2 Kimi K3 1 675,56
  3. 3 Claude Fable 5 1 630,02

Запросы про вёрстку и веб-приложения, оценённые людьми вслепую. От подборки по программированию отличается мерой: там считаются решённые задачи, здесь — чей результат предпочли. Для веба это ближе к делу, потому что оценивают в том числе то, как получилось на вид.

из 77 моделей 70 без значимой разницы

Нейросети для текстов

Arena Score, текст

  1. 1 Claude Opus 5 1 510,88
  2. 2 Claude Fable 5 1 498,96
  3. 3 Gemini 3 Pro 1 481,7

Художественные и свободные тексты, оценённые людьми вслепую: у такой работы нет правильного ответа, поэтому предпочтение здесь — самая честная из доступных мер. Есть и второй взгляд, по прогону заданий с проверкой; он меряет другое и даёт другой порядок.

из 236 моделей 99 без значимой разницы

Лучшие открытые нейросети

Сводный балл

  1. 1 Kimi K3 99,62
  2. 2 MiMo V2.5 Pro 98,85
  3. 3 GLM 5.1 97,9

Тот же сводный балл, что и в общем зачёте, но только среди моделей с открытыми весами — тех, что можно скачать и запустить на своём железе. Подборка показывает, насколько открытые модели отстают от закрытых и в каких задачах не отстают вовсе.

из 107 моделей 98 без значимой разницы

Источники данных

Каталог, цены и оценки собираются из открытых источников; право на перепечатку проверяется по лицензии до того, как число попадёт на сайт. Под каждой таблицей указано, кто измерил показанное в ней и когда. Числа, которые публиковать нельзя, мы используем только для сверки и на сайте не показываем.