OpenAI

o3 2025-04-16

Тип
языковая модель
Контекст
200K токенов
Максимум на выходе
100K
Строка для API
azure/o3-2025-04-16

Поставщик объявил модель устаревшей. Она ещё отвечает, но новых проектов на ней лучше не начинать.

Цены по поставщикам

Поставщик Вход, $ за 1M Выход, $ за 1M В наших данных с
Microsoft Foundry azure/o3-2025-04-16 $2 $8 31 июл 2026
OpenAI $2 $8 31 июл 2026
Microsoft Foundry azure/us/o3-2025-04-16 $2,2 $8,8 31 июл 2026

Показан только базовый тариф и только потокенные цены. Батчевые, льготные и кэшированные ставки, а также цены за изображение или секунду видео в эту таблицу не идут: их нельзя ставить в одну колонку с ценой за миллион токенов.

Один поставщик встречается несколько раз, если продаёт эту модель под разными идентификаторами и по разной цене — например, в разной точности весов. Идентификатор указан рядом с названием. Одинаковые предложения, пришедшие из двух источников под разными написаниями, сведены в одну строку.

Дата в последней колонке — день, когда эта цена впервые попала в наш сбор. Цена может быть и старше: до этого дня мы её просто не записывали. Меняться она с тех пор не меняла — иначе на её месте стояла бы новая строка с новой датой.

Результаты замеров

Набор задач Результат Условия прогона Кто измерил
Arena Score на французском языке 1 445,04 1 422–1 468
Arena Score, математика 1 424,48 1 415–1 434
Arena Score на английском языке 1 414,47 1 410–1 419
Arena Score, общий зачёт 1 409,5 1 406–1 413
Arena Score на русском языке 1 408,32 1 399–1 418
Arena Score, программирование 1 408,19 1 402–1 414
Arena Score, многоходовый диалог 1 404,93 1 398–1 412
Arena Score, сложные запросы 1 401,88 1 397–1 407
Arena Score, экспертные вопросы 1 400,18 1 389–1 412
Arena Score на испанском языке 1 384,08 1 365–1 403
Arena Score, длинные запросы 1 370,54 1 364–1 377
Arena Score, следование инструкции 1 367,67 1 362–1 373
Arena Score, творческий текст 1 359,4 1 352–1 367
Arena Score, понимание схем 1 218,28 1 206–1 230
Arena Score, распознавание текста на изображении 1 218,19 1 210–1 226
Arena Score, работа с изображениями 1 215,41 1 209–1 222
MATH, пятый уровень сложности 97,77 % усилие: high · с подобранной обвязкой Epoch evaluations
Fiction.LiveBench — удержание длинного контекста 88,9 % усилие: medium Fiction.live leaderboard
Творческое письмо (оценка Lech Mazur) 83,9 % усилие: medium lechmazur/writing Github repository
Mock AIME 2024–2025 — олимпиадные задачи 83,87 % усилие: low · с подобранной обвязкой Epoch evaluations
Aider Polyglot — правки кода на шести языках 81,3 % усилие: medium · с подобранной обвязкой Aider LLM Leaderboards
GPQA Diamond — вопросы уровня аспирантуры 75,76 % усилие: low · с подобранной обвязкой Epoch evaluations
CadEval — построение CAD-моделей кодом 74 % усилие: medium CadEval Dashboard
GeoBench — определение места по фотографии 74 % усилие: high GeoBench leaderboard
SWE-bench Verified — исправление ошибок в репозиториях 62,32 % усилие: medium · с подобранной обвязкой Epoch evaluations
ARC-AGI — обобщение на новых закономерностях 60,8 % усилие: high · с подобранной обвязкой ARC Prize Leaderboard
SimpleQA Verified — фактическая точность 53 % усилие: high Epoch evaluations
WeirdML — необычные задачи машинного обучения 52,42 % усилие: high WeirdML Leaderboard
DeepResearch Bench — глубокий поиск 46,6 % усилие: medium DeepResearchBench Leaderboard
SimpleBench — вопросы с подвохом 43,72 % усилие: high SimpleBench Leaderboard
GDPval — задачи реальных профессий 30,8 % усилие: medium
Шахматные задачи 23,19 % усилие: low Epoch evaluations
OSWorld — работа в операционной системе, первая версия 23 % усилие: medium · с подобранной обвязкой OS World Website
APEX-Agents 17,2 % усилие: high
Humanity’s Last Exam — экспертные вопросы 16,3 % усилие: high
GSO-Bench — оптимизация кода 8,8 % усилие: high GSO Leaderboard
ARC-AGI-2 6,53 % усилие: high
CritPt — задачи по физике 1,4 % усилие: high