Opus 5.5, GPT-6 и DeepSeek: как сравнивать цены и скорость
Осенью 2026 года вышли Claude Fable 5.1, GPT-6 Astra, Grok 4.7 и DeepSeek V4. Разбираем, как сравнивать модели по цене решённой задачи, а не по прейскуранту за токен.
- Claude Opus 5.5 возглавил индекс Artificial Analysis с 58 баллами из 224 моделей
- Самая дорогая задача — у Sonnet 5.5: $7,67 на максимальном уровне рассуждения
- GPT-6.1 Sol показал лучшее соотношение цены и качества: 52 балла за 72 цента за задачу

Осень 2026 года выдалась плотной на релизы. 1 сентября Anthropic выпустила Claude Fable 5.1, 3 сентября OpenAI показала GPT-6 Astra, следом отчитались остальные — xAI с Grok 4.7 и DeepSeek с V4. Разбираться в этом потоке приходится по цифрам, а цифры бывают трёх сортов, и мешать их нельзя.
Три источника цифр
Таблицы компаний рисуются в свою пользу: выбор тестов, уровень рассуждения и собственная обвязка настраиваются под нужный результат. Один и тот же тест в разных обвязках даёт разные числа — Terminal-Bench 4.0 для Grok 4.7 показывает 37,6% у xAI и 33% у Artificial Analysis. По таблицам производителей можно сравнивать только грубо.
Независимые замеры Artificial Analysis держат одинаковые условия для всех. Их сводный индекс — десять тестов, сведённые в одно число, плюс отдельные замеры скорости вывода, времени до первого токена и цены задачи. Слабость индекса известна: это средняя температура по больнице, и модель, сильная в нише, в индексе проигрывает.
Третий сорт — прямые сравнения. Издания и блогеры берут одно задание на 2–3 модели и мерят время, доллары и оценивают результат. Это ближе всего к реальной работе, но выборка крошечная: три задания или один «Тетрис» — иллюстрация, не статистика.
Цена токена не равна цене задачи
Прейскурант — это цена слова, а платёж идёт за решённую задачу. Расход слов на задачу у моделей очень разный, а токены размышлений оплачиваются по цене выхода. Artificial Analysis считает среднюю стоимость задачи индекса на заданном уровне рассуждения, и картина получается неочевидная.
Самая дорогая задача — у Sonnet 5.5: $7,67 на максимальном уровне. У Fable 5.1 — $7,63, у Opus 5.5 — $5,98. При этом за токен Sonnet вдвое дешевле Opus и впятеро дешевле Fable. Причина в многословии Sonnet 5.5: 420 млн выходных токенов на прогон против медианы класса 81 млн. У Opus 5.5 — 260 млн, у Fable — 190 млн.
GPT-6 Astra при дорогом токене даёт $3,26 за задачу, вдвое дешевле Opus. GPT-6.1 Sol: 67 млн токенов на прогон, 52 балла индекса, 72 цента за задачу — лучшее соотношение качества и цены среди моделей выше 50 баллов. Grok 4.7 по прейскуранту в пять раз дешевле Astra, но задача стоит $3,74: 81 тысяча выходных токенов на задачу против 36 тысяч у Grok 4.6.
Снизу по цене: GPT-6 Luna — 38 баллов за 7 центов, DeepSeek V4.1 Flash — 39 баллов за 27 центов, DeepSeek V4 Pro — 36 баллов за 67 центов. Старшая DeepSeek дороже Flash при худшем результате. Вывод простой: модель выбирают по цене решённой задачи, а не по прейскуранту — при одинаковой цене за токен счёт может разойтись вдвое.
Индекс и отраслевые тесты
Сводный индекс Artificial Analysis на 3 октября, лучшие результаты: Claude Opus 5.5 — 58 баллов, первое место из 224 моделей; Claude Sonnet 5.5 — 56; Claude Fable 5.1 — 53; GPT-6 Astra — 53; GPT-6.1 Sol — 52; Grok 4.7 — 46; DeepSeek V4.1 Flash — 39; GPT-6 Luna — 38; DeepSeek V4 Pro — 36. Пять первых мест делят две американские компании, разрыв между ними шесть баллов. Это меньше, чем разница между ступенями low и medium у одной модели: наверху плотная группа, и настройка решает не меньше, чем поставщик.
Terminal-Bench 4.0 проверяет агентов в терминале: Sonnet 5.5 — 70,6%, Opus 5.5 — 66,4%, GPT-6 Astra — 57,9%, Fable 5.1 — 55,8%, Grok 4.7 — 37,6%, Grok 4.6 — 20,3%. У GPT-6.1 Sol, Luna и DeepSeek результат не опубликован. OSWorld: Opus 5.5 — 81,8%, Sonnet 5.5 — 80,1%. В AutomationBench по данным OpenAI GPT-6.1 Sol обходит Opus 5.5 на 2,2 пункта. В научной версии Terminal-Bench лидирует Astra, в Harvey — Grok 4.7 с 19,6% против 6,7% у Fable 5.1.
У каждой модели своя ниша, и выводы источников совпадают: длинные агентные задачи в программировании — за Claude, лучшее соотношение качества и цены — у GPT-6.1 Sol, Grok 4.7 вырос, но до флагманов не дотягивает. DeepSeek — лучший среди открытых моделей, но независимые замеры DeepSeek ниже собственных отчётов компании.
Что учитывать при сравнении
Считать цену задачи по расходу токенов, а не по прейскуранту, проверять уровень рассуждения при любом сравнении и сверяться с первоисточниками — эти три правила снимают большую часть расхождений между публикациями. Ограничения метода тоже понятны: сводный индекс усредняет нишевые модели, прямые сравнения опираются на выборку в одно-два задания, а по части моделей независимых замеров на нужном уровне рассуждения просто нет.
Для профиТехнические детали: архитектура, цифры, ссылки
Сводный индекс Artificial Analysis на 3 октября 2026 года (лучшие результаты, 224 модели): Claude Opus 5.5 — 58, Claude Sonnet 5.5 — 56, Claude Fable 5.1 — 53, GPT-6 Astra — 53, GPT-6.1 Sol — 52, Grok 4.7 — 46, DeepSeek V4.1 Flash — 39, GPT-6 Luna — 38, DeepSeek V4 Pro — 36.
Цена задачи индекса на максимальном уровне рассуждения: Sonnet 5.5 — $7,67, Fable 5.1 — $7,63, Opus 5.5 — $5,98, Grok 4.7 — $3,74, GPT-6 Astra — $3,26, GPT-6.1 Sol — 72 цента, DeepSeek V4 Pro — 67 центов, DeepSeek V4.1 Flash — 27 центов, GPT-6 Luna — 7 центов.
Расход выходных токенов на прогон: Sonnet 5.5 — 420 млн, Opus 5.5 — 260 млн, Fable 5.1 — 190 млн, GPT-6.1 Sol — 67 млн. Медиана класса — 81 млн.
Terminal-Bench 4.0: Sonnet 5.5 — 70,6%, Opus 5.5 — 66,4%, GPT-6 Astra — 57,9%, Fable 5.1 — 55,8%, Grok 4.7 — 37,6% (у xAI) и 33% (Artificial Analysis), Grok 4.6 — 20,3%. OSWorld: Opus 5.5 — 81,8%, Sonnet 5.5 — 80,1%. Harvey: Grok 4.7 — 19,6%, Fable 5.1 — 6,7%. AutomationBench: GPT-6.1 Sol обходит Opus 5.5 на 2,2 пункта по данным OpenAI.
Что это значит для России
Данных о доступности новых моделей из России, оплате и российских аналогах в источнике нет. В полной версии разбора на Хабре упоминается работа из России, но конкретика не раскрыта.
Вопросы и ответы
- Какая модель лидирует в сводном индексе Artificial Analysis?
- Claude Opus 5.5 с 58 баллами — первое место из 224 моделей на 3 октября 2026 года.
- Почему цена токена не совпадает с ценой задачи?
- Модели тратят разное количество выходных токенов на задачу, а токены размышлений оплачиваются по цене выхода. Sonnet 5.5 при дешёвом токене расходует 420 млн выходных токенов против медианы 81 млн.
- У какой модели лучшее соотношение качества и цены?
- GPT-6.1 Sol: 52 балла индекса при цене 72 цента за задачу — лучшее соотношение среди моделей выше 50 баллов.



