Claude Sonnet 5.5 победил старшие модели в пошаговой стратегии

Разработчик пошаговой стратегии «Стратегикон» провёл серию партий между LLM-агентами Claude. Младшая и самая дешёвая модель Sonnet 5.5 победила Opus 5.5 и Fable 5.1 со счётом 197:151:31.

Главное
  • Модели играли через MCP-сервер, который для игрового сервера выглядит как обычный сетевой игрок
  • Sonnet 5.5 победил со счётом 197:151:31, решив партию ранним захватом центра карты
  • Haiku 4.5 в партии вчетвером перестал планировать в шестом раунде из тринадцати и закончил с нулём
Иллюстрация к эксперименту: языковые модели Claude играют в пошаговую стратегию на гексагональной карте
Фото: Хабр: ИИ

Разработчик пошаговой онлайн-стратегии на гексах «Стратегикон» провёл серию партий между LLM-агентами Claude. Эксперимент шёл с конца августа по начало октября. Цель — понять, как топовые языковые модели справляются с игрой, где нужно строить экономику, воевать и договариваться, и совпадёт ли расстановка сил за игровым столом с публичными бенчмарками.

Как устроен эксперимент

Модели играют через MCP-сервер, который для игрового сервера выглядит как ещё один сетевой игрок. Модель не видит экран: сервер отдаёт ей текстовый снимок партии и инструменты — те же действия, что доступны человеку в интерфейсе. Каждая модель работает отдельным агентом в Claude Code.

Партия длится 13 раундов, в каждом три фазы: снабжение, строительство и война. Побеждает набравший больше очков, две монеты считаются за очко. Тумана войны нет — поле видно всем. В общем чате обещания ничем не обеспечены: в инструкции игрокам прямо сказано, что дипломатическая хитрость — часть игры, «как в настольной „Дипломатии“».

Перед завершением каждого хода агент обязан оставить короткий комментарий: что делает и зачем. Соперники журнал не видят. Между партиями игроки помнят сыгранное: у каждого есть воспоминания, интервью после партий и «персона» — собственные выводы о стратегии и о соперниках.

Партия 1: Sonnet 5.5, Opus 5.5 и Fable 5.1

1 октября на карте «Три холма» в центре лежали великие руины — самая ценная точка: 4 очка за раунд, а в трёх последних раундах — 8. Их сторожил нейтральный отряд d6 (6), «страж». Opus стартовал вверху карты, Fable — справа, Sonnet — слева внизу. Все трое играли за одну фракцию, и у каждого в памяти было несколько прошлых партий друг с другом.

Все трое договорились о перемирии до конца шестого раунда, а центр должен был достаться тому, кто убьёт стража. Нацелились на него Opus и Sonnet. Sonnet купил политику, с которой тяжёлая пехота нанимается сразу третьего размера, и в журнале первого хода записал дебют, найденный в прошлой партии.

Во втором раунде он выполнил план почти без отступлений: перехватил инициативу, чтобы ходить раньше Opus, а вместо докупки размера взял «Варварство». Его d10 шестого размера ударил стража: нужно было шесть урона, выпало семь. В третьем раунде Sonnet первым поставил у руин город, и Opus написал в чат: «Sonnet, центр твой — чисто сработано…» Позже Sonnet признал, что с ударом повезло: «урон 7 против 6, страж выбросил 1».

В раундах 4–5 шла мирная стройка, лучше всех у Fable: три города, храм и две руины — девять очков за раунд. Дальше Sonnet нанёс удар по городам лидера в том же раунде, в котором пообещал ему мир. Партия закончилась со счётом 197:151:31 в пользу Sonnet 5.5.

Партия вчетвером

В партии вчетвером Haiku 4.5 перестал планировать в шестом раунде из тринадцати и закончил с нулём. Расстановка сил оказалась ближе к агентным бенчмаркам, чем к текстовым рейтингам и цене.

По цене иерархия однозначная: Fable 5.1 — самая способная модель линейки, Opus 5.5 — модель по умолчанию для сложной работы, Sonnet 5.5 — её более быстрое и дешёвое дополнение, Haiku 4.5 — самая маленькая и к тому же прошлого поколения. Независимые рейтинги тоже ставят Haiku в самый низ, но расходятся в том, где Sonnet: далеко от старших или рядом с ними.

Ближе всего к теме эксперимента Kaggle Game Arena, где модели играют друг против друга в шахматы, го, покер и торг. Моделей 5.5 там ещё нет: Sonnet 5.5 вышел 28 сентября, за три дня до партии. Из прежних версий Opus 5 там первый, Fable 5.1 третий, Sonnet 5 — пятнадцатый, почти вдвое ниже по баллам.

Автор подчёркивает: партий мало, это не рейтинг, и выводы предварительные. Но движок позволяет мерить отдельные умения в одной партии, и он думает, как сделать из него бенчмарк.

Для профиТехнические детали: архитектура, цифры, ссылки

Стенд. Модели играют через MCP-сервер, который для игрового сервера выглядит как обычный сетевой игрок, а модели отдаёт текстовый снимок партии и инструменты. Каждая модель работает отдельным агентом в Claude Code.

Цены и рейтинги на 5 октября 2026 года.

  • Fable 5.1 — 10 / 50 долларов за 1 млн токенов (вход / выход), LMArena — 6-е место, LiveBench — 1-е, 83,4 балла, индекс Artificial Analysis — 53
  • Opus 5.5 — 4 / 20 долларов, LMArena — 4-е место, LiveBench — 2-е, 83,2 балла, Artificial Analysis — 58
  • Sonnet 5.5 — 2 / 10 долларов, LMArena — 45-е место, LiveBench — 19-е, 77,8 балла, Artificial Analysis — 56
  • Haiku 4.5 — 1 / 5 долларов, LMArena — 142-е место, в LiveBench нет, Artificial Analysis — 17

Индекс Artificial Analysis делает упор на агентные задачи и приведён для максимальных настроек. В LMArena ответы моделей вслепую сравнивают люди.

Kaggle Game Arena. Из прежних версий Opus 5 там первый, Fable 5.1 третий, Sonnet 5 — пятнадцатый, почти вдвое ниже по баллам. Sonnet 5.5 вышел 28 сентября.

Вопросы и ответы

Какая модель победила в эксперименте?
Sonnet 5.5 — младшая и самая дешёвая из трёх моделей. В партии 1 октября она набрала 197 очков против 151 у Opus 5.5 и 31 у Fable 5.1.
Как модели играли в «Стратегикон»?
Через MCP-сервер, который для игрового сервера выглядит как обычный сетевой игрок. Модель получает текстовый снимок партии и инструменты — те же действия, что доступны человеку в интерфейсе.
Что случилось с Haiku 4.5?
В партии вчетвером Haiku 4.5 перестал планировать в шестом раунде из тринадцати и закончил с нулём очков.