Claude Opus 5 тратит на русский текст вчетверо больше токенов, чем GPT-5.5

Пользователь Habr под ником donseo сравнил токенизаторы 11 нейросетей и выяснил: Claude Opus 5 разбивает русский текст почти на каждый символ, из-за чего он обходится в 3,9 раза дороже, чем в GPT-5.5 при той же цене за токен.

Главное
  • Claude Opus 5 насчитал на 390% больше токенов в русском тексте, чем GPT-5.5
  • Русский текст в среднем «весит» почти на 300% больше английского при одинаковом смысле
  • Российские GigaChat и YandexGPT токенизируют русский текст меньше английского — обратный результат

Пользователь Habr под псевдонимом donseo сравнил, как популярные нейросети разбивают русский текст на токены. Результаты показали: при одинаковой цене за токен пользователи Claude Opus 5 от Anthropic платят за обработку одного и того же русского текста в 3,9 раза больше, чем пользователи GPT-5.5 от OpenAI.

Причина — в токенизаторе, алгоритме, который делит текст на фрагменты перед обработкой. У одних моделей это крупные куски, у других — почти отдельные буквы. В Claude Opus 5, по данным исследования, почти каждая русская буква становится отдельным токеном.

Как проходил эксперимент

donseo загрузил один и тот же текст сначала в Claude Opus 5, затем в GPT-5.5. Модель Anthropic насчитала на 390% больше токенов. «Значит, при одинаковой цене за токен счет за русскоязычный продукт на Opus 5 будет почти вчетверо выше, и это не зависит от того, у кого вы покупаете доступ. Никакой ошибки тут нет, просто у разных моделей разные токенизаторы. Токен у каждой модели свой, и сравнивать модели по цене за токен без поправки на язык нельзя», — отметил автор исследования.

Всего donseo сравнил 11 нейросетей, включая российские GigaChat (Сбербанк) и YandexGPT («Яндекс»), а также Gemini, DeepSeek, Qwen, GLM, Kimi и Grok. Он использовал собственные тексты в четырёх жанрах. «Разброс между жанрами оказался стабильным, и выводы от длины текста почти не зависят», — уточнил автор.

Результаты

При сравнении русского текста с английским при одинаковом смысле русский текст «весит» почти в три раза (почти на 300%) больше. Следом идут Kimi (86%), Qwen (52%) и DeepSeek (38%). В случае GPT-5.x/6, Gemini, Grok и GLM дисбаланс в сторону русского текста составляет 18–23%.

Российские нейросети показали противоположный результат: русский текст в них «весит» меньше английского. Насколько именно, donseo не уточнил.

Английский текст все протестированные модели токенизируют примерно одинаково. «Словари токенизаторов в основном учились на английском, и для него все пришли примерно к одному результату», — объяснил donseo.

Claude официально не работает в России. Как сообщал CNews, в мае 2026 года Anthropic без предупреждения заблокировала несколько сотен профилей россиян, а в октябре 2026 года — массово банит пользователей из неподдерживаемых стран, которые обходят ограничения.

Для профиТехнические детали: архитектура, цифры, ссылки

donseo опубликовал методику, сырые числа, пересчёт в рубли за тысячу символов и код для повторения замера на своих текстах. В исследовании участвовали 11 моделей, среди них Claude Opus 5, GPT-5.5, Gemini, DeepSeek, Qwen, GLM, Kimi, Grok, GigaChat и YandexGPT.

Ключевые цифры из публикации:

  • Claude Opus 5 насчитал на 390% (в 3,9 раза) больше токенов в русском тексте, чем GPT-5.5
  • Русский текст в среднем «весит» почти на 300% больше английского при одинаковом смысле
  • Разница по моделям относительно английского: Kimi — 86%, Qwen — 52%, DeepSeek — 38%, GPT-5.x/6, Gemini, Grok и GLM — 18–23%

Российские модели токенизируют русский текст компактнее английского, но конкретные цифры автор не привёл.

Что это значит для России

Исследование напрямую касается российских пользователей: Claude официально не работает в России, а обход ограничений грозит блокировкой аккаунта. При этом даже при доступе русскоязычные запросы в Claude Opus 5 обходятся почти вчетверо дороже, чем в GPT-5.5.

Российские модели GigaChat и YandexGPT, по данным того же замера, токенизируют русский текст компактнее английского — обратная ситуация по сравнению с иностранными сервисами.

Вопросы и ответы

Почему русский текст в Claude дороже, чем в GPT?
Из-за токенизатора: Claude Opus 5 разбивает русский текст почти на каждую букву, поэтому токенов получается в 3,9 раза больше, чем в GPT-5.5.
Как российские модели токенизируют русский текст?
GigaChat и YandexGPT показали обратный результат: русский текст в них «весит» меньше английского, но точные цифры donseo не привёл.
Можно ли повторить замер?
Да, donseo опубликовал методику, сырые числа и код для повторения эксперимента на своих текстах.

Источники

Материал подготовлен редакцией на основе указанных источников. Как мы работаем