Claude Opus 5 тратит на русский текст вчетверо больше токенов, чем GPT-5.5
Пользователь Habr под ником donseo сравнил токенизаторы 11 нейросетей и выяснил: Claude Opus 5 разбивает русский текст почти на каждый символ, из-за чего он обходится в 3,9 раза дороже, чем в GPT-5.5 при той же цене за токен.
- Claude Opus 5 насчитал на 390% больше токенов в русском тексте, чем GPT-5.5
- Русский текст в среднем «весит» почти на 300% больше английского при одинаковом смысле
- Российские GigaChat и YandexGPT токенизируют русский текст меньше английского — обратный результат
Пользователь Habr под псевдонимом donseo сравнил, как популярные нейросети разбивают русский текст на токены. Результаты показали: при одинаковой цене за токен пользователи Claude Opus 5 от Anthropic платят за обработку одного и того же русского текста в 3,9 раза больше, чем пользователи GPT-5.5 от OpenAI.
Причина — в токенизаторе, алгоритме, который делит текст на фрагменты перед обработкой. У одних моделей это крупные куски, у других — почти отдельные буквы. В Claude Opus 5, по данным исследования, почти каждая русская буква становится отдельным токеном.
Как проходил эксперимент
donseo загрузил один и тот же текст сначала в Claude Opus 5, затем в GPT-5.5. Модель Anthropic насчитала на 390% больше токенов. «Значит, при одинаковой цене за токен счет за русскоязычный продукт на Opus 5 будет почти вчетверо выше, и это не зависит от того, у кого вы покупаете доступ. Никакой ошибки тут нет, просто у разных моделей разные токенизаторы. Токен у каждой модели свой, и сравнивать модели по цене за токен без поправки на язык нельзя», — отметил автор исследования.
Всего donseo сравнил 11 нейросетей, включая российские GigaChat (Сбербанк) и YandexGPT («Яндекс»), а также Gemini, DeepSeek, Qwen, GLM, Kimi и Grok. Он использовал собственные тексты в четырёх жанрах. «Разброс между жанрами оказался стабильным, и выводы от длины текста почти не зависят», — уточнил автор.
Результаты
При сравнении русского текста с английским при одинаковом смысле русский текст «весит» почти в три раза (почти на 300%) больше. Следом идут Kimi (86%), Qwen (52%) и DeepSeek (38%). В случае GPT-5.x/6, Gemini, Grok и GLM дисбаланс в сторону русского текста составляет 18–23%.
Российские нейросети показали противоположный результат: русский текст в них «весит» меньше английского. Насколько именно, donseo не уточнил.
Английский текст все протестированные модели токенизируют примерно одинаково. «Словари токенизаторов в основном учились на английском, и для него все пришли примерно к одному результату», — объяснил donseo.
Claude официально не работает в России. Как сообщал CNews, в мае 2026 года Anthropic без предупреждения заблокировала несколько сотен профилей россиян, а в октябре 2026 года — массово банит пользователей из неподдерживаемых стран, которые обходят ограничения.
Для профиТехнические детали: архитектура, цифры, ссылки
donseo опубликовал методику, сырые числа, пересчёт в рубли за тысячу символов и код для повторения замера на своих текстах. В исследовании участвовали 11 моделей, среди них Claude Opus 5, GPT-5.5, Gemini, DeepSeek, Qwen, GLM, Kimi, Grok, GigaChat и YandexGPT.
Ключевые цифры из публикации:
- Claude Opus 5 насчитал на 390% (в 3,9 раза) больше токенов в русском тексте, чем GPT-5.5
- Русский текст в среднем «весит» почти на 300% больше английского при одинаковом смысле
- Разница по моделям относительно английского: Kimi — 86%, Qwen — 52%, DeepSeek — 38%, GPT-5.x/6, Gemini, Grok и GLM — 18–23%
Российские модели токенизируют русский текст компактнее английского, но конкретные цифры автор не привёл.
Что это значит для России
Исследование напрямую касается российских пользователей: Claude официально не работает в России, а обход ограничений грозит блокировкой аккаунта. При этом даже при доступе русскоязычные запросы в Claude Opus 5 обходятся почти вчетверо дороже, чем в GPT-5.5.
Российские модели GigaChat и YandexGPT, по данным того же замера, токенизируют русский текст компактнее английского — обратная ситуация по сравнению с иностранными сервисами.
Вопросы и ответы
- Почему русский текст в Claude дороже, чем в GPT?
- Из-за токенизатора: Claude Opus 5 разбивает русский текст почти на каждую букву, поэтому токенов получается в 3,9 раза больше, чем в GPT-5.5.
- Как российские модели токенизируют русский текст?
- GigaChat и YandexGPT показали обратный результат: русский текст в них «весит» меньше английского, но точные цифры donseo не привёл.
- Можно ли повторить замер?
- Да, donseo опубликовал методику, сырые числа и код для повторения эксперимента на своих текстах.



