Русский язык обходится генеративным моделям дороже английского

Большинству моделей искусственного интеллекта русский язык обходится на 20–50% дороже английского, показало небольшое исследование, которое провел пользователь Хабра. Все дело в токенизации — переводе естественного текста в понятные ИИ цифровые единицы.
Стоимость API разных LLM, с помощью которых разработчики создают чат-боты, системы клиентской поддержки и прочие полезные продукты, обычно сравнивают по цене за миллион токенов. Но токен у каждой модели свой — он зависит от алгоритма токенизации: одни режут русский текст крупными кусками, другие почти по буквам.
«Я прогнал один и тот же русский текст через Claude Opus 5 и GPT-5.5. Opus 5 насчитал в нем в 3,9 раза больше токенов, — приводит пример автор. — Значит, при одинаковой цене за токен обработка русского текста на Opus 5 обойдется почти вчетверо дороже, чем на GPT-5.5, — и это не зависит от того, у кого вы покупаете доступ».
Исследователь подготовил четыре текста, каждый на русском и английском, и пропустил их через токенизаторы одиннадцати моделей — результаты чего, в том числе пересчитанные в рубли, собрал в таблице.
Английский почти у всех одинаковый — 5,0–5,1 символа на токен у десяти моделей из одиннадцати. Вполне логично — ведь учились они на английском.
На русском — большой разброс. Эффективнее всех его токенизируют отечественные модели YandexGPT и GigaChat — у них один токен умещает в пять раз больше русских букв, чем у Claude Opus 5, а русский текст выходит дешевле английского перевода.
У остальных — закономерность противоположная: русский текст «тяжелее» английского:
- у GPT-5.x/6, Gemini, Grok и GLM — на 18–23%,
- у DeepSeek — на 38%,
- у Qwen — на 52%,
- у Kimi — на 86%,
- у Claude Opus 5 — почти втрое.
«Сравнивать модели для русскоязычного продукта нужно по цене не за миллион токенов, а за 1 000 символов или за типичный запрос на ваших текстах», — резюмирует автор.
Он признает ограничения исследования, но отмечает, что судя по измерениям на разных моделях более обширный массив данных дал бы, по всей видимости, те же результаты.
Что и подтверждается в комментариях. Там показали скриншот другого исследования с аналогичными результатами, хотя и несколько меньшим разбросом. Закономерность тот анализ выявил ровно такую же: китайский язык обходится дешевле при обработке китайскими моделями.












