Русский язык обходится генеративным моделям дороже английского

Небольшое исследование сравнило токенизацию текстов на русском и английском разными моделями искусственного интеллекта.
Иллюстрация: ChatGPT

Большинству моделей искусственного интеллекта русский язык обходится на 20–50% дороже английского, показало небольшое исследование, которое провел пользователь Хабра. Все дело в токенизации — переводе естественного текста в понятные ИИ цифровые единицы.

Стоимость API разных LLM, с помощью которых разработчики создают чат-боты, системы клиентской поддержки и прочие полезные продукты, обычно сравнивают по цене за миллион токенов. Но токен у каждой модели свой — он зависит от алгоритма токенизации: одни режут русский текст крупными кусками, другие почти по буквам.

«Я прогнал один и тот же русский текст через Claude Opus 5 и GPT-5.5. Opus 5 насчитал в нем в 3,9 раза больше токенов, — приводит пример автор. — Значит, при одинаковой цене за токен обработка русского текста на Opus 5 обойдется почти вчетверо дороже, чем на GPT-5.5, — и это не зависит от того, у кого вы покупаете доступ».

Исследователь подготовил четыре текста, каждый на русском и английском, и пропустил их через токенизаторы одиннадцати моделей — результаты чего, в том числе пересчитанные в рубли, собрал в таблице.

Английский почти у всех одинаковый — 5,0–5,1 символа на токен у десяти моделей из одиннадцати. Вполне логично — ведь учились они на английском.

На русском — большой разброс. Эффективнее всех его токенизируют отечественные модели YandexGPT и GigaChat — у них один токен умещает в пять раз больше русских букв, чем у Claude Opus 5, а русский текст выходит дешевле английского перевода.

У остальных — закономерность противоположная: русский текст «тяжелее» английского:

  • у GPT-5.x/6, Gemini, Grok и GLM — на 18–23%,
  • у DeepSeek — на 38%,
  • у Qwen — на 52%,
  • у Kimi — на 86%,
  • у Claude Opus 5 — почти втрое.

«Сравнивать модели для русскоязычного продукта нужно по цене не за миллион токенов, а за 1 000 символов или за типичный запрос на ваших текстах», — резюмирует автор.

Он признает ограничения исследования, но отмечает, что судя по измерениям на разных моделях более обширный массив данных дал бы, по всей видимости, те же результаты.

Что и подтверждается в комментариях. Там показали скриншот другого исследования с аналогичными результатами, хотя и несколько меньшим разбросом. Закономерность тот анализ выявил ровно такую же: китайский язык обходится дешевле при обработке китайскими моделями.

Подписывайтесь и читайте «Науку» в MAX