Калькулятор стоимости токенов LLM

Стоимость нейросети в продукте = (токены на входе × цена входа + токены на выходе × цена выхода) × число запросов. Токен — кусочек текста: для русского языка это в среднем 2–4 символа.

Как посчитать стоимость токенов?

Во что обойдётся ИИ-фича
На пользователя
27 ₽/мес
Всего в месяц
27 000
Доля выручки
5.4%

Инференс укладывается в разумную долю выручки — фичу можно масштабировать, не ломая экономику.

Что такое токен и сколько их в тексте?

Языковая модель работает не с буквами и не со словами, а с токенами — кусочками текста, на которые его режет токенизатор. У английского текста токен в среднем около четырёх символов, у русского — меньше, поэтому один и тот же смысл на русском обычно стоит больше токенов. Точное число зависит от модели: у каждой свой токенизатор.

Практический ориентир для оценки: страница обычного русского текста — порядка тысячи–полутора тысяч токенов. Для точного расчёта прогоните типичный запрос через счётчик токенов нужной модели.

Из чего складывается счёт?

  • Входные токены — всё, что модель читает: системная инструкция, история диалога, приложенные документы, сам вопрос.
  • Выходные токены — ответ модели. Обычно они в несколько раз дороже входных.
  • Число запросов — сколько раз в месяц продукт обращается к модели, включая служебные вызовы.

Главный источник перерасхода почти всегда вход, а не ответ: инструкция и документы повторяются в каждом запросе. Ассистент поддержки, который каждый раз подкладывает в запрос 5 000 токенов регламента, тратит на это больше, чем на сами ответы.

Как снизить стоимость?

  • Сокращать вход, а не ответ. Подкладывайте только нужные фрагменты документов через RAG, а не всю базу знаний.
  • Кешировать повторяющуюся часть. Многие провайдеры дают скидку на повторяющийся префикс запроса.
  • Брать модель поменьше для простых задач. Классификация и извлечение полей не требуют самой дорогой модели.
  • Обрезать историю диалога. Старые реплики можно сжимать в краткое резюме.

Где чаще всего ошибаются при оценке?

  • Считают только ответы. Входные токены в диалоговых продуктах обычно составляют большую часть счёта.
  • Забывают служебные вызовы. Проверка, классификация, перефразирование — это отдельные запросы к модели.
  • Экономят на токенах, а не на людях. Модель редко бывает главной статьёй затрат: дороже подготовка данных и разбор ошибок.
Разобраться на практике

Нейросети и AI для бизнеса

Глубокий курс-тренажёр по нейросетям и AI-агентам для работы и бизнеса 2026: context engineering, agent harness и loops, reasoning-модели, российские модели (YandexGPT, GigaChat), no-code автоматизация и ИИ-аватары. Через сквозной кейс школы английского EnglishKids и её основательницы Анны — превращаем буксующий бизнес в AI-first компанию: экономим время и деньги, удерживаем клиентов, считаем ROI и собираем собственных AI-ассистентов и агентов без кода.

Посмотреть курс