Калькулятор стоимости токенов LLM
Стоимость нейросети в продукте = (токены на входе × цена входа + токены на выходе × цена выхода) × число запросов. Токен — кусочек текста: для русского языка это в среднем 2–4 символа.
Как посчитать стоимость токенов?
Инференс укладывается в разумную долю выручки — фичу можно масштабировать, не ломая экономику.
Что такое токен и сколько их в тексте?
Языковая модель работает не с буквами и не со словами, а с токенами — кусочками текста, на которые его режет токенизатор. У английского текста токен в среднем около четырёх символов, у русского — меньше, поэтому один и тот же смысл на русском обычно стоит больше токенов. Точное число зависит от модели: у каждой свой токенизатор.
Практический ориентир для оценки: страница обычного русского текста — порядка тысячи–полутора тысяч токенов. Для точного расчёта прогоните типичный запрос через счётчик токенов нужной модели.
Из чего складывается счёт?
- Входные токены — всё, что модель читает: системная инструкция, история диалога, приложенные документы, сам вопрос.
- Выходные токены — ответ модели. Обычно они в несколько раз дороже входных.
- Число запросов — сколько раз в месяц продукт обращается к модели, включая служебные вызовы.
Главный источник перерасхода почти всегда вход, а не ответ: инструкция и документы повторяются в каждом запросе. Ассистент поддержки, который каждый раз подкладывает в запрос 5 000 токенов регламента, тратит на это больше, чем на сами ответы.
Как снизить стоимость?
- Сокращать вход, а не ответ. Подкладывайте только нужные фрагменты документов через RAG, а не всю базу знаний.
- Кешировать повторяющуюся часть. Многие провайдеры дают скидку на повторяющийся префикс запроса.
- Брать модель поменьше для простых задач. Классификация и извлечение полей не требуют самой дорогой модели.
- Обрезать историю диалога. Старые реплики можно сжимать в краткое резюме.
Где чаще всего ошибаются при оценке?
- Считают только ответы. Входные токены в диалоговых продуктах обычно составляют большую часть счёта.
- Забывают служебные вызовы. Проверка, классификация, перефразирование — это отдельные запросы к модели.
- Экономят на токенах, а не на людях. Модель редко бывает главной статьёй затрат: дороже подготовка данных и разбор ошибок.
Нейросети и AI для бизнеса
Глубокий курс-тренажёр по нейросетям и AI-агентам для работы и бизнеса 2026: context engineering, agent harness и loops, reasoning-модели, российские модели (YandexGPT, GigaChat), no-code автоматизация и ИИ-аватары. Через сквозной кейс школы английского EnglishKids и её основательницы Анны — превращаем буксующий бизнес в AI-first компанию: экономим время и деньги, удерживаем клиентов, считаем ROI и собираем собственных AI-ассистентов и агентов без кода.
Посмотреть курс