Как управлять расходами на токены ИИ
Коротко: Расходы на токены складываются из двух потоков: входящие токены (запрос и контекст) и исходящие (ответ модели), причём исходящие обычно дороже. Русскоязычные запросы обходятся дороже английских, потому что кириллица кодируется менее эффективно и один токен покрывает меньше текста. Управлять затратами можно через сокращение системных промптов, выбор модели под задачу и контроль длины контекста.
Рост расходов на токены пугает почти каждую команду, которая начинает серьёзно использовать языковые модели. Но прежде чем резать бюджет, стоит понять: иногда рост затрат означает, что ИИ наконец-то работает на полную.
Содержание
Что такое токены и почему за них платят
Языковые модели не читают текст буквами и не считают слова. Они разбивают входящий текст на куски, которые называют токенами. Один токен в английском тексте примерно равен четырём символам или трём четвертям слова. В русском всё хуже: кириллица кодируется менее эффективно, и один токен часто покрывает меньше текста, чем в латинице. На практике это значит, что русскоязычные запросы обходятся дороже при одинаковом объёме информации.
Провайдеры (OpenAI, Anthropic, Google, Yandex, Sber) берут деньги за два потока: входящие токены (ваш запрос, контекст, системный промпт) и исходящие (ответ модели). Исходящие обычно стоят дороже в 2-3 раза. Это важно знать, потому что именно здесь прячутся главные потери.
Почему расходы растут и что это значит
Когда команда только запускает пилот, токены почти не тратятся: несколько человек, несколько запросов в день. Потом внедрение набирает обороты, сотрудники начинают реально пользоваться инструментом, и счёт вырастает в разы. Это не баг. Это сигнал, что продукт прижился.
Проблема возникает в другом месте: когда расходы растут, а результат не отслеживается. Тогда вы платите за активность, а не за ценность. Моя практика показывает, что большинство компаний на этом этапе начинают резать доступ вместо того, чтобы разобраться, какие сценарии реально окупаются.
Правильный вопрос не «почему токены дорожают», а «какой бизнес-результат стоит за каждым потраченным рублём».
Где деньги утекают незаметно
Четыре места, где я видел самые бессмысленные потери:
Раздутые системные промпты. Инструкция модели на 2000 токенов, которая копируется в каждый запрос. Если у вас 500 запросов в день, это миллион лишних токенов только на системный промпт. Переписать его компактнее, убрать повторения и «вежливую воду» обычно сокращает объём вдвое без потери качества.
Лишний контекст. Разработчики часто передают в запрос весь документ, хотя модели нужен только релевантный фрагмент. Если ваш сценарий предполагает работу с большими текстами, сначала извлекайте нужный кусок через поиск (RAG), а потом отправляйте его модели. Разница в стоимости бывает 5-10 кратной.
Выбор не той модели. GPT-4o на задаче классификации коротких текстов, с которой справится GPT-4o mini, это переплата в 10-20 раз. Для каждого сценария нужна своя модель: мощные флагманы для сложных рассуждений, быстрые и дешёвые варианты для рутины. Посмотрите каталог LLM-моделей и сравните цены и возможности перед тем, как фиксировать стек.
Отсутствие кэширования. Если один и тот же системный промпт или документ используется в сотнях запросов, большинство провайдеров позволяют кэшировать его и не тарифицировать повторно. OpenAI и Anthropic поддерживают prompt caching, это снижает стоимость повторяющихся входящих токенов на 50-90%.
Как выстроить контроль расходов
Без метрик управлять нечем. Первое, что нужно сделать, настроить учёт по сценариям, а не просто смотреть на общий счёт.
Конкретные шаги:
- Разбейте использование по юзкейсам. Саммаризация встреч, генерация текстов, поиск по базе знаний, код-ревью, это разные продукты с разной ценностью. Считайте токены отдельно по каждому.
- Считайте стоимость одной операции. Сколько стоит один саммари встречи? Один ответ в чат-боте? Один сгенерированный черновик? Это даст вам базу для сравнения с ручным трудом.
- Установите лимиты на уровне приложения. Большинство API позволяют задавать максимальное количество токенов в ответе (параметр
max_tokens). Не давайте модели генерировать 2000 слов там, где нужно 200.
- Тестируйте деградацию качества при смене модели. Прежде чем переключиться с дорогой модели на дешёвую, прогоните 50-100 реальных кейсов и сравните результаты. Часто разница незначительна, а экономия существенная.
- Мониторьте аномалии. Резкий рост токенов за день может означать баг в коде (бесконечный цикл запросов) или то, что кто-то использует корпоративный доступ не по назначению.
Если ваша команда работает со встречами и документами, и вы ищете инструмент, который уже встроил контроль над контекстом и не гоняет лишние токены, посмотрите на ENGRAM: российский сервис для ИИ-памяти команды, заточенный под корпоративные сценарии.
Российский контекст: оплата и альтернативы
Прямой доступ к OpenAI API из России официально закрыт с 2024 года. Работают прокси-сервисы и посредники, но это юридический и операционный риск. Практичнее смотреть на:
- YandexGPT API через Yandex Cloud, рублёвая оплата, работает в российском правовом поле.
- GigaChat API от Сбера, аналогично, рубли, 152-ФЗ, есть корпоративные тарифы.
- Облачные провайдеры с российскими юрлицами, которые перепродают доступ к западным моделям с оплатой в рублях.
Цены у отечественных моделей ниже, но и качество на сложных задачах пока уступает GPT-4o и Claude. Для рутинных операций разница несущественна.
Подробнее о том, как формулировать запросы так, чтобы тратить меньше токенов без потери результата, читайте в гайде по промпт-инжинирингу.
Частые вопросы
Как понять, что мы переплачиваем за токены?
Сравните стоимость одной операции с альтернативой: сколько стоит сотрудник-человек на ту же задачу за то же время. Если ИИ дешевле и быстрее, расходы оправданы. Если нет, либо сценарий выбран неудачно, либо реализация неэффективна (лишний контекст, не та модель, отсутствие кэша).
Стоит ли ограничивать сотрудникам доступ к ИИ-инструментам, чтобы снизить расходы?
Резать доступ вслепую контрпродуктивно. Лучше разделить сценарии на те, где ИИ даёт измеримый результат, и те, где люди просто экспериментируют. Первые финансируйте без ограничений, для вторых установите разумные лимиты. Полный запрет обычно убивает культуру использования раньше, чем она успевает принести пользу.
Можно ли сократить расходы на токены без потери качества?
Да, и часто значительно. Три самых быстрых рычага: сократить системный промпт, включить кэширование повторяющихся блоков и заменить флагманскую модель на более дешёвую там, где задача это позволяет. На практике это даёт 30-60% экономии без заметного ухудшения результата.
Мнение редакции ENGRAM
Рекомендуем начинать не с выбора модели, а с аудита системных промптов и контекста: на нашем опыте именно здесь уходит 40-60% бюджета впустую, и сокращение занимает день-два без какого-либо ущерба для качества. Для российских команд практичнее всего стартовать с YandexGPT API или GigaChat API: рублёвая оплата, соответствие 152-ФЗ и отсутствие юридических рисков, связанных с прокси-доступом к OpenAI. Флагманские западные модели имеет смысл подключать точечно - только под задачи, где разница в качестве действительно измерима и окупается.
Знания и наработки команды теряются в переписке. ENGRAM собирает их в единую ИИ-память с поиском по смыслу - данные остаются в России.