Что такое токены ИИ: как устроены контекст, лимиты и оплата
Neaptide · 6 сентября 2026 г. · 6 мин чтения
Что считается токенами, сколько данных занимает контекст и как рассчитывать стоимость запросов к ИИ. Учебный пример, проверка расхода и способы его сократить.
В этой статье

Даже короткое сообщение «поправь последний абзац» может потребовать много токенов. Вместе с ним приложение иногда отправляет модели предыдущую переписку, документ и служебные инструкции. Поэтому расход нужно считать по всем переданным данным, а не только по последней реплике.
Что такое токен и почему это не слово
Модель обрабатывает текст небольшими частями — токенами. Токен может соответствовать символу, части слова или целому слову. Постоянного соотношения между словами и токенами нет: оно зависит от текста и способа его разбиения, то есть токенизатора. Для расчёта расходов используйте счётчик выбранной модели.
Что помещается в контекст модели
Контекстное окно — это предел объёма данных, с которыми модель может работать в одном запросе. В документации OpenAI в него входят входные данные, ответ и токены рассуждения. Для конкретной модели проверяйте два ограничения: размер контекста и максимальную длину ответа. Большое окно позволяет передать длинный документ, но не гарантирует, что модель правильно учтёт каждую деталь.

В условном примере окно составляет 2000 токенов. Входные данные занимают 1200, для ответа выделено до 600, ещё 200 остаются свободными. Если модель ответила за 300 токенов, оставшиеся 300 из выделенного места не становятся сгенерированным ответом. В реальном API отдельно учитывайте правила оплаты токенов рассуждения и других категорий расхода.
Что входит в запрос, кроме вашего сообщения
- Инструкции приложения и переданная история переписки.
- Текст документов, найденные фрагменты и результаты инструментов.
- Изображения и другие входные данные — по правилам выбранного сервиса.
То, какие данные передаются модели, зависит от приложения. Например, в OpenAI использование previous_response_id для продолжения диалога не отменяет оплату предыдущих входных токенов. Поэтому короткое сообщение в длинной переписке может стоить дороже, чем развёрнутый вопрос в новом чате.
Учебный расчёт стоимости одного запроса
Для примера возьмём условные цены: 2 доллара за миллион входных токенов и 8 долларов за миллион выходных. Это вымышленные значения, а не действующий тариф. Рассчитаем только вход и выход, без инструментов, кэширования и других начислений.
| Категория | Количество | Расчёт | Стоимость, $ |
|---|---|---|---|
| Вход | 1200 | 1200 × 2 / 1 000 000 | 0,0024 |
| Выход | 300 | 300 × 8 / 1 000 000 | 0,0024 |
| Всего | 1500 | 0,0024 + 0,0024 | 0,0048 |
Тысяча таких запросов стоила бы 4,80 доллара. Если для одной задачи понадобятся три попытки с тем же расходом, получится 0,0144 доллара. Но обычно попытки различаются: переписка удлиняется, ответы меняются, агент использует инструменты. Чтобы узнать стоимость задачи, складывайте фактические расходы всех попыток, в том числе неудачных.
Где взять точное число токенов
- До отправки посчитайте все входные данные инструментом провайдера для выбранной модели.
- После ответа проверьте статистику usage, если API её предоставляет. Просить модель угадать собственный расход ненадёжно.
- Сопоставьте категории usage с тарифом и начислениями: в оплату может входить больше, чем видимый текст ответа.
- Сгруппируйте запросы по задачам, чтобы видеть суммарные затраты на каждый результат.
OpenAI предоставляет отдельный метод подсчёта входных токенов. В документации Gemini также описаны предварительный подсчёт и статистика расхода после ответа. Названия полей и правила учёта проверяйте для своей версии API.
Как уменьшить расход и сохранить важные сведения
Удалите повторяющиеся фрагменты, старые версии документов и материалы, не относящиеся к задаче. Уточните формат результата: например, попросите перечислить пять ошибок с цитатами вместо полного пересказа. При этом сохраните условия задачи, исключения и источники — без них ответ может стать неверным.
Для продолжения длинной работы в новом чате подготовьте сводку: принятые решения, ограничения, нерешённые вопросы и ссылки на материалы. Проверьте её по исходной переписке. Если при сокращении потеряется важное условие, исправления могут потребовать больше времени и токенов, чем удалось сэкономить.
Оценивайте затраты на пригодный результат, включая проверку и переделки. Низкая цена запроса мало помогает, если ответ затем приходится полностью исправлять вручную.