Перейти к контенту
Neaptidestudio
блог

Что такое токены ИИ: как устроены контекст, лимиты и оплата

Neaptide · 6 сентября 2026 г. · 6 мин чтения

Что считается токенами, сколько данных занимает контекст и как рассчитывать стоимость запросов к ИИ. Учебный пример, проверка расхода и способы его сократить.

В этой статье
Маленькие бумажные фрагменты проходят через прозрачное окно рядом с монетами.

Даже короткое сообщение «поправь последний абзац» может потребовать много токенов. Вместе с ним приложение иногда отправляет модели предыдущую переписку, документ и служебные инструкции. Поэтому расход нужно считать по всем переданным данным, а не только по последней реплике.

Что такое токен и почему это не слово

Модель обрабатывает текст небольшими частями — токенами. Токен может соответствовать символу, части слова или целому слову. Постоянного соотношения между словами и токенами нет: оно зависит от текста и способа его разбиения, то есть токенизатора. Для расчёта расходов используйте счётчик выбранной модели.

Что помещается в контекст модели

Контекстное окно — это предел объёма данных, с которыми модель может работать в одном запросе. В документации OpenAI в него входят входные данные, ответ и токены рассуждения. Для конкретной модели проверяйте два ограничения: размер контекста и максимальную длину ответа. Большое окно позволяет передать длинный документ, но не гарантирует, что модель правильно учтёт каждую деталь.

Учебное контекстное окно на 2000 токенов: 1200 занимают входные данные, до 600 выделено на ответ, 200 свободны.
Условный пример, а не параметры модели. Выделенное место для ответа может быть больше его фактической длины.

В условном примере окно составляет 2000 токенов. Входные данные занимают 1200, для ответа выделено до 600, ещё 200 остаются свободными. Если модель ответила за 300 токенов, оставшиеся 300 из выделенного места не становятся сгенерированным ответом. В реальном API отдельно учитывайте правила оплаты токенов рассуждения и других категорий расхода.

Что входит в запрос, кроме вашего сообщения

  • Инструкции приложения и переданная история переписки.
  • Текст документов, найденные фрагменты и результаты инструментов.
  • Изображения и другие входные данные — по правилам выбранного сервиса.

То, какие данные передаются модели, зависит от приложения. Например, в OpenAI использование previous_response_id для продолжения диалога не отменяет оплату предыдущих входных токенов. Поэтому короткое сообщение в длинной переписке может стоить дороже, чем развёрнутый вопрос в новом чате.

Учебный расчёт стоимости одного запроса

Для примера возьмём условные цены: 2 доллара за миллион входных токенов и 8 долларов за миллион выходных. Это вымышленные значения, а не действующий тариф. Рассчитаем только вход и выход, без инструментов, кэширования и других начислений.

Расчёт одного условного запроса
КатегорияКоличествоРасчётСтоимость, $
Вход12001200 × 2 / 1 000 0000,0024
Выход300300 × 8 / 1 000 0000,0024
Всего15000,0024 + 0,00240,0048

Тысяча таких запросов стоила бы 4,80 доллара. Если для одной задачи понадобятся три попытки с тем же расходом, получится 0,0144 доллара. Но обычно попытки различаются: переписка удлиняется, ответы меняются, агент использует инструменты. Чтобы узнать стоимость задачи, складывайте фактические расходы всех попыток, в том числе неудачных.

Где взять точное число токенов

  1. До отправки посчитайте все входные данные инструментом провайдера для выбранной модели.
  2. После ответа проверьте статистику usage, если API её предоставляет. Просить модель угадать собственный расход ненадёжно.
  3. Сопоставьте категории usage с тарифом и начислениями: в оплату может входить больше, чем видимый текст ответа.
  4. Сгруппируйте запросы по задачам, чтобы видеть суммарные затраты на каждый результат.

OpenAI предоставляет отдельный метод подсчёта входных токенов. В документации Gemini также описаны предварительный подсчёт и статистика расхода после ответа. Названия полей и правила учёта проверяйте для своей версии API.

Как уменьшить расход и сохранить важные сведения

Удалите повторяющиеся фрагменты, старые версии документов и материалы, не относящиеся к задаче. Уточните формат результата: например, попросите перечислить пять ошибок с цитатами вместо полного пересказа. При этом сохраните условия задачи, исключения и источники — без них ответ может стать неверным.

Для продолжения длинной работы в новом чате подготовьте сводку: принятые решения, ограничения, нерешённые вопросы и ссылки на материалы. Проверьте её по исходной переписке. Если при сокращении потеряется важное условие, исправления могут потребовать больше времени и токенов, чем удалось сэкономить.

Оценивайте затраты на пригодный результат, включая проверку и переделки. Низкая цена запроса мало помогает, если ответ затем приходится полностью исправлять вручную.

частые вопросы

Коротко о главном

Сколько токенов в одном русском слове?

Постоянного числа нет. Посчитайте свой текст токенизатором выбранной модели. Число слов позволяет лишь очень приблизительно оценить объём.

Контекст — это месячный лимит подписки?

Нет. Контекст — это объём данных, доступный модели в одном запросе. Лимиты подписки и ограничения на частоту использования устанавливаются отдельно.

Новый чат всегда уменьшает расходы?

Только если в новом запросе приложение передаст меньше данных. Важные инструкции и материалы всё равно нужно добавить. Если забыть нужные условия, может потребоваться больше попыток.

Можно считать PDF по числу страниц?

Для точной сметы — нет. Важны способ обработки файла, его содержимое и правила модели для текста и изображений.