Tokens de IA: contexto, límites y coste de una consulta
Neaptide · 6 de septiembre de 2026 · 6 min de lectura
Aprende a contar tokens y calcular el coste de una tarea con IA. Ejemplo con cifras, historial de conversación y gastos de los reintentos.
En este artículo

Pides «corrige el último párrafo» y el consumo sube. Puede que la aplicación haya enviado también el historial, un documento y sus instrucciones. Tu último mensaje no es necesariamente toda la entrada.
Un token no equivale a una palabra
El modelo usa tokens para procesar la entrada y generar la respuesta. En un texto pueden representar un carácter, parte de una palabra o una palabra completa. No hay una conversión fija: depende del tokenizador y del texto. Para presupuestar, utiliza un contador compatible con el modelo.
El contexto limita lo que cabe en una consulta
La ventana de contexto limita el volumen que el modelo puede utilizar en una solicitud. OpenAI incluye entrada, salida y tokens de razonamiento en ese presupuesto. Revisa tanto el límite de contexto como el de respuesta. Que un documento quepa no garantiza que todos sus detalles se interpreten bien.

Reservamos 600 tokens para la respuesta. Si al final genera 300, no ha generado los 600 reservados. En una API real, comprueba también cómo se contabilizan el razonamiento y las demás categorías.
Qué más puede incluir la entrada
- Instrucciones de la aplicación e historial que esta envíe.
- Documentos, fragmentos recuperados y resultados de herramientas.
- Imágenes y otros datos, según las reglas del proveedor.
La aplicación decide qué información envía. OpenAI señala que usar previous_response_id para continuar una conversación no hace gratuitos los tokens de entrada de los intercambios anteriores. Por eso, un mensaje breve al final de un chat largo puede consumir más tokens de entrada que un primer mensaje extenso.
Un cálculo de ejemplo: 0,0048 dólares
Usamos precios ficticios: 2 dólares por millón de tokens de entrada y 8 por millón de salida. No son tarifas actuales. Excluimos herramientas, caché y otros cargos.
| Categoría | Tokens | Cálculo | Coste, USD |
|---|---|---|---|
| Entrada | 1200 | 1200 × 2 / 1 000 000 | 0,0024 |
| Salida | 300 | 300 × 8 / 1 000 000 | 0,0024 |
| Total | 1500 | 0,0024 + 0,0024 | 0,0048 |
Mil solicitudes idénticas costarían 4,80 dólares. Tres intentos con exactamente el mismo consumo sumarían 0,0144 dólares por tarea. En la práctica cambian el historial, las respuestas y las herramientas: suma los costes reales, incluidos los intentos fallidos.
Medir antes y después
- Cuenta toda la entrada con el contador del proveedor antes de enviarla.
- Después de recibir la respuesta, consulta las estadísticas de consumo que devuelve la API, como los campos usage. No pidas al modelo que adivine cuántos tokens ha utilizado.
- Contrasta cada categoría con la tarifa y los cargos. La respuesta visible puede no reflejar todo el uso.
- Agrupa las solicitudes por tarea para conocer el coste del resultado.
OpenAI ofrece un método para contar tokens de entrada. Gemini documenta el recuento previo y las estadísticas de respuesta. Revisa los campos de tu versión de API.
Ahorrar sin perder lo importante
Elimina duplicados, versiones antiguas y fragmentos irrelevantes. Define una salida concreta: cinco errores con citas, por ejemplo, en lugar de un resumen de todo. Conserva restricciones, excepciones y pruebas.
Para continuar una conversación larga en otro chat, prepara un resumen con las decisiones, las condiciones, las dudas pendientes y los enlaces a las fuentes. Compruébalo con la conversación original antes de usarlo. Si se pierde una condición importante, el trabajo de corregir el resultado puede superar el ahorro de tokens.
Compara cuánto cuesta obtener un resultado que puedas dar por válido, incluida la revisión y las correcciones. Una llamada barata a la API puede dejar mucho trabajo pendiente si hay que rehacer la respuesta.