Saltar al contenido
Neaptidestudio
blog

Tokens de IA: contexto, límites y coste de una consulta

Neaptide · 6 de septiembre de 2026 · 6 min de lectura

Aprende a contar tokens y calcular el coste de una tarea con IA. Ejemplo con cifras, historial de conversación y gastos de los reintentos.

En este artículo
Pequeños fragmentos de papel atraviesan una ventana transparente junto a unas monedas.

Pides «corrige el último párrafo» y el consumo sube. Puede que la aplicación haya enviado también el historial, un documento y sus instrucciones. Tu último mensaje no es necesariamente toda la entrada.

Un token no equivale a una palabra

El modelo usa tokens para procesar la entrada y generar la respuesta. En un texto pueden representar un carácter, parte de una palabra o una palabra completa. No hay una conversión fija: depende del tokenizador y del texto. Para presupuestar, utiliza un contador compatible con el modelo.

El contexto limita lo que cabe en una consulta

La ventana de contexto limita el volumen que el modelo puede utilizar en una solicitud. OpenAI incluye entrada, salida y tokens de razonamiento en ese presupuesto. Revisa tanto el límite de contexto como el de respuesta. Que un documento quepa no garantiza que todos sus detalles se interpreten bien.

Ventana ficticia de 2000 tokens: entrada 1200, reserva para salida 600 y margen 200
Ejemplo didáctico, no especificaciones de un modelo.

Reservamos 600 tokens para la respuesta. Si al final genera 300, no ha generado los 600 reservados. En una API real, comprueba también cómo se contabilizan el razonamiento y las demás categorías.

Qué más puede incluir la entrada

  • Instrucciones de la aplicación e historial que esta envíe.
  • Documentos, fragmentos recuperados y resultados de herramientas.
  • Imágenes y otros datos, según las reglas del proveedor.

La aplicación decide qué información envía. OpenAI señala que usar previous_response_id para continuar una conversación no hace gratuitos los tokens de entrada de los intercambios anteriores. Por eso, un mensaje breve al final de un chat largo puede consumir más tokens de entrada que un primer mensaje extenso.

Un cálculo de ejemplo: 0,0048 dólares

Usamos precios ficticios: 2 dólares por millón de tokens de entrada y 8 por millón de salida. No son tarifas actuales. Excluimos herramientas, caché y otros cargos.

Una solicitud ficticia
CategoríaTokensCálculoCoste, USD
Entrada12001200 × 2 / 1 000 0000,0024
Salida300300 × 8 / 1 000 0000,0024
Total15000,0024 + 0,00240,0048

Mil solicitudes idénticas costarían 4,80 dólares. Tres intentos con exactamente el mismo consumo sumarían 0,0144 dólares por tarea. En la práctica cambian el historial, las respuestas y las herramientas: suma los costes reales, incluidos los intentos fallidos.

Medir antes y después

  1. Cuenta toda la entrada con el contador del proveedor antes de enviarla.
  2. Después de recibir la respuesta, consulta las estadísticas de consumo que devuelve la API, como los campos usage. No pidas al modelo que adivine cuántos tokens ha utilizado.
  3. Contrasta cada categoría con la tarifa y los cargos. La respuesta visible puede no reflejar todo el uso.
  4. Agrupa las solicitudes por tarea para conocer el coste del resultado.

OpenAI ofrece un método para contar tokens de entrada. Gemini documenta el recuento previo y las estadísticas de respuesta. Revisa los campos de tu versión de API.

Ahorrar sin perder lo importante

Elimina duplicados, versiones antiguas y fragmentos irrelevantes. Define una salida concreta: cinco errores con citas, por ejemplo, en lugar de un resumen de todo. Conserva restricciones, excepciones y pruebas.

Para continuar una conversación larga en otro chat, prepara un resumen con las decisiones, las condiciones, las dudas pendientes y los enlaces a las fuentes. Compruébalo con la conversación original antes de usarlo. Si se pierde una condición importante, el trabajo de corregir el resultado puede superar el ahorro de tokens.

Compara cuánto cuesta obtener un resultado que puedas dar por válido, incluida la revisión y las correcciones. Una llamada barata a la API puede dejar mucho trabajo pendiente si hay que rehacer la respuesta.

faq

Lo esencial en breve

¿Cuántos tokens tiene una palabra?

No existe un valor fijo. Cuenta el texto real con el tokenizador adecuado.

¿El contexto es mi cuota mensual?

No. Limita una solicitud; la suscripción y los límites de frecuencia son independientes.

¿Abrir otro chat siempre ahorra?

Puede costar menos si la aplicación envía menos datos. Aun así, hay que volver a aportar la información imprescindible: un contexto incompleto puede provocar errores y nuevos intentos.

¿Puedo calcular un PDF por páginas?

No con precisión. Importan el contenido, el procesamiento y las reglas del modelo para texto e imágenes.