← Volver a FAQ IA

¿Qué es un token en IA y por qué determina lo que pago cada mes?

Daniel García·

La primera vez que un cliente me preguntó “pero ¿por qué me cobráis por palabras?” tuve que parar la reunión y explicarle que no son palabras. Son tokens, y la diferencia importa más de lo que parece cuando llega la factura de la API a final de mes.

Un token es un trozo de texto, casi nunca una palabra entera. “Gato” suele ser un token. “Extraordinariamente” puede partirse en tres o cuatro. Los modelos de OpenAI, Claude o Gemini no leen letras ni palabras sueltas: leen estos fragmentos, y cada llamada a la API se cobra por cuántos entran (el prompt que mandas) y cuántos salen (lo que responde el modelo). En español, además, se suelen gastar más tokens que en inglés para decir lo mismo. Lo descubrimos a las malas en un proyecto de un cliente de hostelería, cuando el gasto mensual de la API se disparó casi un 40% respecto a lo que habíamos estimado con textos de prueba en inglés.

Eso tiene consecuencias que afectan al diseño de una función con IA, no solo a lo que se paga:

  • Un prompt de sistema muy largo (las instrucciones fijas que le mandas al modelo en cada petición) se paga en cada llamada, aunque el usuario solo escriba dos palabras.
  • Si un chatbot mantiene el historial completo de la conversación para simular “memoria”, cada mensaje nuevo arrastra todo lo anterior, y el coste por turno sube según avanza la charla.
  • Los modelos más potentes no solo cobran más por token: encima tienden a escribir respuestas más largas si no les pones un límite explícito, así que el coste se multiplica dos veces.

Cuando presupuestamos una integración de IA para un cliente, lo primero que hacemos ya no es preguntarnos “cuánto va a costar la IA” en abstracto, sino estimar tokens por interacción. Cogemos ejemplos reales de lo que va a escribir el usuario, medimos con el tokenizador de cada proveedor (todos lo publican, son gratis de usar) y multiplicamos por el volumen esperado al mes. Es un paso aburrido. También es el que evita sorpresas.

Hay un matiz que casi nadie pregunta y que debería preguntar más gente: el límite de contexto de un modelo también se mide en tokens, no en “mensajes” ni en “páginas”. Si un cliente quiere que la IA “lea todo el catálogo de productos” antes de responder, ese catálogo entero tiene que caber, en tokens, dentro de esa ventana. Si no cabe, hay que trocearlo o montar una base vectorial que traiga solo lo relevante en cada consulta, y eso ya es otro proyecto con otro presupuesto, no una casilla que se marca en la primera reunión.

Lo que no me convence del todo es que casi ningún proveedor deja ver el recuento de tokens en tiempo real mientras escribes el prompt, como si prefirieran que no pienses en ello hasta que llega el cargo a la tarjeta.

iatokensprecios