Qué es un token y por qué todas las IA cobran por ellos
Todos los precios de la IA se miden en una unidad que casi nadie sabe explicar: el token. Esta guía cuenta qué es exactamente, por qué las empresas cobran por ellos y no por mensajes, por qué escribir en español sale más caro que en inglés y qué trucos abaratan de verdad la factura.
Por DidadoY

/ En esta guía
Si has leído cualquier noticia sobre precios de IA, te has cruzado con la frase "10 dólares por millón de tokens" y probablemente has asentido sin saber muy bien qué acababas de leer. No estás solo: el token es la unidad de medida de toda la economía de la IA y a la vez la palabra peor explicada del sector. Esta guía la desmonta de una vez, porque sin entenderla es imposible saber cuánto cuesta de verdad usar estas herramientas ni por qué los precios hacen las cosas raras que hacen.
Qué es exactamente un token
Un modelo de lenguaje no lee texto como tú. Antes de procesarlo, un programa llamado tokenizador trocea todo lo que escribes en fragmentos que el modelo conoce, sacados de un diccionario de decenas de miles de piezas construido mirando qué combinaciones de letras aparecen más en internet. Las palabras muy comunes ("casa", "the", "para") suelen ser un token entero; las raras o largas se parten en varios ("electroencefalografista" pueden ser seis o siete trozos).
La regla rápida para español: una palabra son 1,3 tokens de media, o al revés, un token son unas tres cuartas partes de palabra. Un folio de texto ronda los 650 tokens. Esta guía entera, unos 1.800.
¿Por qué no cobran por palabras, que sería más fácil de entender? Porque el token es la unidad física del negocio: el modelo genera su respuesta token a token, como quien escribe a golpes de tecla, y cada golpe consume una fracción medible de tiempo de GPU. Cobrar por token es cobrar por el trabajo exacto de la máquina. Todo lo demás (mensajes, consultas, "usos") son envoltorios comerciales encima de esa contabilidad.
Por qué la salida cuesta el triple (o más)
Mira cualquier tarifa y verás dos precios: GPT-6 Astra y Claude Fable 5.1 cuestan ambos 10 dólares por millón de tokens de entrada y 50 por el de salida. Cinco veces más por salir que por entrar, y no es capricho: leer tu pregunta lo hace el modelo en paralelo, de una pasada, mientras que escribir la respuesta es token a token, cada uno esperando al anterior. Generar es mucho más lento y caro que leer, y la tarifa lo refleja.
De ahí sale una consecuencia práctica que casi nadie aplica: la forma más eficaz de abaratar la IA es pedir respuestas cortas. Un "responde en una línea" ahorra más dinero que cualquier cambio de modelo. Los modelos que "razonan" también quedan explicados: ese pensamiento previo son tokens de salida que pagas aunque no los veas, y por eso el modo razonamiento intensivo de cualquier modelo dispara la factura.
La caché, el descuento del que nadie habla
El tercer precio de las tarifas, el que va en letra pequeña, es la lectura de caché: lo que cuesta que el modelo relea contexto que ya procesó antes (tus instrucciones fijas, el documento sobre el que llevas veinte preguntas, el historial de la conversación). Como ese trabajo ya está hecho y guardado, se cobra a una fracción del precio de entrada.
Y ahí se esconden las rebajas de verdad. Cuando Anthropic bajó la lectura de caché un 75% con Fable 5.1, el titular de tarifas no se movió y sin embargo el trabajo agéntico se abarató casi a la mitad, porque en tareas largas la mayoría de la factura es releer contexto. Regla para leer tarifas como un profesional: el precio de entrada y salida te dice lo que cuesta charlar; el de caché, lo que cuesta trabajar.
Por qué el español paga un impuesto invisible
Los diccionarios de los tokenizadores se construyeron principalmente con texto en inglés, así que el inglés se comprime mejor: sus palabras comunes suelen ser un token limpio, mientras que el español, con sus conjugaciones y sus palabras más largas, se trocea más. El mismo texto gasta entre un 10% y un 25% más de tokens en español que en inglés, según el modelo.
En una suscripción de tarifa plana no lo notas. Por API, un negocio que procese español paga ese sobrecoste en cada llamada. Y en los límites de las versiones gratis, tu cuota se agota antes que la de un usuario en inglés con el mismo uso. No hay solución (no vas a escribirle en inglés a tu asistente para ahorrar), pero explica una asimetría que casi nadie cuenta: la IA es estructuralmente más barata para quien trabaja en inglés.
El contexto también son tokens
La "ventana de contexto" que presumen los modelos (un millón de tokens en los grandes) es simplemente cuánto texto caben en su memoria de trabajo, medida en la misma unidad. Y tiene la misma trampa contable: todo lo que metes en la ventana se procesa, y lo que se procesa se paga. Subir un PDF de 300 páginas para preguntar una cosa que estaba en la página 12 es pagar 200.000 tokens de lectura por una respuesta de 50. Con la caché duele menos si vas a hacer muchas preguntas al mismo documento; para una consulta suelta, recortar el contexto al trozo relevante es dinero directo al bolsillo.
Los precios "de oferta" también cobran sentido con la unidad clara: el Gemini 3.8 Flash a 0,75 dólares por millón de tokens es una decimotercera parte del precio de la gama alta. Para resumir correos da igual el modelo; para razonamiento largo, no. Saber qué tarea necesita qué modelo es, literalmente, la diferencia entre céntimos y euros.
La lectura sin humo
El token no es jerga: es el precio de la luz de esta tecnología, y quien no lo entiende firma la factura a ciegas. Lo esencial cabe en cuatro reglas. Uno: pides corto, pagas menos, porque la salida es lo caro. Dos: si repites contexto, la caché es tu tarifa nocturna. Tres: el español paga un recargo silencioso que no puedes evitar pero sí conviene conocer. Y cuatro: cuando un titular anuncie una bajada de precios, mira siempre cuál de los tres precios bajó, porque no es lo mismo abaratar la charla que abaratar el trabajo.
Si después de esto quieres números concretos de cada suscripción, cuánto cuesta cada IA los tiene al día. Y si lo tuyo son las versiones gratis, las mejores IA gratis en 2026 explica qué incluye cada una, ahora ya sabiendo en qué moneda te están racionando.
¿Te ha servido? Recíbelo cada día.
Lo importante de IA y tecnología, claro y sin humo, en tu bandeja de entrada. Gratis.
/ Más guías

Cuánto cuesta cada IA (ChatGPT, Claude, Gemini y Copilot)
Todos los precios de la IA en una página: qué incluye cada plan gratis, cuándo compensa pagar 20 € al mes y cuánto cuesta la API por millón de tokens. Comparados, verificados cada mes y sin humo.
Por DidadoY

Las mejores IA gratis en 2026 y para qué sirve cada una
ChatGPT ya no limita los mensajes de texto gratis, Gemini regala más que nadie, Claude escribe mejor pero con tope diario y DeepSeek lo da todo sin pagar. Comparamos lo que incluye de verdad cada plan gratis en 2026 y cuál usar según la tarea, sin que te cuelen la suscripción.
Por DidadoY

Cómo leer un benchmark de IA sin que te la cuelen
Cada semana un modelo nuevo bate un récord en algo. Esta guía explica qué mide de verdad un benchmark, los trucos habituales para inflar resultados (contaminación, configuraciones a medida, versiones que nunca pruebas tú) y una lista de comprobaciones para distinguir un avance real del marketing.
Por DidadoY