Qué son los tokens de IA y por qué el precio es por millón
Tabla de contenido

Qué son los tokens de IA y por qué el precio es por millón

Qué son los tokens de IA con precios reales de 2026: cuánto cuesta leer y escribir, por qué salida cuesta cinco veces más y cómo enseñar la cuenta en casa.

Qué son los tokens de IA se entiende mejor con el número concreto: Claude Opus 5, lanzado el 24 de julio de 2026, cuesta 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida. Un token no es una palabra. Es un trozo de texto, aproximadamente cuatro caracteres o unas tres cuartas partes de una palabra en inglés. Así que un millón de tokens son unas 750.000 palabras, o diez novelas decentes.

Esa proporción de 1 a 5 entre leer y escribir es el dato más útil que una familia puede tener sobre precios de IA. Significa que pedirle a un modelo que lea un documento largo es barato. Pedirle que produzca un documento largo es caro. A casi todo el mundo la intuición le funciona al revés.

Puntos clave

  • Un token es un trozo de texto que produce un tokenizador, aproximadamente 4 caracteres o 0,75 palabras en inglés. Los modelos procesan tokens, no palabras ni letras.
  • Claude Opus 5 cuesta 5 dólares por millón de tokens de entrada y 25 por millón de salida. Fable 5.1 cuesta 10 y 50. Haiku 4.5 cuesta 1 y 5.
  • La salida cuesta consistentemente cinco veces la entrada en todos los niveles, porque generar texto requiere una pasada completa por token mientras que leerlo se puede procesar en paralelo.
  • Los tokenizadores difieren entre modelos. La documentación de Anthropic señala que Claude 4.7 y posteriores usan un tokenizador nuevo que produce cerca de 30% más tokens para el mismo texto, lo que cambia la cuenta aun con precios idénticos.
  • La razón por la que la IA no puede contar las letras de una palabra es la tokenización: ve trozos, no caracteres. Es un gran momento didáctico y una limitación real.

Qué es un token en realidad

Un tokenizador es un programa que corta el texto en piezas que el modelo puede manejar. Corre antes de que el modelo vea nada. Las piezas que produce son los tokens, y el mundo entero del modelo es una secuencia de ellos.

¿Por qué no usar palabras directamente? Dos razones. Primera, el tamaño del vocabulario. El español tiene cientos de miles de formas, más nombres, errores de tipeo y otros idiomas. El modelo necesitaría una entrada para cada una. Segunda, la generalización. Si “corriendo” y “corre” son entradas sin relación, el modelo tiene que aprender cada una por separado.

La solución, la tokenización por subpalabras, viene del artículo de 2016 de Sennrich, Haddow y Birch sobre codificación por pares de bytes, y corta el texto en trozos frecuentes. Las palabras comunes se vuelven un token. Las raras se parten en pedazos. “Gato” es un token. “Tokenización” quizá sean tres. Un nombre como “Xóchitl” puede ser cuatro o cinco. La puntuación y los espacios también cuentan.

La documentación de precios de Anthropic da la estimación de trabajo: “1 token es aproximadamente 4 caracteres o 0,75 palabras en inglés. El conteo exacto varía según el idioma y el tipo de contenido”.

Esa última frase importa más de lo que parece, y para nosotros importa el doble. Los tokenizadores se entrenan con datos sesgados hacia el inglés, así que el español y el portugués suelen usar más tokens para el mismo significado. Mismo contenido, factura más alta. Ojo con esto si pagas en dólares.

Y aquí está el hecho que explica una conducta que tu hijo seguro notó: los modelos son malos contando las letras de una palabra, o diciéndote cuántas r tiene “ferrocarril”, porque no ven letras. Ven trozos. Pedirle a un modelo que cuente caracteres es como pedirle a alguien que lee un libro a través de un montón de fichas que cuente trazos de lápiz individuales.

Por qué la salida cuesta cinco veces la entrada

Mira la tabla de precios publicada y el patrón es inconfundible:

Opus 5: 5 de entrada, 25 de salida. Fable 5.1: 10 y 50. Sonnet 5: 2 y 10. Haiku 4.5: 1 y 5. Todos los niveles mantienen la proporción de 1 a 5.

La razón mecánica está en cómo funcionan los transformers. Cuando mandas una entrada, el modelo puede procesar todo el pedido en paralelo; todos esos tokens pasan juntos por la red en una pasada. Cuando el modelo genera salida, produce un token a la vez, y cada token nuevo requiere otra pasada por la red completa, porque depende de todo lo generado antes. Generar 1.000 tokens significa 1.000 pasadas secuenciales. Leer 1.000 tokens significa aproximadamente una.

Las consecuencias para una familia que usa IA:

Leer es barato. Pegar un PDF de 20 páginas y hacer una pregunta cuesta muy poco. Unos 10.000 tokens de entrada a tarifa de Opus 5 son cinco centavos de dólar.

Escribir es caro. Pedir un ensayo de 3.000 palabras genera unos 4.000 tokens de salida, que a 25 dólares el millón son diez centavos. Los niveles baratos cambian la aritmética: el resumen de Google de agosto de 2026 puso a Gemini 3.7 Flash a la mitad del precio por token del nivel anterior. Suena poco hasta que son 30 estudiantes haciéndolo a diario.

Pensar es salida. Esta es la que se le escapa a todo el mundo. La deliberación interna de un modelo de razonamiento son tokens generados, facturados como salida. Un modelo que piensa 40 minutos en un problema difícil puede producir decenas de miles de tokens de salida antes de escribir su respuesta.

El historial de la conversación se acumula. Cada turno reenvía toda la conversación previa como entrada. El turno 20 de un chat manda de nuevo todo del turno 1 al 19. Es barato por turno y se suma, que es exactamente la razón por la que existe el caché de prompts.

El cambio de tokenizador que nadie menciona

Hay un detalle en la documentación de Anthropic con consecuencias financieras reales: “Claude 4.7 y modelos posteriores y Claude Mythos Preview usan un tokenizador más nuevo que contribuye a su mejor desempeño en una amplia gama de tareas. Este tokenizador produce aproximadamente 30% más tokens para el mismo texto”.

Léelo con cuidado. Mismo texto, 30% más tokens. Así que incluso con precios de lista idénticos, un modelo más nuevo puede costar más por página de contenido real. El cambio de tokenizador compró mejor desempeño y un conteo de tokens más alto para la misma entrada.

Esto es genuinamente útil de entender, porque significa que “precio por millón de tokens” no es directamente comparable entre modelos con tokenizadores distintos. Cuando Sam Altman dijo que GPT-5.6 Sol era “54% más eficiente en tokens” para programar, esa es una afirmación sobre el mismo eje desde el otro lado.

El resumen honesto para un papá: el precio de lista es uno de dos números que determinan tu factura, y el otro, tokens por página de tu contenido real, casi nunca se publica.

¿Y en América Latina?

El efecto del idioma es el ángulo regional más concreto de todo este tema. Como los tokenizadores se entrenan con datos mayoritariamente en inglés, el mismo párrafo escrito en español suele consumir más tokens que su traducción al inglés. Eso significa que una familia en Bogotá, Lima o Guadalajara que paga por uso en dólares está pagando una prima silenciosa por trabajar en su propio idioma. No es una conspiración; es una consecuencia técnica de cómo se construyó el vocabulario.

Hay dos cosas prácticas que salen de ahí. Primera: si tu hijo usa un nivel gratuito con límite de mensajes, ese límite se agota más rápido en español de lo que se agotaría en inglés para el mismo trabajo. Segunda: pedir respuestas cortas (“responde en tres oraciones”) ahorra más aquí que en inglés, porque cada palabra de salida en español pesa más en tokens.

También vale mirarlo desde la escuela. Cuando una secretaría de educación evalúa una herramienta de IA para miles de estudiantes, el cálculo de tokens es el cálculo del presupuesto. La aritmética que le enseñes a tu hijo esta semana es, literalmente, la misma que hace un funcionario decidiendo si el programa alcanza para todo el estado.

Cómo enseñarle esto a tu hijo

Los tokens son un problema de contar, lo que los vuelve ideales para niños. Todo aquí se hace con papel.

De 5 a 8 años: cortar la oración

Escribe una oración corta en papel: “El gato se sentó en el tapete”. Córtala en palabras con tijeras. Cuenten las piezas: siete. Ahora escribe una palabra larga, como “increíblemente”, y córtala en tres trozos: “in”, “creíble”, “mente”. Dile: “Las computadoras leen así. Cortan todo en pedacitos y los cuentan. Las palabras grandes se vuelven más pedazos”. Después pregúntale cuántos pedazos tiene su propio nombre. Lo cortará en dos o tres, que es exactamente lo que hace un tokenizador con nombres poco comunes.

De 9 a 12 años: la regla de los cuatro caracteres

Dale a tu hijo un párrafo de un libro, unas 100 palabras. Que cuente los caracteres incluyendo espacios (o que lo estime: alrededor de 5,5 caracteres por palabra). Que divida entre 4. Ese es el conteo aproximado de tokens, y debería caer cerca de 130 o 140 para un párrafo de 100 palabras. Ahora la cuenta: a 25 dólares por millón de tokens de salida, ¿cuánto costaría que la IA escribiera ese párrafo? (Como un tercio de un centavo.) Y luego: ¿cuántos párrafos antes de que cueste un dólar? Unos 300. Un niño que hace esta división una vez nunca más piensa que la IA es gratis.

De 13 en adelante: medir la proporción entrada-salida

Que tu hijo haga un experimento real. Toma un artículo largo. Tarea A: pedirle a una IA que lo resuma en tres oraciones. Tarea B: pedirle que escriba un ensayo de 1.000 palabras sobre el mismo tema. Que estime los tokens de ambas (entrada y salida por separado, con la regla de los 4 caracteres) y calcule el costo a tarifa de Opus 5. Va a encontrar que la tarea A está dominada por la entrada y cuesta poco; la B está dominada por la salida y cuesta más aunque el pedido sea más corto. Después que busque la nota del tokenizador en la página de precios y explique por qué dos modelos al mismo precio de lista pueden costar distinto.

La pregunta que debes hacer: “¿Esta tarea es sobre todo leer o sobre todo escribir? ¿Cuál cuesta más?”

De texto a tokens a dólares: tabla trabajada

TextoCaracteres aprox.Tokens aprox.Como entrada en Opus 5 (5 USD/M)Como salida en Opus 5 (25 USD/M)
“gato”410,000005 USD0,000025 USD
Una oración corta (~140 caracteres)140~350,00018 USD0,00088 USD
Un párrafo (~100 palabras)~550~1400,0007 USD0,0035 USD
Un ensayo de 5 páginas (~2.500 palabras)~13.750~3.4000,017 USD0,086 USD
Una novela de 300 páginas (~90.000 palabras)~495.000~124.0000,62 USD3,10 USD
Un millón de tokens~4.000.0001.000.0005,00 USD25,00 USD

Tarifas del precio publicado por Anthropic para Claude Opus 5. Los conteos usan la estimación documentada de 4 caracteres por token y varían según contenido y tokenizador. En español, espera conteos algo mayores.

Fíjate en la fila de la novela. Darle a un modelo un libro entero de 300 páginas para leer cuesta unos 62 centavos. Pedirle que escriba uno cuesta más de tres dólares, y tardaría horas. La asimetría es la lección.

Qué hacer en casa

Pide salidas más cortas a propósito

“Responde en tres oraciones” no solo es bueno para la comprensión. Es control de costo directo, porque la salida cuesta cinco veces la entrada. Enseñarle a un niño a especificar la extensión es enseñarle a ser mejor usuario y más económico.

Pega generoso, pregunta conciso

Si tu hijo todavía no tiene claro qué hace el modelo con esos tokens, nuestra guía sobre cómo funciona ChatGPT es el paso previo. Si trabaja con un documento fuente, que pegue todo. La entrada es barata y anclar la respuesta en el texto real reduce errores. Después que haga una pregunta angosta. Es lo contrario de lo que hace la mayoría.

Cuidado con los modos de pensamiento en tareas largas

Un ajuste de esfuerzo alto genera muchos tokens de salida antes de contestar. En un plan pago eso es dinero real. Úsalo cuando el problema lo necesite y bájalo para trabajo rutinario.

Haz la división una vez

Siéntate con tu hijo y calculen qué cuesta en tokens el uso de IA de tu familia durante una semana. Es la misma aritmética de cómo funcionan los modelos de IA: pesos, tokens y predicción, pero aplicada a tu factura. Toma quince minutos y cambia de forma permanente cómo piensan los dos sobre “solo preguntarle a la IA”. La mayoría de las familias encuentra el número sorprendentemente bajo, lo cual también es información útil.

Lo que no debes hacer

No le digas a tu hijo que un token es una palabra. Es suficientemente cercano para estimar y está equivocado justo donde importa: es la razón de que el modelo no pueda contar letras, de que el texto en español cueste más y de que dos modelos al mismo precio facturen distinto. El concepto de trozo es apenas más difícil y explica conductas reales.

Qué observar en los próximos 3 meses

  • Semana 4: tu hijo puede estimar los tokens de un párrafo con la regla de los 4 caracteres y sabe que la salida cuesta más que la entrada.
  • Señales de alerta en el mes 2: pide respuestas de extensión máxima por defecto. O se confunde cuando el modelo cuenta mal las letras de una palabra y cree que el modelo está roto.
  • Autoevaluación del mes 3: dale dos tareas y pregúntale cuál costará más. Si razona desde entrada contra salida y no desde qué tan difícil suena la tarea, lo entendió.

Preguntas frecuentes

¿Cuántas palabras hay en un millón de tokens?

Unas 750.000 palabras en inglés, usando la estimación documentada de 0,75 palabras por token. Eso son aproximadamente diez novelas. El conteo varía según el idioma, y el texto en español normalmente usa más tokens para el mismo significado.

¿Por qué la salida es más cara que la entrada?

Porque la generación es secuencial. Cada token de salida requiere una pasada completa por la red y depende de todos los anteriores, mientras que un pedido de entrada se puede procesar en paralelo en aproximadamente una pasada. En los niveles de Claude, la salida cuesta cinco veces la entrada.

¿Por qué la IA no puede contar las letras de una palabra?

Porque nunca ve letras. El tokenizador corta el texto en trozos antes de que el modelo lo lea, así que el modelo procesa algo como “ferro” más “carril” en lugar de once caracteres. Las tareas a nivel de carácter son genuinamente incómodas para modelos basados en tokens.

¿El mismo texto siempre produce la misma cantidad de tokens?

No. Distintos modelos usan distintos tokenizadores. La documentación de Anthropic señala que Claude 4.7 y posteriores usan un tokenizador nuevo que produce cerca de 30% más tokens para el mismo texto que los modelos anteriores. Así que precios de lista idénticos pueden significar costos reales distintos.

¿Debo preocuparme por el costo de tokens en la tarea de mi hijo?

Normalmente no, con el volumen típico de una casa. Un ensayo de cinco páginas generado a tarifa de Opus 5 cuesta menos de diez centavos. Los costos que sorprenden son las sesiones largas de razonamiento, las tareas de agentes que corren un rato y las suscripciones de consumidor donde pagas una tarifa fija igual. Entender los tokens te dice en cuál situación estás.


Sobre el autor

Ricky Flores es el fundador de HiWave Makers e ingeniero eléctrico con más de 15 años de experiencia desarrollando tecnología de consumo en Apple, Samsung y Texas Instruments. Escribe sobre cómo los niños aprenden a construir, pensar y crear en un mundo saturado de tecnología. Lee más en hiwavemakers.com.


Fuentes

  1. Anthropic. (2026). “Pricing.” Claude Platform Documentation. https://platform.claude.com/docs/en/about-claude/pricing
  2. Gizmodo. (2026, 24 de julio). “Anthropic releases new Claude model, positions it as a cost-efficient version of Fable 5.” https://gizmodo.com/anthropic-releases-new-claude-model-positions-it-as-a-cost-efficient-version-of-fable-5-2000790486
  3. Sennrich, R., Haddow, B., y Birch, A. (2016). “Neural Machine Translation of Rare Words with Subword Units.” Proceedings of ACL 2016. https://arxiv.org/abs/1508.07909
  4. Anthropic. (2026). “Prompt caching.” Claude Platform Documentation. https://platform.claude.com/docs/en/build-with-claude/prompt-caching
  5. OpenAI. (2026, 9 de julio). “GPT-5.6.” https://openai.com/index/gpt-5-6/
  6. Google. (2026, agosto). “Google AI updates, August 2026.” The Keyword. https://blog.google/innovation-and-ai/technology/google-ai-updates-august-2026/
  7. MarkTechPost. (2026, 1 de septiembre). “Anthropic releases Claude Fable 5.1 and Claude Mythos 5.1.” https://www.marktechpost.com/2026/09/01/anthropic-releases-claude-fable-5-1-and-claude-mythos-5-1-52-6-on-terminal-bench-science-and-75-cheaper-cache-reads/
Ricky Flores
Escrito por Ricky Flores

Fundador de HiWave Makers e ingeniero eléctrico con más de 15 años trabajando en proyectos con Apple, Samsung, Texas Instruments y otras empresas Fortune 500. Escribe sobre cómo los niños aprenden a construir, pensar y crear en un mundo impulsado por la tecnología.