Tabla de contenido
Números de marketing de IA: enseña a leer la letra chica
Números de marketing de IA: usa el famoso 54% de eficiencia en tokens como clase de alfabetización mediática, con cinco preguntas que separan el dato del humo.
“54% más eficiente en tokens.” Lo dijo Sam Altman sobre GPT-5.6 Sol en julio de 2026, la prensa tecnológica lo repitió y casi nadie hizo la pregunta obvia: ¿más eficiente que qué, medido cómo, en cuál tarea? La respuesta resulta ser específica y en buena medida defendible, y por eso es tan buena clase. Enseñar a leer números de marketing de IA funciona mejor con una afirmación parcialmente verdadera, porque la habilidad no es detectar mentiras. Es encontrar el borde de lo que un número abarca.
Tu hijo ya lee números así todos los días, en anuncios de juegos, etiquetas de suplementos y notas del colegio.
Puntos clave
- La afirmación precisa, de la cuenta de desarrolladores de OpenAI, es que GPT-5.6 Sol con razonamiento máximo llegó a 80 en el índice de agentes de código de Artificial Analysis “usando 54% menos tokens de salida y completando tareas en 57% menos tiempo que el siguiente modelo mejor puntuado”.
- Eso es una comparación contra un modelo competidor, en un benchmark, con un arnés de pruebas; no una afirmación general sobre eficiencia.
- La medición independiente de Artificial Analysis mostró a Sol usando unos 15.000 tokens por tarea del índice de inteligencia contra 16.000 de GPT-5.5: cerca de 6% de mejora en otra medida.
- Cinco preguntas, comparado con qué, medido por quién, en cuál tarea, en cuántas corridas y si aplica en mi configuración, atrapan casi cualquier afirmación inflada.
- Los chicos necesitan esta habilidad: Breakstone et al. (2021) encontró que el 96% de 3.446 estudiantes de secundaria no notó los vínculos de un sitio de “información climática” con la industria de combustibles fósiles.
Números de marketing de IA: la frase desarmada palabra por palabra
Arranca por el texto exacto, porque la versión vaga es la que viaja. La cobertura del lanzamiento de GPT-5.6 del 9 de julio de 2026 llevó la frase de Altman sobre que Sol es 54% más eficiente en tokens para tareas de programación. La cuenta de desarrolladores de OpenAI fue más precisa: en el índice de agentes de código de Artificial Analysis, “Sol con razonamiento máximo marca un nuevo récord de 80 usando 54% menos tokens de salida y completando tareas en 57% menos tiempo que el siguiente modelo mejor puntuado”.
Ahora el desarme, cláusula por cláusula.
“54% menos tokens de salida” es una cantidad específica y medible. Los tokens de salida son lo que el modelo escribe, incluido su razonamiento, y son la mitad cara de una cuenta de API. Menos tokens de salida para el mismo puntaje es un logro de ingeniería real, no una sensación.
“que el siguiente modelo mejor puntuado” es la comparación, y está haciendo mucho trabajo. El siguiente mejor en ese índice era Claude Fable 5. Así que la afirmación es sobre un competidor, no sobre el promedio del campo.
“en el índice de agentes de código de Artificial Analysis” es el alcance. Tareas de agentes de programación. No escritura, no tutoría de matemáticas, no comprensión de lectura. Un 54% menos de tokens programando no dice nada sobre cuántos tokens gasta el modelo explicando fracciones.
“con razonamiento máximo” es la configuración. El número aplica al nivel de esfuerzo más alto, que es la configuración más cara. Una familia usando el mismo modelo en ajustes por defecto obtiene otros números.
“marca un nuevo récord de 80” es el titular, y la versión honesta es que 80 quedó 2,8 puntos sobre Fable 5. Mejor, claro. No en otra liga.
¿Entonces la afirmación es verdadera? En su mayoría sí, tal como está escrita y en contexto. ¿Y la versión que va a escuchar tu hijo, “la nueva IA es 54% más eficiente”? No realmente, porque deja caer las cuatro condiciones.
Qué mostró una medición independiente
Esta es la parte que hace aterrizar la clase. Artificial Analysis publicó su propia evaluación el mismo día y, en otra métrica, tokens por tarea del índice de inteligencia, Sol usó unos 15.000 tokens contra 16.000 de GPT-5.5. Eso es cerca de 6% de mejora.
Los dos números son reales. Miden cosas distintas: el de OpenAI compara a Sol con un competidor en un índice de agentes de código; el independiente compara a Sol con su propio antecesor en un índice general de inteligencia. Un chico que puede sostener los dos en la cabeza, sin concluir “entonces todo era mentira”, ya adquirió la habilidad.
El mismo patrón aparece en todo el marketing de IA. Anthropic reportó 52,6% para Claude Fable 5.1 en Terminal-Bench-Science en septiembre de 2026, mientras la tabla pública listaba 21,4% y 30,0% para configuraciones muy parecidas, porque el arnés y el esfuerzo cambian. La cobertura de VentureBeat lo dijo sin rodeos: los resultados del proveedor “no son prueba independiente de superioridad” y “los resguardos de producción pueden afectar los puntajes”. Fíjate que el matiz honesto vino de la prensa especializada, no del comunicado.
Cómo enseñarle esto a tu hijo
De 5 a 8 años: el juego del “¿más que qué?”
Cada vez que un empaque o un anuncio diga “más”, “más rápido” o “mejor”, pregúntale a tu hijo: ¿más que qué? Las cajas de cereal son material de entrenamiento perfecto. Hazlo una semana y un niño de cinco años va a empezar a preguntarlo solo, que es el objetivo. Los números necesitan una pareja con quien compararse, y casi todos los anuncios esconden a la pareja.
De 9 a 12 años: hacer un cartel engañoso a propósito
Dale un hecho verdadero sobre sí mismo y que escriba tres titulares: uno honesto, uno que exagere sin mentir y uno falso. Hecho de ejemplo: corrió un kilómetro 20 segundos más rápido que el mes pasado. Honesto: “mejoró 20 segundos”. Exagerado pero no falso: “corredor dramáticamente más rápido”. Falso: “el más rápido del colegio”. Después que explique por qué el del medio es el peligroso. Los niños que construyeron el truco lo reconocen después.
De 13 en adelante: auditar una afirmación real
Entrégale a tu adolescente la frase del 54% y las cinco preguntas de abajo. Que escriba un veredicto de un párrafo: qué sostiene la afirmación, qué no, y qué necesitaría para verificarla. Después muéstrale el dato de 15.000 contra 16.000 tokens de Artificial Analysis y pregúntale si contradice el 54%. La respuesta correcta es no, y descubrir por qué es toda la lección sobre alcance y medición.
La pregunta que debes hacer: “Este número es verdadero. ¿Qué creería equivocadamente alguien que solo escuchó la versión corta?”
Las cinco preguntas, aplicadas a afirmaciones reales de 2026
| Afirmación | Pregunta a hacer | Qué revela la respuesta |
|---|---|---|
| ”54% más eficiente en tokens” (GPT-5.6 Sol) | ¿Comparado con qué, en cuál tarea, con qué configuración? | Contra un competidor, en un índice de agentes de código, con razonamiento máximo |
| ”Cerca de la frontera a la mitad del precio” (Claude Opus 5) | ¿La mitad del precio de qué, y cerca en cuál benchmark? | US$5/US$25 contra los US$10/US$50 de Fable 5; a 0,5% en CursorBench con esfuerzo máximo |
| ”52,6% en Terminal-Bench-Science” (Fable 5.1) | ¿Quién corrió la prueba y con qué arnés? | El arnés propio de Anthropic; la tabla pública lista cifras más bajas para configuraciones similares |
| ”La mitad del precio de su antecesor” (Gemini 3.7 Flash) | ¿Por cuánto tiempo? | Precio de introducción que vence el 31 de diciembre de 2026 y luego se duplica |
| ”El modelo más alineado hasta la fecha” (Claude Opus 5) | ¿Alineado según qué medición? | Un puntaje de 2,3 en la auditoría automatizada de comportamiento de Anthropic |
| ”Un tutor de IA duplicó el aprendizaje” (Kestin et al. 2025) | ¿Cuál era el grupo de control? | Un salón de aprendizaje activo, que ya es la mejor práctica, lo que hace el resultado más fuerte, no más débil |
Mira la última fila, porque corre en la otra dirección. A veces el contexto completo hace una afirmación más impresionante, no menos. En Kestin et al. (2025), en Scientific Reports, 194 estudiantes de física de Harvard con un tutor de IA bien diseñado mostraron ganancias medianas de más del doble que el control, y el control era un salón de aprendizaje activo, no una clase magistral. Preguntar “¿comparado con qué?” no es una forma de desmentir. Es una forma de averiguar.
¿Y en América Latina?
Hay un dato regional que vale como ejercicio para tu hijo. La OCDE reportó, vía Pulzo, que el 56% de los estudiantes colombianos usa IA semanalmente para aprender, por encima del 46% promedio de la OCDE. Titular fácil: “Colombia lidera el uso de IA en educación”. Ahora aplica las cinco preguntas: ¿comparado con qué? Con el promedio OCDE, no con Singapur (66%) ni Vietnam (69%). ¿Medido cómo? Por autodeclaración de los propios estudiantes en un cuestionario. ¿Y qué no dice el número? Que el mismo reporte señaló que el 63% de esos estudiantes asiste a colegios sin materiales educativos suficientes, contra 44% en 2022.
Ese es el ejercicio completo, con un dato de la región y en un solo párrafo: liderar en uso no es liderar en aprendizaje. Infobae reportó que Argentina cayó a 367 puntos en matemáticas y México a 388, los peores resultados de ambos desde 2006. Un adolescente que puede sostener las dos cosas, uso alto y resultados bajos, sin elegir el titular que le conviene, ya sabe leer estadística pública.
Por qué vale el esfuerzo enseñar esto
La evidencia sobre cómo evalúan los chicos las afirmaciones en línea no es alentadora. Breakstone, Smith, Wineburg et al. (2021), en Educational Researcher, evaluó a 3.446 estudiantes de secundaria con internet abierto. El 96% nunca descubrió que un sitio que afirmaba publicar reportes factuales sobre el clima tenía vínculos con la industria de combustibles fósiles. Dos tercios no pudieron distinguir noticias de anuncios en una página de inicio. Más de la mitad juzgó que un video anónimo grabado en Rusia era evidencia sólida de fraude electoral en Estados Unidos.
Esos estudiantes tenían internet delante. Lo que faltaba no era acceso: era el hábito de preguntar quién me lo está diciendo y cómo lo sabría.
Las afirmaciones de IA son material de práctica inusualmente bueno por dos razones. Son cuantitativas, así que las condiciones se pueden encontrar en vez de discutir. Y son verificables, porque evaluadores independientes como Artificial Analysis y las tablas públicas publican sus propios números. Un adolescente puede resolver la pregunta de verdad, algo que casi nunca pasa con las afirmaciones políticas. Si quieres el fondo técnico de qué es un token, está en cómo funcionan los modelos de IA, y el caso del benchmark científico está en cómo se califica a la IA en ciencia.
Qué observar en los próximos 3 meses
- Semana 4: Cacen juntos una afirmación de IA en su hábitat, en una ficha de la tienda de apps o en un anuncio de YouTube, y córranle las cinco preguntas.
- Señales de alerta en el mes 2: Que tu hijo repita un porcentaje sin grupo de comparación; que cite un hallazgo sin nombrar al investigador; que confunda el número de un fabricante con una prueba independiente.
- Autoevaluación del mes 3: Van a salir modelos nuevos con récords nuevos. Pídele a tu hijo que prediga cuál va a ser la condición escondida antes de leer el anuncio juntos. Cuando acierte seguido, la habilidad quedó.
Preguntas frecuentes
¿La afirmación del “54% más eficiente en tokens” es falsa?
No. La versión precisa, que GPT-5.6 Sol con razonamiento máximo sacó 80 en el índice de agentes de código de Artificial Analysis usando 54% menos tokens de salida que el siguiente mejor modelo, parece correcta. Lo engañoso es la versión corta, que borra el modelo de comparación, el benchmark y el nivel de razonamiento.
¿Por qué una prueba independiente mostró solo cerca de 6%?
Porque midió otra cosa. Artificial Analysis comparó tokens por tarea del índice de inteligencia entre Sol (unos 15.000) y GPT-5.5 (unos 16.000). El número de OpenAI comparaba a Sol con un competidor en un índice de agentes de código. Otra comparación, otra tarea, otro número.
¿Cuáles son las cinco preguntas para cualquier afirmación de IA?
¿Comparado con qué? ¿Medido por quién? ¿En cuál tarea o benchmark? ¿En cuántas corridas? ¿Y aplica en la configuración que yo usaría? Esas cinco cubren casi toda la distancia entre lo que dice una afirmación y lo que la gente entiende.
¿A qué edad se puede aprender esto?
Un niño de cinco años puede aprender “¿más que qué?” con una caja de cereal. De 9 a 12 pueden construir un titular engañoso a propósito. Un adolescente puede auditar una afirmación real contra una fuente independiente. La habilidad escala; solo cambia el material.
¿Las empresas de IA son especialmente deshonestas con los números?
No especialmente. Sus afirmaciones suelen ser más verificables que el promedio de la industria, porque los benchmarks son públicos y hay evaluadores independientes. El problema es que las condiciones son técnicas, así que la prensa las recorta, y la versión recortada es la que circula.
¿Cómo verifico yo mismo una afirmación de benchmark?
Busca el sitio y la tabla del propio benchmark, fíjate en el arnés y el nivel de esfuerzo anotados junto a cada puntaje, y compara la cifra del fabricante con la de la tabla. Si el número del fabricante es mucho más alto, normalmente la configuración lo explica, y la configuración es parte de la afirmación.
Sobre el autor
Ricky Flores es el fundador de HiWave Makers e ingeniero eléctrico con más de 15 años de experiencia desarrollando tecnología de consumo en Apple, Samsung y Texas Instruments. Escribe sobre cómo los niños aprenden a construir, pensar y crear en un mundo saturado de tecnología. Lee más en hiwavemakers.com.
Fuentes
- TechCrunch. (2026, 9 de julio). “OpenAI launches its new family of models with GPT-5.6.” https://techcrunch.com/2026/07/09/openai-launches-its-new-family-of-models-with-gpt-5-6/
- Artificial Analysis. (2026, 9 de julio). “GPT-5.6 benchmarks across Intelligence, Speed and Cost.” https://artificialanalysis.ai/articles/gpt-5-6-has-landed
- OpenAI. (2026, 9 de julio). “GPT-5.6: Frontier intelligence that scales with your ambition.” https://openai.com/index/gpt-5-6/
- Anthropic. (2026, 24 de julio). “Introducing Claude Opus 5.” https://www.anthropic.com/news/claude-opus-5
- Breakstone, J., Smith, M., Wineburg, S., et al. (2021). “Students’ Civic Online Reasoning: A National Portrait.” Educational Researcher, 50(8), 505–515. https://journals.sagepub.com/doi/10.3102/0013189X211017495
- Kestin, G., Miller, K., Klales, A., et al. (2025). “AI tutoring outperforms in-class active learning.” Scientific Reports. https://www.nature.com/articles/s41598-025-97652-6
- Pulzo. (2026, 8 de septiembre). “Estudiantes en Colombia lideran uso de IA, según la OCDE.” https://www.pulzo.com/tecnologia/inteligencia-artificial-en-la-educacion-estudiantes-en-colombia-lideran-uso-de-ia-segun-la-ocde-PP5296043A
- Infobae. (2026, 8 de septiembre). “Pruebas PISA: los países de América Latina profundizan su retroceso educativo.” https://www.infobae.com/america/america-latina/2026/09/08/pruebas-pisa-los-paises-de-america-latina-profundizan-su-retroceso-educativo/
- OCDE. (2026, 8 de septiembre). “PISA 2025 Results (Volume I).” https://www.oecd.org/en/publications/pisa-2025-results-volume-i_73451bc5-en.html