Tasa de éxito de la IA: enseñar confiabilidad con dados
Tabla de contenido

Tasa de éxito de la IA: enseñar confiabilidad con dados

La tasa de éxito de la IA fue del 50% en un problema matemático famoso. Una lección con dados y monedas sobre por qué el mismo pedido da respuestas distintas.

Para enseñar qué es la tasa de éxito de la IA, hay que empezar por un número. En mayo de 2026, un modelo de OpenAI refutó una conjetura matemática que estaba en pie desde 1946. Sébastien Bubeck, de OpenAI, dijo que el modelo produjo soluciones correctas en cerca del 50% de las corridas con el mismo pedido.

Misma pregunta. Mismo modelo. La mitad bien, la mitad mal. Y nada en la salida te avisa cuál te tocó.

Esa propiedad tiene nombre técnico, pero conviene enseñarla con dados antes de enseñarla con vocabulario.

Puntos clave

  • El modelo que refutó la conjetura de la distancia unitaria de Erdős produjo soluciones correctas en cerca del 50% de las corridas idénticas, según OpenAI.
  • No es un error: los modelos de lenguaje muestrean de distribuciones de probabilidad, así que corridas repetidas difieren aun con la misma entrada.
  • Con 50% por corrida, si corres tres veces y tomas cualquier respuesta correcta, aciertas cerca del 87,5% de las veces. El muestreo cambia la cuenta.
  • El cuello de botella es la verificación, no la generación. Un generador al 50% solo le sirve a quien puede distinguir las dos mitades.
  • La misma propiedad aparece en el chatbot que usa tu hijo para la tarea. Preguntar lo mismo dos veces es un experimento gratis.

Por qué la tasa de éxito de la IA no es una falla

Un modelo de lenguaje no busca una respuesta guardada. Produce texto un token a la vez, y en cada paso tiene una distribución de probabilidad sobre lo que podría venir. A menos que lo fuerces a elegir siempre el token más probable, muestrea. Muestras distintas significan caminos distintos, y en una cadena larga de razonamiento matemático, caminos distintos pueden llevar a conclusiones distintas.

Ese es el mecanismo. Sin misterio ni magia.

Para una pregunta corta y factual, los caminos en general convergen y obtienes la misma respuesta siempre. Para una demostración de 100 páginas, no. Cada paso se compone con el anterior, y un giro equivocado en el paso 40 envenena todo lo que sigue. Cuanto más larga y abierta la tarea, más varianza ves.

El reporte de Science News es cuidadoso sobre lo que sabemos y lo que no: los datos que respaldan ese 50% “no se han publicado ni revisado por pares” y no se reveló el tiempo de cómputo. Melanie Matchett Wood planteó una preocupación relacionada sobre que OpenAI no divulgara los intentos fallidos. O sea que el 50% es una declaración de la empresa, no una medición verificada de forma independiente, y eso también vale que un chico lo note.

Intentos, éxitos y qué le hace el muestreo a las probabilidades

Esta es la tabla que yo dibujaría para un chico de 12 años. Supón que cada corrida tiene éxito de forma independiente con probabilidad 0,5 y que puedes distinguir una demostración correcta de una incorrecta cuando la ves.

Cantidad de corridasProbabilidad de que al menos una acierteProbabilidad de que todas fallenQué cuesta
150%50%1 unidad de cómputo
275%25%2 unidades
387,5%12,5%3 unidades
596,9%3,1%5 unidades
1099,9%0,1%10 unidades

El supuesto de independencia hace mucho trabajo acá, y quiero marcarlo con honestidad. Las corridas reales no son del todo independientes: comparten sesgos, así que un modelo que entendió mal el problema puede fallar igual diez veces. Toma la tabla como el mejor caso.

Pero la estructura del razonamiento se sostiene, y eso es lo importante: un generador al 50% más un verificador confiable es un sistema fuerte. Un generador al 50% sin verificador es un volado. Por eso la pregunta de la verificación importa más que la de la capacidad. Los métodos están en cómo verifican los matemáticos una demostración de 125 páginas.

Cómo enseñarle esto a tu hijo

Las tres actividades usan dados, monedas o un chatbot que ya tengas.

De 5 a 8 años: la misma pregunta dos veces

Tira un dado y anota el número. Tíralo otra vez y anota. Pregúntale a tu hijo por qué la misma acción dio dos respuestas distintas.

Después haz el equivalente con un chatbot, si tienes: hazle la misma pregunta dos veces, en dos conversaciones separadas, y lean las dos respuestas en voz alta. Señala las diferencias. “Misma pregunta, distinta respuesta” es un concepto que un chico de seis años puede sostener, y lo vacuna contra tratar al chatbot como una máquina de datos.

De 9 a 12 años: monedas y el mejor de tres

Dale una moneda. Cara significa que la IA acertó, cruz que se equivocó. Que tire una vez: va a ver que es un volado. Ahora que tire tres veces y cuente con qué frecuencia sale al menos una cara. Que lo haga veinte veces y lleve la cuenta.

Debería quedar cerca de 17 o 18 de 20, que se acerca al 87,5%. Y después la pregunta del remate: ¿qué necesitas para poder usar el mejor de tres? La respuesta es una forma de distinguir cara de cruz, que en el caso de la IA significa alguien que pueda revisar una demostración. Sin el verificador, tres intentos no te dan nada.

De 13 en adelante: correr el experimento con la tarea

Que tu adolescente elija un problema de matemáticas cuya respuesta ya sepa. Que le haga la misma pregunta a un chatbot en cinco conversaciones nuevas. Que registre cada respuesta y si estuvo bien.

La mayoría espera 5 de 5. Lo que suele obtener es 4 de 5 o 3 de 5 en un problema difícil, y a veces cinco enfoques distintos con resultados finales distintos. Después que calcule su propia tasa de éxito medida. Ese número, salido de su propio experimento, se le va a quedar mejor que cualquier cosa que tú le digas sobre los límites de la IA.

La pregunta que debes hacer: “Si no puedes distinguir una respuesta correcta de una equivocada, ¿cuántos intentos hacen falta para estar seguro?”

Dónde más aparece esto

La pregunta de la confiabilidad no se limita a las demostraciones matemáticas.

La tarea. La encuesta “Teens in the AI Era” de Common Sense Media, publicada el 18 de agosto de 2026 con 1.017 adolescentes estadounidenses de 13 a 17 años, encontró que el 70% usa IA para tareas escolares: el 25% usa la respuesta tal cual, el 31% la reescribe para que suene como ellos y el 35% la mejora con su propio conocimiento. Solo el 27% dijo que un docente le habló alguna vez de uso seguro de IA. Ese 25% que usa la salida tal cual es el más expuesto a la varianza por corrida.

Los benchmarks. En la IMO 2026, varios sistemas sacaron 42/42, pero el arnés importa. Dos fueron corregidos por los organizadores de la IMO; otros cuatro se probaron con un arnés autoadministrado corregido por agentes de IA. Un puntaje perfecto reportado sin decir cuántos intentos hubo es una afirmación mucho más débil.

¿Y en América Latina?

Acá el dato pega en un punto sensible. Según PISA 2025, el 56% de los estudiantes colombianos usa chatbots de IA cada semana para aprender, el 54% en Perú, el 53% en Uruguay y el 52% en Ecuador, todos por encima del 46% promedio de la OCDE. Al mismo tiempo, Colombia reporta 36% de distracción frecuente por tecnología en clase, contra 28% del promedio.

Y el dato que completa el cuadro: la UNESCO calcula que menos del 10% de las instituciones de la región tiene lineamientos formales sobre IA. En Argentina, un informe de Argentinos por la Educación con investigadores del MIT recogió una frase de Diego López Yse que resume el riesgo: “Si la IA puede obtener una calificación en lugar de un estudiante, esa nota ya no certifica aprendizaje”.

Uso alto, enseñanza baja. Ese es exactamente el escenario donde una tasa de éxito del 50% hace daño invisible: el chico entrega la salida sin revisar y la nota no mide nada. Enseñarle a preguntar dos veces y a revisar un paso del medio es, en ese contexto, más valioso que cualquier prohibición.

Qué hacer en casa

Que “preguntar dos veces” sea el hábito por defecto

Si la respuesta de un chatbot importa, que tu hijo pregunte de nuevo en una conversación nueva. Dos respuestas idénticas es evidencia débil de que está bien. Dos respuestas distintas es evidencia fuerte de que una está mal.

Enseña la palabra “borrador”

El replanteo más útil que encontré es llamar a la salida de la IA un borrador y no una respuesta. Los borradores se revisan. Las respuestas se entregan. El vocabulario hace trabajo real.

Pregunta por la revisión, no por el resultado

Cuando tu hijo use IA, la pregunta interesante no es “qué te dijo” sino “cómo lo confirmaste”. Si la respuesta es “sonaba bien”, ahí está el hueco.

Usa el número de confiabilidad como argumento de carrera

Una herramienta que acierta la mitad de las veces vuelve más valiosa, no menos, a la persona que puede distinguir. Es un encuadre más honesto y más motivador que “la IA te va a quitar el trabajo”. Los datos laborales están en si la IA resolviendo problemas matemáticos acaba con las carreras de matemáticas.

Lo que no conviene hacer

No uses el 50% para argumentar que la IA es poco confiable en general. Es una cifra por corrida en un problema de investigación de frontera, que es casi la prueba más difícil posible. En tareas de rutina estos sistemas son mucho más consistentes. La lección es sobre varianza y verificación, no sobre descartar la herramienta.

Qué observar en los próximos 3 meses

  • Semana 4: ¿tu hijo le hace la misma pregunta dos veces a un chatbot cuando la respuesta importa? Ese solo hábito cubre casi todo el terreno.
  • Señales de alerta en el mes 2: trabajo entregado que tu hijo no puede explicar. Es la firma de aceptar una sola corrida sin revisar.
  • Autoevaluación del mes 3: pregúntale cuál fue su tasa de éxito medida en el experimento de cinco corridas. Si recuerda el número, el concepto quedó.

Preguntas frecuentes

¿Por qué la IA da respuestas distintas a la misma pregunta?

Porque muestrea de una distribución de probabilidad en cada paso en vez de buscar una respuesta guardada. Muestras distintas producen caminos de razonamiento distintos, y en tareas largas esos caminos pueden terminar en conclusiones distintas. Las preguntas cortas y factuales suelen converger; las largas y abiertas, no.

¿Qué significa realmente una tasa de éxito del 50%?

Que en corridas repetidas del mismo pedido, cerca de la mitad produjo un resultado correcto. No dice nada sobre si una salida específica es correcta. OpenAI reportó esa cifra para el modelo que refutó la conjetura de la distancia unitaria de Erdős, aunque los datos de base no se publicaron ni se revisaron por pares.

¿Correrlo más veces arregla el problema?

En parte, si puedes distinguir lo correcto de lo incorrecto. Con 50% por corrida y suponiendo independencia, tres corridas dan cerca del 87,5% de probabilidad de que al menos una esté bien. Pero igual tienes que identificar cuál, así que el verificador hace el trabajo real.

¿El chatbot que usa mi hijo para la tarea es así de poco confiable?

En problemas de rutina, no. El 50% aplica a un problema de investigación sin resolver, el caso más difícil. Pero la varianza existe en todos los niveles de dificultad, y por eso vale preguntar dos veces cuando la respuesta importa.

¿Cómo lo explico sin que mi hijo desconfíe de todo?

Preséntalo como una propiedad, no como un defecto. Una regla es exacta; un chatbot es probabilístico. Los dos sirven cuando sabes cuál tienes en la mano. La meta es un chico que revisa, no uno que se niega a usar herramientas.


Sobre el autor

Ricky Flores es el fundador de HiWave Makers e ingeniero eléctrico con más de 15 años de experiencia desarrollando tecnología de consumo en Apple, Samsung y Texas Instruments. Escribe sobre cómo los niños aprenden a construir, pensar y crear en un mundo saturado de tecnología. Lee más en hiwavemakers.com.


Fuentes

  1. Hulick, K. (2026, 8 de junio). “AI guardrails and the Erdős math problem.” Science News. https://www.sciencenews.org/article/ai-guardrails-erdos-math-problem
  2. OpenAI. (2026, 20 de mayo). “An OpenAI model has disproved a central conjecture in discrete geometry.” https://openai.com/index/model-disproves-discrete-geometry-conjecture/
  3. Common Sense Media. (2026, 18 de agosto). “Teens in the AI Era: Schoolwork and Skills That Matter.” https://www.commonsensemedia.org/research/teens-in-the-ai-era-schoolwork-and-skills-that-matter
  4. OECD. (2026). “PISA 2025 Results (Volume I): Future-Ready Students,” capítulo 4. OECD Publishing. https://www.oecd.org/en/publications/pisa-2025-results-volume-i_73451bc5-en.html
  5. Digital Applied. (2026). “IMO 2026 perfect scores and AI benchmark saturation.” https://www.digitalapplied.com/blog/imo-2026-perfect-scores-ai-benchmark-saturation
  6. Argentinos por la Educación y MIT. (2026, 15 de enero). “Inteligencia artificial en la educación: desafíos y perspectivas.” https://www.diariodecuyo.com.ar/argentina/ia-en-las-escuelas-un-informe-destaca-los-beneficios-y-desafios-del-uso-sin-planificacion-1820537.html
  7. UNESCO. (2026). “UNESCO launches Observatory on Artificial Intelligence in Education for Latin America and the Caribbean.” https://www.unesco.org/en/articles/unesco-launches-observatory-artificial-intelligence-education-latin-america-and-caribbean
Ricky Flores
Escrito por Ricky Flores

Fundador de HiWave Makers e ingeniero eléctrico con más de 15 años trabajando en proyectos con Apple, Samsung, Texas Instruments y otras empresas Fortune 500. Escribe sobre cómo los niños aprenden a construir, pensar y crear en un mundo impulsado por la tecnología.