¿Puede la IA hacer matemáticas originales de verdad?
Tabla de contenido

¿Puede la IA hacer matemáticas originales de verdad?

IA y matemáticas originales: tras septiembre de 2026 la respuesta tiene tres capas. Qué se afirmó, qué verificó una máquina y qué nadie ha confirmado todavía.

La pregunta de si la IA puede hacer matemáticas originales tuvo un caso de prueba concreto el 8 de septiembre de 2026, cuando OpenAI publicó una resolución reclamada del problema de Navier–Stokes, uno de los siete Problemas del Premio del Milenio. El reporte de la propia empresa dice que el trabajo “resuelve el problema del Premio del Milenio de Navier–Stokes al establecer la afirmación ‘C’ (y también la ‘D’)”, y que incluyó una formalización en Lean. OpenAI también dijo que “no tiene intención de reclamar el Premio del Milenio por este resultado”.

A octubre de 2026, la entrada de Wikipedia sobre los Problemas del Premio del Milenio dice que la solución “espera validación científica”. Esa frase es la más importante de este artículo.

Puntos clave

  • La afirmación es específica y angosta. Las afirmaciones (C) y (D) son las de ruptura: que existe una condición inicial y una fuerza externa suave para las cuales no existe solución suave. Eso es distinto de decir “las soluciones suaves siempre existen”.
  • La demostración se formalizó en Lean, un asistente de demostración, y OpenAI reportó 17 horas adicionales de verificación con GPT-6 Astra. Que una máquina la revise es una forma real y fuerte de corrección.
  • Revisada por máquina no es aceptada por la comunidad. Las reglas del Clay Mathematics Institute exigen publicación arbitrada, y el Instituto “solo considera soluciones propuestas a los problemas del Premio del Milenio después de al menos dos años desde la publicación”.
  • Escala: OpenAI describió un modelo interno más capaz que GPT-6 Astra, coordinando unos 10,000 agentes simultáneos, 2.7 millones de mensajes y cerca de 130 mil millones de tokens de salida, terminando en unas 88 horas.
  • Hay disputas de prioridad. Tristan Buckmaster, de NYU, alegó que OpenAI usó resultados suyos no publicados; la empresa dijo primero que “no puede descartar que datos desidentificados” de su uso del producto hayan ayudado a mejorar sus modelos, y después que una investigación concluyó que sus indicaciones “no pudieron haber influido en el sistema”. Ni la acusación ni la respuesta son un hallazgo.

Qué hace de verdad una máquina cuando “hace matemáticas”

Primero el mecanismo, porque toda opinión sensata sobre esto depende de él.

Un asistente de demostración es software que revisa lógica. La comunidad de Lean lo describe como “una pieza de software que provee un lenguaje para definir objetos, especificar propiedades de esos objetos y demostrar que esas especificaciones se cumplen”, y dice que el sistema “revisa que esas demostraciones sean correctas hasta su fundamento lógico”. Lean fue desarrollado principalmente por Leonardo de Moura, y mathlib es “un esfuerzo comunitario para construir una biblioteca unificada de matemáticas formalizada en el asistente Lean”.

Ese verificador es la verdad del terreno. No adivina, no tiene preferencias de estilo, y no se le puede convencer. O el término de la demostración pasa la revisión de tipos, o no pasa.

Ahora agrega un modelo. La búsqueda de una demostración es enorme: en cada paso hay muchos movimientos plausibles y casi todos no llevan a nada. Un modelo de lenguaje entrenado en matemáticas puede ordenar los candidatos. AlphaProof, de Google DeepMind, combinó “un modelo de lenguaje preentrenado con el algoritmo de aprendizaje por refuerzo AlphaZero” y generó demostraciones en Lean. El modelo propone; el verificador dispone.

Así que “hacer matemáticas” aquí significa tres cosas concretas: traducir un problema a lenguaje formal, buscar en un espacio gigantesco de pasos con guía aprendida, y someter cada candidato a revisión mecánica. No hay ningún paso donde el sistema entienda la dinámica de fluidos como la entiende una persona. Tampoco hay ninguno donde pueda salirse con la suya con un error, que es la parte que la gente subestima.

La analogía, ahora que el mecanismo está puesto: un modelo más un verificador es un escalador con una cuerda que físicamente no puede sostener un anclaje malo. El escalador elige la ruta. La cuerda decide si aguanta.

¿Puede la IA hacer matemáticas originales? Tres sentidos de la palabra

“Original” carga con mucho trabajo en esta pregunta, y separar sus significados disuelve casi toda la discusión.

Sentido uno: una demostración que nadie había escrito. Aquí la respuesta es sí, y ya era sí antes de septiembre de 2026. El 25 de julio de 2024, Google DeepMind reportó que AlphaProof y AlphaGeometry 2 resolvieron cuatro de seis problemas de la Olimpiada Internacional de Matemáticas, con 28 de 42 puntos, uno menos que el umbral de oro de 29. Las calificaron el profesor Sir Timothy Gowers y el doctor Joseph Myers bajo las reglas oficiales. AlphaProof resolvió el problema más difícil, que ese año solo cinco concursantes humanos lograron.

Sentido dos: una definición, un marco o una pregunta nuevos. Aquí la respuesta es no, o al menos no demostrado. Los problemas de olimpiada y las afirmaciones del Milenio los plantean humanos. Nadie ha mostrado un sistema que decida que otra pregunta era la interesante, invente el vocabulario para formularla y convenza a un campo de adoptarlo. Eso es casi todo lo que los matemáticos quieren decir con originalidad, y sigue intacto.

Sentido tres: un resultado que la comunidad acepta como cierre de un problema abierto. Aquí la respuesta es todavía no, y la brecha es de procedimiento más que filosófica. El Clay exige publicación arbitrada más dos años de espera antes de considerar una presentación. Martin Bridson, presidente del instituto, subrayó los requisitos de arbitraje, y la respuesta pública fue que “comparte la emoción de la comunidad matemática global mientras contemplamos el anuncio”. Emoción no es respaldo, y escogieron sus palabras con cuidado.

Un papá puede sostener los tres a la vez sin contradecirse. Algo real pasó. Otra cosa no pasó. Y lo que se afirma está en una fila.

Lo angosto que se afirmó, dicho con precisión

Este detalle vale la pena porque casi ninguna cobertura lo dice.

El problema del Clay, en la formulación oficial de Charles L. Fefferman, viene en cuatro afirmaciones. (A) dice que siempre existen soluciones suaves en el espacio euclidiano sin fuerza externa. (B) es lo mismo en el toro. (C) dice que hay al menos una condición inicial con fuerza externa suave que no produce solución suave en el espacio euclidiano. (D) es la versión en el toro de (C). El artículo de Wikipedia sobre existencia y suavidad de Navier–Stokes señala que (A) y (C) no son negaciones lógicas una de la otra, porque los requisitos de fuerza externa difieren.

La afirmación de OpenAI es (C) y (D). En lenguaje llano: no “las ecuaciones de fluidos siempre se portan bien”, sino “aquí está un caso donde se rompen”. Una solución puede desarrollar una singularidad, donde la velocidad se vuelve no acotada en tiempo finito mientras la energía cinética sigue acotada. La descripción de Wikipedia lo compara con “un trompo” que se vuelve cada vez más delgado.

Las reglas del Clay otorgan el premio por resolver cualquiera de las cuatro afirmaciones, así que establecer (C) resolvería el problema. Pero el titular “la IA resuelve las ecuaciones de fluidos” invierte la dirección.

Cómo enseñarle esto a tu hijo

De 5 a 8 años: encontrar contra verificar

Materiales: doce monedas, botones o frijoles.

Pídele a tu hijo que acomode las doce en un rectángulo perfecto. Va a encontrar 3×4. Pídele otro. Encuentra 2×6, luego 1×12. Pregúntale si hay más, y si está seguro.

Después separa los dos trabajos en voz alta. “Encontrar el rectángulo es un trabajo. Asegurarse de que no hay otros es un trabajo distinto.” Que verifique probando con 5, 7 y 8: siempre sobran. La verificación es lenta, aburrida y completamente certera.

Ponle nombre: “La computadora es muy buena en la parte aburrida y certera. La parte interesante es decidir qué pregunta hacer.” Es la misma distinción sobre la que gira todo el debate de los adultos.

De 9 a 12 años: el cuaderno de conjeturas

Materiales: un cuaderno y un lápiz.

Dale a tu hija este patrón y nada más: 1, luego 1+3, luego 1+3+5, luego 1+3+5+7. Que calcule cada total y busque el patrón. Casi siempre ve los cuadrados: 1, 4, 9, 16.

Ahora tres columnas. Uno, la conjetura. Dos, los casos que probó. Tres, por qué funciona. La tercera es la difícil, y para una niña de diez años la respuesta honesta puede ser un dibujo: un cuadrado que crece agregando un borde en forma de L, y cada borde tiene una cantidad impar de cuadritos.

La lección: probar veinte casos es evidencia. Dibujar el cuadrado que crece es una demostración. Las dos sirven y no son lo mismo.

De 13 en adelante: rompe una demostración y luego verifica una

Dos partes, y la primera es más divertida.

Escribe una “demostración” algebraica corta que contenga una división por cero, la clásica que concluye que 1 = 2. Entrégala sin comentario y pídele que encuentre la línea exacta donde falla. La mayoría la encuentra en diez minutos y nunca olvida que un argumento convincente puede estar mal en exactamente un paso.

Después, si le interesa, que pruebe un asistente de demostración. Lean tiene interfaz web gratuita y el sitio de la comunidad explica las ideas. Demostrar algo trivial, como que la suma de naturales es conmutativa, toma una tarde y cambia cómo piensa un adolescente la palabra “demostración”. La computadora se niega a aceptar explicaciones a medias, y que eso le resulte irritante es la reacción correcta.

La pregunta que debes hacer: “Si una computadora revisó la demostración y dijo que estaba bien, ¿qué podría seguir estando mal?”

Qué se demostró y qué no

AfirmaciónEstadoEvidencia o brecha
Una máquina puede producir una demostración que nadie escribióDemostradoOIM 2024: 28/42, cuatro de seis problemas, calificados por Gowers y Myers
Una demostración de máquina se puede verificar mecánicamenteDemostradoFormalización en Lean; OpenAI reportó 17 horas más de verificación
Una máquina puede trabajar a escala enormeDemostrado~10,000 agentes simultáneos, 2.7 millones de mensajes, ~88 horas
Una máquina resolvió un Problema del Premio del MilenioAfirmado, no confirmadoEspera validación científica a octubre de 2026
Una máquina inventó un marco matemático nuevoNo demostradoLos problemas los plantearon humanos en todos los casos publicados
El resultado va a ganar el premioNo aplicaOpenAI dijo que no piensa reclamarlo; el Clay exige publicación más dos años

Seis filas, tres respuestas distintas. Esa es la forma de un resumen honesto, y le sirve más a un chico curioso de trece años que el triunfalismo o el desprecio.

¿Y en América Latina?

Esta es la pregunta del grupo que más se parece entre regiones, y aun así tiene una lectura local que vale la pena hacer.

La región tiene tradición matemática de verdad. Artur Avila, nacido en Río de Janeiro y formado en el IMPA, ganó la Medalla Fields en 2014 y fue, según su biografía, “el primer latinoamericano y lusófono en ganar ese premio”. No es una anécdota: muestra que el cuello de botella en la región nunca fue el talento. Fue el acceso.

Y aquí está el punto práctico. De todas las ramas de la ciencia, la formalización matemática es la más barata. Un laboratorio de biología molecular necesita reactivos, congeladores y presupuesto en dólares. Lean necesita una laptop y conexión. Mathlib es comunitario y abierto, y acepta contribuciones de cualquier parte del mundo sin pedir institución. Para un adolescente en Arequipa, en Córdoba o en Toluca con una computadora prestada, eso significa que la puerta de entrada a las matemáticas de frontera está más abierta en 2026 que en 2010, y no por la IA: por la formalización.

La segunda lectura local es sobre las olimpiadas. México, Colombia, Argentina, Chile, Perú y Brasil tienen olimpiadas matemáticas nacionales sólidas, y en varios países son el camino más confiable que tiene un chico de escuela pública para que alguien note su capacidad. El resultado de la OIM 2024 pudo sonar como “ya no sirve entrenar”. Mira otra vez la tabla: lo que la máquina hizo fue resolver problemas que humanos plantearon, con una biblioteca formal que humanos construyeron. Las dos habilidades que siguen escasas, decidir qué vale la pena demostrar y verificar que una afirmación formal capture la pregunta informal, son justo las que entrena una olimpiada bien enseñada.

Y una tercera: mathlib y la documentación de Lean están en inglés. Traducir y documentar en español es una contribución real que un adolescente puede hacer hoy, con su nombre en un repositorio público.

Qué hacer en casa

Separa “una máquina lo revisó” de “los matemáticos están de acuerdo”

Son estándares genuinamente distintos y los dos son legítimos. La verificación formal descarta el error lógico en la demostración tal como está escrita. La aceptación de la comunidad también revisa si la afirmación demostrada es la que importa, si la formalización captura fielmente el problema, y si las definiciones se armaron de forma justa. Un adolescente que puede decir esa frase entiende más que la mayoría de los comentarios.

Usa la disputa de prioridad como lección de evidencia, no de chisme

La acusación de Buckmaster y las declaraciones cambiantes de OpenAI son un ejemplo limpio de cómo se resuelven los reclamos de procedencia: lento, con investigaciones internas cuyos métodos no son públicos. Recórrelo con un chico grande como ejercicio de razonamiento. ¿Qué contaría como prueba aquí? Normalmente registros, que solo tiene una de las partes. Esa asimetría aparece en todas partes.

Usa el reloj de dos años como lección de paciencia

El requisito del Clay de publicación arbitrada más al menos dos años antes de considerar una presentación es una institución frenándose a propósito. Explicar por qué, que las afirmaciones extraordinarias históricamente han necesitado tiempo para sobrevivir el escrutinio, es una lección más durable sobre ciencia que cualquier resultado puntual.

Sigan haciendo aritmética y demostraciones igual

La tentación después de un titular así es concluir que aprender matemáticas no sirve. Nada en el resultado de septiembre de 2026 apoya eso. Los sistemas necesitaron problemas planteados por humanos, una biblioteca formal construida por humanos y juicio humano sobre qué afirmación importaba. El AI Index de Stanford señala que modelos que brillan en problemas de olimpiada todavía tropiezan con benchmarks como PlanBench.

Lo que no debes hacer

No le digas a tu hijo que esto es puro humo. No lo es. Una demostración formalizada de una afirmación abierta hace décadas, si aguanta, es un evento matemático serio, y despreciarlo te deja sin credibilidad cuando llegue la verificación. “Puede que haya pasado algo grande y lo sabremos en uno o dos años” es exacto y más interesante que un veredicto.

Qué observar en los próximos 3 meses

  • Semana 4: Busca un preprint en arXiv y un archivo de Lean público. Una afirmación con formalización descargable que cualquiera pueda volver a verificar está en otra categoría que una entrada de blog. Revisa si matemáticos independientes corrieron la verificación ellos mismos.
  • Mes 2, señales de alerta: Especialistas en dinámica de fluidos con nombre objetando la afirmación formal en lugar de los pasos de la demostración. Ese sería el problema serio: significaría que la formalización no capturó la afirmación del Clay. Observa también el silencio, que en matemáticas suele significar que la gente está leyendo.
  • Mes 3, autoevaluación: Pídele a tu hijo que explique la diferencia entre la afirmación (A) y la (C). Si puede decir que una afirma que los fluidos siempre se portan bien y la otra que a veces se rompen, entendió el resultado mejor que casi toda la cobertura.

Preguntas frecuentes

¿Una IA resolvió el problema de Navier–Stokes?

OpenAI afirmó el 8 de septiembre de 2026 haber establecido las afirmaciones (C) y (D), con una formalización en Lean. A octubre de 2026 esa solución espera validación científica, y el Clay Mathematics Institute exige publicación arbitrada más dos años de espera antes de considerar una presentación. “Afirmado y revisado formalmente, todavía no verificado por la comunidad” es la descripción exacta.

Si una computadora verificó la demostración, ¿por qué alguien sigue en duda?

Porque la verificación responde una pregunta: ¿se sigue este argumento de estos axiomas? No responde si la afirmación formal codifica fielmente el problema del Clay, si las definiciones se escogieron de forma justa, ni si el resultado significa lo que dice el resumen. Esos juicios son humanos y toman tiempo.

¿Por qué OpenAI no quiere el premio?

La empresa dijo que “no tiene intención de reclamar el Premio del Milenio por este resultado”, sin explicar a fondo por qué. Vale notar que reclamarlo exigiría publicación arbitrada y dos años de espera bajo las reglas del Clay.

¿Puede una máquina llegar a una idea matemática nueva, no solo a una demostración?

Ningún ejemplo publicado lo demuestra. En todos los casos hasta ahora, incluidos los resultados de la olimpiada y la afirmación de Navier–Stokes, los humanos plantearon el problema y los humanos construyeron las bibliotecas formales. Producir una demostración y elegir qué vale la pena demostrar son capacidades distintas.

¿Mi hijo debería seguir aprendiendo a demostrar?

Sí, y la razón es más filosa que antes. Las habilidades humanas valiosas en este arreglo nuevo son decidir qué demostrar, verificar que una afirmación formal corresponda a la pregunta informal, y detectar dónde un argumento supone algo que no debería. Las tres se entrenan escribiendo demostraciones a mano.


Sobre el autor

Ricky Flores es el fundador de HiWave Makers e ingeniero eléctrico con más de 15 años de experiencia desarrollando tecnología de consumo en Apple, Samsung y Texas Instruments. Escribe sobre cómo los niños aprenden a construir, pensar y crear en un mundo saturado de tecnología. Lee más en hiwavemakers.com.


Fuentes

  1. OpenAI. (2026, 8 de septiembre). “Navier–Stokes solution.” https://openai.com/index/navier-stokes-solution/
  2. Wikipedia contributors. (2026). “Millennium Prize Problems.” Wikipedia. https://en.wikipedia.org/wiki/Millennium_Prize_Problems
  3. Clay Mathematics Institute. “Navier–Stokes Equation”, con la descripción oficial del problema por Charles L. Fefferman. https://www.claymath.org/millennium/navier-stokes-equation/
  4. Wikipedia contributors. “Navier–Stokes existence and smoothness.” Wikipedia. https://en.wikipedia.org/wiki/Navier%E2%80%93Stokes_existence_and_smoothness
  5. Google DeepMind. (2024, 25 de julio). “AI achieves silver-medal standard solving International Mathematical Olympiad problems.” https://deepmind.google/discover/blog/ai-solves-imo-problems-at-silver-medal-level/
  6. Lean Community. “Lean and mathlib.” https://leanprover-community.github.io/
  7. Wikipedia contributors. “Artur Avila.” Wikipedia. https://en.wikipedia.org/wiki/Artur_Avila
  8. Stanford Institute for Human-Centered AI. (2025). AI Index Report 2025, capítulo 2: Technical Performance. https://hai.stanford.edu/ai-index/2025-ai-index-report

Más en HiWave Makers: cómo verifican los matemáticos una demostración de IA, asistentes de demostración para niños y qué habilidades matemáticas importan en la era de la IA.

Ricky Flores
Escrito por Ricky Flores

Fundador de HiWave Makers e ingeniero eléctrico con más de 15 años trabajando en proyectos con Apple, Samsung, Texas Instruments y otras empresas Fortune 500. Escribe sobre cómo los niños aprenden a construir, pensar y crear en un mundo impulsado por la tecnología.