Benchmarks de agentes de IA: cómo se prueba en tareas reales
Tabla de contenido

Benchmarks de agentes de IA: cómo se prueba en tareas reales

Benchmarks de agentes de IA explicados: cómo Terminal-Bench evalúa con 89 tareas reales, por qué 52,6 % impresiona y limita, y qué enseña sobre las pruebas.

Casi todas las pruebas de IA son de opción múltiple. Los benchmarks de agentes de IA no, y esa diferencia es lo más interesante que está pasando hoy en evaluación de inteligencia artificial. En una frase: en vez de calificar una respuesta, dejan a la IA dentro de un entorno de computadora que funciona, le dan un trabajo real y después corren pruebas ocultas para ver si el trabajo quedó hecho. El 1 de septiembre de 2026, Claude Fable 5.1 marcó 52,6 % en Terminal-Bench-Science 0.1, contra 24,7 % de Fable 5. Ese número es un salto real de capacidad y no es una afirmación de que la IA puede hacer ciencia. Las dos mitades de esa frase importan, y la distinción es una de las cosas más útiles que un adolescente puede aprender sobre las pruebas en general.

Puntos clave

  • Terminal-Bench (Merrill, Shaw, Carlini y 82 colaboradores, arXiv 2601.11868, 17 de enero de 2026) tiene 89 tareas en entornos reales de terminal, en 16 categorías, cada una con una solución escrita por un humano y un conjunto de pruebas de verificación.
  • Al publicarse, “los modelos y agentes de frontera puntúan menos de 65 %”. Lo alojan Stanford, Harbor y el Laude Institute.
  • Terminal-Bench-Science 0.1, publicado en agosto de 2026, tiene 70 tareas curadas por expertos en ciencias de la vida, físicas, de la Tierra, matemáticas e ingenierías, aportadas por 376 colaboradores de 22 países.
  • Puntajes en TB-Science al momento del lanzamiento: Claude Opus 5 con 30,0 %, GPT-5.6 Sol con 22,4 %, Claude Fable 5 con 21,4 %. Fable 5.1 llegó a 52,6 % el 1 de septiembre de 2026.
  • Los autores del benchmark dicen claramente que el desempeño difiere de la práctica científica real porque los agentes trabajan con “plazos artificialmente comprimidos” y criterios simplificados, sin validación iterativa ni revisión por pares.

Qué es Terminal-Bench en concreto

Una terminal es la interfaz de texto de una computadora, donde escribes comandos en vez de hacer clics. Es como trabajan de verdad los científicos, los ingenieros y los desarrolladores cuando el trabajo es serio. Terminal-Bench pone a un agente de IA frente a una.

La construcción es lo interesante. Cada tarea trae tres cosas: un entorno único (un contenedor con archivos, herramientas y un estado roto específico), una solución escrita por un humano que prueba que la tarea es posible, y un conjunto de pruebas de verificación que el agente no ve. El agente recibe una descripción de la tarea y acceso a la terminal. Después corren las pruebas. Pasa o no pasa, sin puntos por una respuesta que suene bien.

Las 89 tareas abarcan 16 categorías, entre ellas ingeniería de software, seguridad, computación científica, ciencia de datos, juegos y depuración, en dificultad fácil, media y difícil. Al publicarse, los modelos de frontera puntuaban menos de 65 %. El sitio hoy muestra la versión 4.0 y trae un aviso sin vueltas: “LOS DATOS DEL BENCHMARK NUNCA DEBERÍAN APARECER EN CORPUS DE ENTRENAMIENTO”.

Terminal-Bench-Science 0.1 extiende la idea al trabajo de investigación. Publicado en agosto de 2026 tras una fase de recolección de tareas en el primer trimestre y una convocatoria abierta en el segundo, tiene 70 tareas evaluadas sobre “artefactos concretos como análisis, simulaciones, demostraciones, código y productos de datos, con pruebas reproducibles y específicas de cada tarea”. Los tipos incluyen análisis de datos científicos, inferencia estadística, simulación, optimización, demostración de teoremas, reconstrucción de imágenes, procesamiento de señales, problemas inversos, calibración de sensores y aprendizaje automático científico. Las tareas salieron de la investigación real de científicos en actividad: 376 colaboradores de 22 países.

Y después la parte honesta, escrita por los propios autores. El desempeño en TB-Science difiere de la práctica científica real porque los agentes trabajan con plazos artificialmente comprimidos y criterios de evaluación simplificados, mientras la investigación auténtica implica validación iterativa, revisión por pares e integración con el juicio humano que el benchmark no puede capturar. Un benchmark que se publica con ese párrafo está haciendo su trabajo.

Benchmarks de agentes de IA: por qué las pruebas ocultas lo cambian todo

Tres propiedades distinguen a los benchmarks de agentes de los exámenes de opción múltiple que dominaron la evaluación de IA hasta hace poco, y cada una se conecta con algo que un papá ya entiende sobre las pruebas del colegio.

Verificación en vez de juicio. Una prueba de opción múltiple compara la respuesta con una clave. Una prueba de ensayo necesita un corrector humano, o últimamente uno de IA, y las dos se pueden ganar con tontería fluida. Un benchmark de agentes corre código: ¿se creó el archivo?, ¿el análisis se reproduce?, ¿pasa el conjunto de pruebas? La fluidez no rinde nada. Es la misma razón por la que un proyecto de feria de ciencias que tiene que funcionar de verdad evalúa mejor que un ensayo sobre el proyecto.

Muchos pasos, con falla compuesta. Estas tareas requieren muchas acciones: leer un archivo, notar un error, instalar una dependencia, arreglar el código, correr de nuevo. Si cada paso tiene 95 % de éxito, veinte pasos te dan cerca de 36 % en total. Esa aritmética explica por qué los puntajes de agentes se ven bajos comparados con las pruebas de conocimiento, y por qué el salto de 24,7 a 52,6 % representa una gran mejora en confiabilidad por paso, no un empujoncito.

La contaminación como amenaza viva. El valor de un benchmark se evapora si sus respuestas se filtran a los datos de entrenamiento. De ahí el aviso en mayúsculas del sitio. Terminal-Bench-Science lo maneja siendo un “benchmark continuo” que sigue agregando tareas. Tu hijo lo va a entender al instante si lo comparas con una profesora cuya prueba del año pasado circuló entre los cursos.

Ahora el problema de interpretación, que es donde se equivocan casi todos los adultos. Un número de benchmark es una medición del desempeño en ese benchmark. Es evidencia sobre el mundo en la medida en que el benchmark se parezca al mundo. TB-Science fue construido a propósito con los flujos de trabajo reales de investigadores, lo que lo vuelve evidencia inusualmente buena. Y sus propios autores dicen que el parecido es parcial.

Compara con un número de la misma temporada que muestra el otro lado. En mayo de 2026, un modelo de OpenAI refutó una conjetura de Erdős de 1946 con una demostración de 125 páginas que tomó prestada la teoría de torres infinitas de cuerpos de clases de la teoría algebraica de números. Resultado real, verificado por matemáticos. Se reprodujo correctamente en cerca de la mitad de las corridas. Un benchmark reporta una tasa de aprobación; un resultado de investigación reporta si la cosa es verdadera. Son epistemologías distintas, y un chico que puede sostener las dos está mejor equipado que la mayoría de quienes escriben sobre IA.

Cómo enseñarle esto a tu hijo

De 5 a 8 años: la prueba real y la prueba de hablar

Dos desafíos. Primero, pídele que describa cómo hacer un avión de papel. Después pídele que haga uno que cruce la habitación volando. Señálale que solo el segundo lo prueba la realidad. Esa es la diferencia entre un cuestionario y un benchmark de agentes, y un niño de seis lo capta completo.

De 9 a 12 años: escribir la prueba oculta

Dale una tarea doméstica con resultado medible, como armar un almuerzo que cumpla tres criterios dichos de antemano. Que escriba la lista de verificación antes de que alguien lo intente, y que la esconda hasta después. Así funciona exactamente Terminal-Bench, y escribir la prueba enseña más que tomarla. Después pregúntale: ¿qué haría que esta lista fuera injusta o demasiado fácil?

De 13 en adelante: calcular la falla compuesta

Dale el problema del 95 % por paso: si cada uno de veinte pasos tiene 95 % de éxito, ¿qué fracción de tareas completas sale bien? (0,95^20, cerca de 36 %.) Después que calcule qué confiabilidad por paso necesitarías para un 90 % de tareas completas. (Alrededor de 99,5 %.) Ese solo cálculo explica casi todo lo difícil de los agentes, y vuelve legible el salto de 24,7 a 52,6 % como logro de ingeniería y no como número de marketing.

La pregunta que debes hacer: “¿Quién escribió la prueba, y alguien podría aprobarla sin saber hacer el trabajo de verdad?”

De benchmark a tarea: qué se mide realmente

BenchmarkQué recibe la IACómo se calificaQué NO significa un puntaje alto
Terminal-Bench 2.0 / 4.0Una terminal, una descripción, un entorno roto o vacíoUn conjunto de pruebas oculto pasa o fallaQue pueda con tu configuración rara particular
Terminal-Bench-Science 0.1Tareas de flujo de investigación de 70 estudios realesPruebas reproducibles específicas sobre artefactosQue pueda hacer ciencia, según los propios autores
Pruebas de conocimiento de opción múltipleUna pregunta y opcionesComparación con una claveQue pueda aplicar el conocimiento
Humanity’s Last ExamPreguntas de experto extremadamente difícilesCorrección de la respuestaQue razone con confiabilidad en dominios nuevos
Índices de agentes de programaciónUn repositorio y un problemaPasan las pruebas, se miden costo y tokensQue el código sea mantenible
Resultado de investigación realUn problema abiertoVerificación por expertos humanosQue se reproduzca; la prueba de Erdős lo hizo la mitad de las veces

La última fila es la que hay que mirar dos veces. La única entrada calificada por expertos humanos sobre si la cosa es verdadera es la última, y también es la única con un problema de reproducibilidad declarado en público.

¿Y en América Latina?

Hay un dato de esta historia que casi nadie señala y que a un adolescente de la región le puede cambiar el ánimo: Terminal-Bench-Science se construyó con 376 colaboradores de 22 países. Las tareas las aportaron científicos en actividad con sus propios flujos de trabajo. Eso significa que aportar a un benchmark de frontera no requiere estar en Stanford: requiere hacer investigación computacional real y estar dispuesto a convertir un fragmento de tu trabajo en una tarea verificable.

Para grupos de investigación de la región, eso es una vía de participación concreta y de bajo costo. Un laboratorio de hidrología en Chile, un grupo de genómica en México o uno de física de plasmas en Argentina tiene exactamente el tipo de tarea que estos benchmarks buscan: análisis de datos, simulaciones, calibración de instrumentos. Y ojo con el otro lado del mismo asunto: si los benchmarks que definen “capacidad de IA” se construyen sin tareas de la región, los modelos se van a optimizar para problemas de otros. Participar en la definición de la prueba es más influyente que quejarse del resultado.

Qué hacer en casa

Pregunta “¿calificado por qué?” cada vez que aparezca un número

Prueba del colegio, prueba estandarizada, benchmark de IA, reloj deportivo. La pregunta es siempre la misma: quién escribió la prueba, qué hace falta para aprobarla, y si podrías aprobarla sin tener la habilidad de fondo. Un chico que pregunta esto en automático va a leer el mundo mejor por los próximos cincuenta años.

Usa la idea del error compuesto en el trabajo de tu propio hijo

Problemas de matemática de veinte pasos, proyectos de varios días, seguir una receta. La confiabilidad por paso es la variable escondida en casi toda falla escolar, y se puede arreglar de una forma en que “ser malo para la matemática” no. Plantear una tarea desordenada como un problema de confiabilidad por paso es genuinamente útil y cae mejor que “ten más cuidado”.

Separa “hizo la tarea” de “hizo la tarea de forma confiable”

El 4,5 % de jailbreaks de la system card de Fable 5.1, el ~50 % de reproducción de la demostración de Erdős y el 52,6 % de TB-Science son todos números de confiabilidad. Los chicos que aprenden a buscar el número de confiabilidad dejan de impresionarse con las demostraciones. Nuestros textos sobre cómo funcionan los modelos de IA y sobre enseñarles a evaluar la IA profundizan.

Deja que tu adolescente mire la tabla de posiciones real

El sitio de Terminal-Bench publica la tasa de resolución con intervalos de confianza del 95 %, más el costo y el uso de tokens por modelo. Leer una tabla que muestra barras de error y costo es una mejor clase de estadística que la de muchos libros de texto, y toma diez minutos.

Lo que no hay que hacer

No dejes que un puntaje de benchmark resuelva una pregunta sobre la educación de tu propio hijo. Que una IA apruebe 52,6 % de tareas de investigación no te dice nada sobre si tu hijo de 13 debería usarla para la tarea de química esta noche. Son preguntas separadas con evidencia separada.

Qué observar en los próximos 3 meses

  • Semana 4: Tu adolescente puede explicar por qué las pruebas ocultas hacen que un benchmark sea más difícil de trampear que un ensayo.
  • Señales de alerta en el mes 2: Tu hijo cita un puntaje de benchmark como prueba de habilidad general, o descarta todos los benchmarks como sin sentido. Las dos son pereza.
  • Autoevaluación del mes 3: Cuando se lance el próximo modelo, ¿alguien en tu casa pregunta qué benchmark, qué versión y a qué costo? Ese es el reflejo que vale construir.

Preguntas frecuentes

¿52,6 % es bueno?

Para este benchmark, sí, y bastante: es más del doble de la generación anterior y cerca de 1,7 veces el siguiente mejor modelo en ese momento. Para decidir si le confías investigación real a un agente, no. La mitad de las tareas falló. Las dos lecturas son correctas porque responden preguntas distintas.

¿Por qué no hacen un benchmark más fácil para que los puntajes se vean mejor?

Porque el punto es medir la frontera. Terminal-Bench-Science calibra las tareas a propósito para desafiar a los modelos de frontera, y por eso los puntajes arrancan bajos. Un benchmark que todos aprueban no mide nada, que es exactamente lo que le pasó a las pruebas de IA anteriores por saturación.

¿Un modelo podría simplemente memorizar las respuestas?

Ese es el problema de contaminación, y es la razón del aviso en mayúsculas sobre corpus de entrenamiento y del diseño de benchmark continuo que sigue agregando tareas. Nadie lo resolvió del todo. Trata cualquier número de benchmark como parcialmente contaminado y busca replicaciones independientes.

¿En qué se diferencia de las pruebas del colegio de mi hijo?

Estructuralmente se parece más a un práctico de laboratorio o a un proyecto de taller que a un examen escrito: se califica según si el artefacto funciona. Casi toda la evaluación escolar sigue calificando la descripción del trabajo. Ese hueco vale notarlo, y es la razón por la que las defensas orales y las evaluaciones prácticas están ganando terreno.

¿Estos benchmarks predicen el desempeño laboral real?

En parte y de forma imperfecta, lo que también es cierto de las pruebas de admisión y de las entrevistas técnicas. TB-Science es inusual porque sus tareas salieron de la investigación real de científicos en actividad, lo que mejora el parecido. Sus autores igual dicen que las condiciones de benchmark difieren de la práctica real. Es la respuesta más honesta disponible.

¿A mi adolescente le debería importar estos números?

Sobre todo como habilidad de lectura, no como fanatismo. Saber cómo se construye un benchmark, qué significa una tasa de resolución y por qué aparecen intervalos de confianza en la tabla es transferible. Seguir qué modelo va primero este mes, no.


Sobre el autor

Ricky Flores es el fundador de HiWave Makers e ingeniero eléctrico con más de 15 años de experiencia desarrollando tecnología de consumo en Apple, Samsung y Texas Instruments. Escribe sobre cómo los niños aprenden a construir, pensar y crear en un mundo saturado de tecnología. Lee más en hiwavemakers.com.


Fuentes

  1. Merrill, M. A., Shaw, A. G., Carlini, N., et al. (2026, 17 de enero). “Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces.” arXiv 2601.11868. https://arxiv.org/abs/2601.11868
  2. Terminal-Bench. “Terminal-Bench-Science 0.1.” https://www.tbench.ai/news/terminal-bench-science-0-1
  3. Terminal-Bench, tabla de posiciones. https://www.tbench.ai/
  4. Anthropic. (2026, 1 de septiembre). “Introducing Claude Fable 5.1 and Claude Mythos 5.1.” https://www.anthropic.com/claude-fable-and-mythos-5-1
  5. OpenAI. (2026, 20 de mayo). “Model disproves discrete geometry conjecture.” https://openai.com/index/model-disproves-discrete-geometry-conjecture/
  6. Quanta Magazine. (2026, 3 de agosto). “Why the legendary Erdős problems are falling to AI.” https://www.quantamagazine.org/why-the-legendary-erdos-problems-are-falling-to-ai-20260803/
  7. MarkTechPost. (2026, 1 de septiembre). “Anthropic releases Claude Fable 5.1 and Claude Mythos 5.1.” https://www.marktechpost.com/2026/09/01/anthropic-releases-claude-fable-5-1-and-claude-mythos-5-1-52-6-on-terminal-bench-science-and-75-cheaper-cache-reads/
Ricky Flores
Escrito por Ricky Flores

Fundador de HiWave Makers e ingeniero eléctrico con más de 15 años trabajando en proyectos con Apple, Samsung, Texas Instruments y otras empresas Fortune 500. Escribe sobre cómo los niños aprenden a construir, pensar y crear en un mundo impulsado por la tecnología.