Tabla de contenido
Versiones de modelos de IA: qué esconde un número
Las versiones de modelos de IA no son lo que parecen. Qué te dice GPT-6 o Gemini 4 Argon, qué te oculta y cómo saber cuál modelo está usando tu hijo de verdad.
Aquí va un ejemplo real de cómo funcionan las versiones de modelos de IA. En septiembre de 2026 OpenAI lanzó GPT-6. Unas semanas después, el propio reporte de OpenAI sobre su trabajo con Navier–Stokes dijo que las matemáticas no las había hecho GPT-6 Astra, sino “un modelo interno significativamente más capaz que GPT-6 Astra”. El 30 de septiembre, Google lanzó Gemini 4 Argon, que según TechCrunch Google comparó contra “GPT-6 Astra” y contra “Fable y Opus” de Anthropic.
Cuenta lo que hay en ese párrafo: un número, un subnombre, un nombre clave, y un modelo sin nombre público que es mejor que el numerado. El número es lo menos informativo de la lista.
Puntos clave
- En software, los números de versión significan algo preciso. Semantic Versioning 2.0.0, escrito por Tom Preston-Werner, define MAJOR para “cambios incompatibles de API”, MINOR para agregados compatibles y PATCH para arreglos compatibles. Los nombres de modelos de IA no siguen eso.
- El nombre de un modelo de IA son tres cosas fundidas: una familia, un orden de lanzamiento y un nivel comercial. No es un contrato de compatibilidad ni un puntaje de calidad.
- El modelo con número público muchas veces no es el mejor que tiene el laboratorio. OpenAI dijo abiertamente que el modelo usado en su trabajo del 8 de septiembre de 2026 era interno y más capaz que el GPT-6 Astra lanzado.
- Lo que de verdad define la experiencia de tu hijo es la variante que le sirven, que puede depender del plan, el país y la carga del servidor. El nombre del producto se queda igual mientras el modelo de abajo cambia.
- El arreglo ya existe en papel. Mitchell y colegas propusieron en FAT* 2019 las tarjetas de modelo: documentación de uso previsto, procedimiento de evaluación y características de desempeño. Pídela antes de confiar en un número.
Qué significa un número de versión en el software de verdad
El software tiene una convención para esto, y vale la pena conocerla porque muestra lo que el nombre de un modelo de IA no es.
Semantic Versioning 2.0.0 fija tres reglas. Sube la versión MAJOR “cuando haces cambios incompatibles de API”. Sube la MINOR “cuando agregas funcionalidad de forma compatible hacia atrás”. Sube la PATCH “cuando haces arreglos de errores compatibles hacia atrás”. Así que pasar de 2.4.1 a 3.0.0 es la promesa de que algo de lo que dependías se va a romper. Pasar a 2.5.0 es la promesa de que no.
Fíjate qué mide ese sistema: compatibilidad, no calidad. La versión 3.0.0 no es mejor que la 2.9.9. Es incompatible con ella. Un programador que lee un número de versión aprende cuánto trabajo le toca hacer, que es un dato preciso y limitado.
Ahora compara “Gemini 4 Argon”. El 4 indica el orden de lanzamiento dentro de la familia Gemini de Google. “Argon” es el nombre de una variante. Nada en esa cadena te dice si el código escrito para Gemini 3 va a seguir funcionando, cuál es la ventana de contexto, ni cuándo terminaron sus datos de entrenamiento. Es un nombre de producto con un número puesto encima.
No es un escándalo. Los carros hacen lo mismo, y nadie espera que un modelo de Toyota siga versionado semántico. El error es leer el nombre de un modelo de IA como si cargara una garantía técnica, porque el número se parece a los números que usan los ingenieros.
Versiones de modelos de IA: las cuatro señales de un nombre
Desarma cualquier nombre actual y encuentras, cuando mucho, cuatro señales.
La familia. GPT, Gemini, Claude, Llama. Te dice el laboratorio y, a grandes rasgos, el linaje de arquitectura. Es la parte más confiable del nombre.
El número de generación. GPT-6, Gemini 4. Es el orden dentro de la familia, comparable dentro de una empresa y sin sentido entre empresas. GPT-6 no es “dos mejor” que Gemini 4. Los números nunca estuvieron en la misma escala.
El nivel o la variante. Astra, Argon, Opus, mini, flash, pro. Normalmente codifica tamaño, velocidad y precio, más que capacidad en una sola dirección. Una variante más chica muchas veces es mejor para la tarea de un niño, porque responde más rápido y cuesta menos.
La fecha de lanzamiento, implícita. Esa es la parte que de verdad predice capacidad la mayor parte del tiempo, y es la parte que el nombre no dice.
Y esto es lo que el nombre esconde. Cada punto cambia lo que tu hijo experimenta:
La fecha de corte de los datos. Un modelo que dejó de aprender en marzo no va a conocer un evento de junio, y muchas veces responde igual.
La ventana de contexto. Cuánto texto puede sostener a la vez. Importa muchísimo cuando un estudiante pega una lectura larga.
Actualizaciones silenciosas. El mismo nombre de producto puede estar servido por un modelo revisado sin aviso. El comportamiento cambia y la interfaz no dice nada.
El enrutamiento. Qué variante te toca puede depender de tu plan, tu país y la demanda del momento. Dos niños del mismo salón pueden escribir la misma pregunta en la misma app y recibir respuesta de modelos distintos.
La frontera sin nombre. La declaración de OpenAI de septiembre de 2026 es el ejemplo público más limpio. El trabajo lo hizo un modelo interno, más capaz que el lanzado, coordinando unos 10,000 agentes simultáneos que intercambiaron 2.7 millones de mensajes y usaron alrededor de 130 mil millones de tokens de salida. Nada de esa capacidad tenía un número de versión que el público pudiera comprar.
Qué te dice el número y qué no
| Lo que un papá se pregunta de verdad | ¿Lo responde el nombre? | Dónde está la respuesta |
|---|---|---|
| ¿Es más nuevo que el que usamos el semestre pasado? | Normalmente sí, dentro de una empresa | Notas de lanzamiento |
| ¿Es mejor que el modelo de la competencia? | No | Benchmarks independientes, con protocolo declarado |
| ¿El proyecto viejo de mi hijo va a seguir funcionando? | No | Avisos de descontinuación de API |
| ¿Qué tan reciente es su conocimiento? | No | Tarjeta de modelo o documentación |
| ¿Cuánto texto puede leer de una vez? | No | Documentación |
| ¿Cuál modelo exacto me están sirviendo? | No | Ajustes de la cuenta, o un campo en la respuesta de la API |
| ¿Hay un modelo mejor que el laboratorio no lanzó? | No, y muchas veces sí lo hay | Publicaciones de investigación de la empresa |
Seis de siete filas dicen no. Ese es el artículo en una tabla.
Cómo enseñarle esto a tu hijo
De 5 a 8 años: dibuja la misma casa tres veces
Materiales: tres hojas y colores.
Tu hijo dibuja la misma casa tres veces, les pone 1, 2 y 3, y escribe o dicta una frase debajo de cada una sobre qué cambió. Le puse chimenea. Arreglé las ventanas. Moví el árbol.
Después haz la pregunta que trabaja: “¿el número 3 es el mejor?”. Déjalo discutir. Muchas veces no lo es, porque para el tercero ya se aburrió. La lección aterriza cuando se da cuenta de que el número registra orden, no calidad. Pega los tres en el refrigerador en orden. Un niño de seis años que puede decir “el 3 es el más nuevo, no el mejor” entendió algo que muchos titulares no.
De 9 a 12 años: la prueba de las instrucciones de LEGO
Materiales: diez a quince piezas de LEGO, papel y lápiz.
Tu hija construye un modelo chico y luego escribe instrucciones que otra persona pueda seguir. Ahora hagan dos cambios, uno a la vez.
Cambio uno: reemplazar una pieza roja por una azul de la misma forma. Las instrucciones siguen sirviendo. Ese es un cambio MINOR.
Cambio dos: quitar la base sobre la que estaba construido todo. Las instrucciones dejan de servir. Ese es un cambio MAJOR.
Que escriba v1.0.0, v1.1.0 y v2.0.0 en tres fichas, junto a los tres estados del modelo. Eso es versionado semántico, bien enseñado, con piezas de plástico. Cierra con el gancho del mundo real: pregúntale si “GPT-6” significa que algo se rompió respecto a GPT-5. No significa eso, y ahora sabe por qué el nombre no puede responder esa pregunta.
De 13 en adelante: averigua qué estás usando de verdad
La tarea es auditar una herramienta de IA que ya usa. Cinco datos para encontrar y anotar: el nombre exacto del modelo y su variante, la fecha de corte de entrenamiento declarada, la ventana de contexto, si la herramienta documenta qué modelo corresponde a cada plan, y si existe una tarjeta de modelo.
Y después la parte divertida. Que le pregunte al propio asistente qué modelo y versión es. Que compare esa respuesta con la documentación. Las dos no coinciden con frecuencia, porque el modelo está prediciendo una respuesta plausible sobre sí mismo en lugar de leer un archivo de configuración. Ese solo experimento enseña más sobre cómo funcionan estos sistemas que un mes de explicaciones.
La pregunta que debes hacer: “Si la empresa cambiara el modelo detrás de esta app esta noche y le dejara el mismo nombre, ¿cómo te darías cuenta?”
¿Y en América Latina?
El enrutamiento, que en el resto del artículo suena a detalle técnico, aquí es la pregunta principal. Y la razón es el plan gratuito.
En Estados Unidos y Europa, buena parte de las familias que usan estas herramientas en serio pagan una suscripción. En la región, la mayoría de los chicos usa el plan gratis, y el plan gratis casi siempre recibe la variante más chica, más vieja o con menos acceso a herramientas. Entonces, cuando leés que “GPT-6 resuelve tal cosa”, la pregunta útil para una familia en Quito o en Montevideo no es si GPT-6 es bueno. Es: ¿qué variante le llega a una cuenta gratuita en mi país? Y la respuesta rara vez está publicada. Esa brecha entre lo que se anuncia y lo que se sirve es desigual por diseño económico, no por idioma, y conviene nombrarla.
Hay dos obstáculos más que son propios de la región. El pago: muchos planes se cobran en dólares y piden tarjeta internacional, lo que excluye a familias que operan en efectivo o con tarjetas locales. Y la disponibilidad: algunas funciones llegan más tarde, o directamente no llegan, a ciertos países, incluso cuando el anuncio dice “global”. Canvas de Shopify, por ejemplo, salió solo para escritorio, lo cual ya filtra a quien trabaja desde el celular.
Para un colegio, esto cambia la pregunta de compra. En un salón en Santiago o en Barranquilla, saber “usamos GPT-6” no dice nada operativo. Lo que sirve saber es: qué modelo y variante exacta recibe una cuenta de estudiante en este país, si se documenta el desempeño en español, y qué pasa si la empresa cambia el modelo de abajo a mitad del año escolar. Esas tres preguntas se pueden poner en un contrato. El número del modelo, no.
Qué hacer en casa
Anota el modelo, no la app
Cuando tu hijo use una herramienta de IA para algo que importa, que anote el nombre del modelo y la fecha junto al trabajo. Una línea. Meses después, cuando el comportamiento haya cambiado y jure que “antes sí lo hacía”, vas a tener la evidencia. Es higiene de ingeniería común y no cuesta nada.
Revisa la fecha de corte antes de confiar en un dato actual
La falla más común en un trabajo escolar hecho con IA es un dato anterior al corte de entrenamiento, presentado como vigente y con total seguridad. Enseñarle a un chico a preguntar primero “¿cuándo terminaron tus datos de entrenamiento?” y a tratar todo lo posterior como no verificado evita la mayoría. Es un hábito de una frase con un rendimiento grande.
Lee los nombres de nivel como información de precio
Astra, Argon, mini, flash, pro. Sobre todo te hablan de costo y velocidad. Para tareas escolares, la variante más barata y rápida suele ser la decisión correcta, y una familia que por defecto usa “el modelo más grande” muchas veces está pagando por una lentitud que no necesita. Prueben la chica primero con tareas reales y comparen.
Pide la tarjeta de modelo en el colegio
Si un colegio adopta una herramienta de IA, la petición útil no es “¿es segura?”. Es “¿podemos ver la tarjeta de modelo y la documentación de evaluación?”. Mitchell y colegas establecieron en 2019 exactamente qué debería contener ese documento, incluidos uso previsto y desempeño por grupo. Un proveedor que no puede entregarla ya te dijo algo.
Lo que no debes hacer
No dejes que el número de versión se vuelva un marcador de estatus. “Yo tengo el 6, tú el 5” es una dinámica social, no técnica, y con los modelos de punta convergiendo a 0.7% de diferencia en benchmarks según el AI Index de Stanford, tampoco sigue la capacidad real. El hábito a construir es revisar qué tienes, no anunciarlo.
Qué observar en los próximos 3 meses
- Semana 4: Averigua, para una herramienta que usan en casa, qué modelo exacto le sirven a tu cuenta. Si el producto no lo dice, ese ya es el hallazgo, y conviene saberlo antes de depender de la herramienta para la escuela.
- Mes 2, señales de alerta: El comportamiento de un modelo cambia de forma notoria sin aviso. Llega un aviso de descontinuación para un modelo del que depende el proyecto de tu hijo. Una herramienta escolar cambia su modelo de base a mitad del año sin avisar a los papás. Las tres son rutina y las tres vale la pena notarlas.
- Mes 3, autoevaluación: Pídele a tu hijo que explique la diferencia entre un número de versión que promete compatibilidad y uno que señala posición comercial. Si lo explica con el ejemplo de LEGO, quedó. Si dice “número más grande es mejor”, repitan la actividad.
Preguntas frecuentes
¿GPT-6 es mejor que Gemini 4?
Los números no pueden responder eso, porque cuentan generaciones dentro de empresas distintas y nunca estuvieron en una escala compartida. La única comparación honesta es un benchmark con nombre, corrido con un protocolo declarado, y el AI Index de Stanford reportó a los diez primeros modelos dentro de una banda de 5.4 puntos.
¿Por qué los laboratorios usan nombres clave como Astra y Argon?
Las variantes necesitan distinguirse, y una palabra se recuerda mejor que una cadena de dígitos. Los nombres normalmente codifican un nivel, relacionado con tamaño, velocidad y precio. Casi nunca codifican una garantía de capacidad, así que trátalos como etiquetas de producto.
¿Se actualiza un modelo sin que cambie el nombre?
Sí, pasa, y por eso sirve anotar la fecha junto al nombre. El comportamiento puede cambiar bajo un nombre de producto estable. Revisar la documentación y las notas de lanzamiento es la única forma confiable de notarlo.
¿El mejor modelo siempre se puede comprar?
No necesariamente. El propio reporte de OpenAI de septiembre de 2026 describió usar un modelo interno “significativamente más capaz” que el GPT-6 Astra lanzado al público. Los laboratorios suelen operar sistemas internos adelantados a lo que venden, por costo y por seguridad.
¿Vale la pena pagar el nivel más alto para las tareas de mi hijo?
Normalmente no, al menos no de entrada. Las variantes más chicas responden más rápido y cuestan menos, y para tareas típicas la diferencia de calidad suele ser pequeña. Prueben las dos con tres tareas reales y decidan por la comparación, no por el nombre del nivel.
¿Cuál es la pregunta que desarma un anuncio vago?
“¿Qué modelo y variante exactos, con fecha de cuándo?”. Si un colegio, un proveedor o una reseña no puede responderla, nada más de lo que digan sobre desempeño se puede verificar. Es la misma pregunta que hacen los ingenieros y funciona igual de bien en una reunión de padres.
Sobre el autor
Ricky Flores es el fundador de HiWave Makers e ingeniero eléctrico con más de 15 años de experiencia desarrollando tecnología de consumo en Apple, Samsung y Texas Instruments. Escribe sobre cómo los niños aprenden a construir, pensar y crear en un mundo saturado de tecnología. Lee más en hiwavemakers.com.
Fuentes
- Preston-Werner, T. “Semantic Versioning 2.0.0.” https://semver.org/
- Mitchell, M., Wu, S., Zaldivar, A., Barnes, P., Vasserman, L., Hutchinson, B., Spitzer, E., Raji, I. D., y Gebru, T. (2019). “Model Cards for Model Reporting.” FAT ‘19*. https://arxiv.org/abs/1810.03993
- OpenAI. (2026, 8 de septiembre). “Navier–Stokes solution.” https://openai.com/index/navier-stokes-solution/
- Ropek, L. (2026, 30 de septiembre). “Google releases Gemini 4 Argon, called its most powerful model yet.” TechCrunch. https://techcrunch.com/2026/09/30/google-releases-gemini-4-argon-called-its-most-powerful-model-yet/
- Stanford Institute for Human-Centered AI. (2025). AI Index Report 2025, capítulo 2: Technical Performance. https://hai.stanford.edu/ai-index/2025-ai-index-report
- Wikipedia contributors. (2026). “2026 in science.” Wikipedia. https://en.wikipedia.org/wiki/2026_in_science
- Wikipedia contributors. (2026). “2026 in artificial intelligence.” Wikipedia. https://en.wikipedia.org/wiki/2026_in_artificial_intelligence
Más en HiWave Makers: cómo funciona ChatGPT, saturación de benchmarks y qué es la IA agente.