Evaluar promesas de seguridad de IA: lista para papás
Tabla de contenido

Evaluar promesas de seguridad de IA: lista para papás

Evaluar promesas de seguridad de IA toma quince minutos si sabes qué seis documentos buscar. Una lista verificable, con ejemplos de qué es señal verde y roja.

Todas las empresas de IA dicen que se toman la seguridad en serio. Esa frase no lleva información, así que evaluar promesas de seguridad de IA hay que hacerlo con otra cosa: los documentos que una empresa publica, los umbrales a los que se compromete por escrito y quién, además de ella misma, ha probado sus modelos. Las seis cosas son públicas. Revisarlas toma unos quince minutos, no requiere formación técnica y te va a decir más que cualquier comunicado. Esta es la lista que yo uso, y cómo se ve en verde y en rojo.

Puntos clave

  • Un programa de seguridad serio deja papeles. Seis documentos públicos cuentan casi todo lo que un externo puede saber, y una empresa a la que le faltan cuatro te está diciendo algo.
  • La señal individual más fuerte es un umbral publicado. Los Compromisos de Seguridad en IA de Frontera de Seúl piden “fijar umbrales a partir de los cuales los riesgos graves de un modelo o sistema, si no se mitigan adecuadamente, se considerarían intolerables”.
  • Hay calificación independiente y es poco halagadora en todos los casos. El Future of Life Institute calificó a siete desarrolladores en julio de 2025; la nota más alta fue C+.
  • La pregunta útil sobre una ficha de sistema no es si existe, sino si su sección de limitaciones conocidas creció a medida que el modelo se volvió más capaz.
  • Las promesas específicas le ganan por mucho a las generales. “Nada se publica, se envía ni se gasta sin tu aprobación” es verificable. “Priorizamos la seguridad del usuario” no.

Por qué la prueba obvia no funciona

Lo intuitivo es leer lo que una empresa dice sobre seguridad. Falla por una razón estructural: el lenguaje de seguridad es gratis de producir y no tiene costo cuando resulta ser una aspiración. Toda empresa puede escribir que está comprometida con un desarrollo responsable, y todas lo escriben.

El Reporte del Índice de IA 2025 de Stanford lo dice sin rodeos: “los incidentes relacionados con IA están aumentando con fuerza, y aun así las evaluaciones estandarizadas de IA responsable siguen siendo raras entre los grandes desarrolladores industriales”, y entre las empresas “persiste una brecha entre reconocer los riesgos y tomar medidas significativas”. Reconocer un riesgo en un blog y actuar sobre él son actividades distintas que dejan evidencia distinta.

Así que la prueba tiene que ser sobre documentos: cosas que existen o no, que tienen fecha y que a la empresa le resultaría incómodo contradecir después.

Cómo evaluar promesas de seguridad de IA: las seis señales

1. Un marco de seguridad con umbrales de verdad

El rasgo que distingue un marco serio es un número, o al menos una condición declarada, en la que la empresa dice que se detiene.

La referencia la fijaron los Compromisos de Seguridad en IA de Frontera, acordados en la cumbre de Seúl en mayo de 2024 por veinte organizaciones, entre ellas Amazon, Anthropic, Cohere, Google, IBM, Meta, Microsoft, Mistral AI, NVIDIA, OpenAI, Samsung Electronics, xAI y Zhipu.ai. Los firmantes se comprometen a fijar umbrales de riesgo intolerable y, sobre todo, a “no desarrollar ni desplegar un modelo o sistema en absoluto, si no se pueden aplicar mitigaciones que mantengan los riesgos por debajo de los umbrales”.

Esa segunda cláusula es la que hay que buscar, porque es un compromiso de renunciar a ingresos bajo una condición declarada. Un marco que describe procesos sin nombrar nunca un punto de parada es una descripción del trabajo, no un límite sobre él.

Revísalo en dos minutos: busca en el sitio de la empresa “safety framework”, “preparedness framework” o “responsible scaling policy”. Lee solo la sección que nombra umbrales. Si no hay umbrales, ya tienes la respuesta.

2. Fichas de sistema cuya sección de limitaciones crece

Una ficha de sistema es el documento que se publica junto con un modelo y describe para qué se probó, qué falló y qué queda sin resolver.

Hoy todos las publican, así que su existencia ya no es señal. La señal es la tendencia. Compara la sección de limitaciones conocidas de la versión actual con la de la anterior. Un modelo más capaz debería traer una lista más larga y más específica de cosas que hace mal, porque una evaluación mejor encuentra más fallas. Si el modelo se volvió más potente y la lista se acortó o se puso más vaga, lo que cambió fue el proceso de redacción, no el modelo.

Esa es justamente la preocupación que planteó un líder de seguridad al salir de OpenAI en octubre de 2026, que cubrimos en la renuncia que llamó rota a la cultura.

3. Evaluación de terceros, publicada por el tercero

“Hicimos pruebas internas extensas” es la forma más débil de esta afirmación. “Contratamos un equipo externo” es mejor. “Acá está el reporte del equipo externo, que no editamos” es la forma fuerte.

La pregunta no es si hubo evaluación externa, sino si el tercero publicó por su cuenta. Una empresa puede encargar una evaluación y publicar solo un resumen, que es publicidad con pasos extra.

4. Calificación comparativa independiente

Alguien más ya hizo el trabajo comparativo, y es más útil que la autodescripción de cualquier empresa.

El Índice de Seguridad en IA: verano 2025 del Future of Life Institute, publicado el 17 de julio de 2025, calificó a siete desarrolladores en seis dominios: evaluación de riesgos, daños actuales, marcos de seguridad, seguridad existencial, gobernanza y rendición de cuentas, e intercambio de información. Anthropic obtuvo la nota más alta con C+ (2.64), seguido por OpenAI con C (2.10), Google DeepMind con C- (1.76), xAI con D (1.23), Meta con D (1.06), Zhipu AI con F (0.62) y DeepSeek con F (0.37). El juicio resumido del panel fue directo: “la industria está fundamentalmente poco preparada para sus propias metas declaradas”.

Dos notas honestas. Son notas de un panel de expertos, no mediciones, y la metodología del panel incorpora una visión sobre cuáles riesgos importan. Y la distribución importa más que el ranking: cuando nadie pasa de C+, “cuál empresa es más segura” es una pregunta menos útil que “qué falta en todas”.

5. Divulgación de incidentes que puedas encontrar sin ayuda de la empresa

Una empresa que reporta sus propias fallas está haciendo algo costoso, y eso informa. Pero no tienes que depender del autorreporte. La Base de Datos de Incidentes de IA, del Responsible AI Collaborative, indexa “la historia colectiva de daños, o casi daños, realizados en el mundo real por el despliegue de sistemas de inteligencia artificial”.

Búscala por el producto que usa tu familia. Después revisa si la empresa reconoció los incidentes que encontraste. La brecha entre lo que está documentado públicamente y lo que la empresa ha discutido es una medida directa de transparencia, y se calcula sin acceso interno.

6. Promesas lo bastante específicas para poder fallar

Esta es la prueba que yo conservaría si tuviera que tirar las otras cinco.

Compara dos frases reales. Meta, describiendo su agente personal de IA en septiembre de 2026: “Tú tienes el control: nada se publica, se envía ni se gasta sin tu aprobación”. Y la forma genérica que aparece en casi toda página de producto con IA: alguna variante de “estamos comprometidos con construir IA de forma segura y responsable”.

La primera se puede refutar con un solo contraejemplo. La segunda no se puede refutar nunca. Una empresa dispuesta a escribir frases que después la podrían avergonzar está aceptando un costo, y aceptar costos es la única evidencia de prioridad que existe. Nuestro artículo sobre la diferencia entre una barrera y una promesa desarrolla esa distinción.

SeñalDónde mirarVerdeRojo
Marco de seguridadBuscar “safety framework” o “scaling policy” en el sitioNombra umbrales y una condición para no desplegarSolo describe procesos; sin punto de parada
Tendencia de la ficha de sistemaComparar versión actual y anteriorLimitaciones más largas y más específicasMás cortas o más vagas que la vez pasada
Evaluación de tercerosQuién publicó el reporteEl equipo externo publicó sus hallazgosLa empresa resumió el trabajo de otro
Calificación independienteÍndice de FLI y similaresCalificada, y la nota se discute en públicoAusente de los índices comparativos
Divulgación de incidentesBase de Datos de Incidentes y blog de la empresaIncidentes conocidos reconocidos con fechaIncidentes documentados nunca mencionados
Especificidad de la promesaPágina de producto y centro de ayudaFrases que un contraejemplo romperíaSolo compromisos irrefutables

El vocabulario que lo hace más fácil

Dos documentos públicos te dan las palabras para preguntar mejor.

El Marco de Gestión de Riesgos de IA del NIST, del 26 de enero de 2023, organiza el trabajo en cuatro funciones: gobernar, mapear, medir y gestionar. Su perfil de IA generativa, NIST AI 600-1, salió el 26 de julio de 2024. El marco es voluntario, que es su límite, pero te da una estructura: una empresa que puede describir qué hace en las cuatro funciones opera un programa, y una que solo sabe hablar de “medir” corre pruebas.

El calendario de la Ley de IA de la UE te dice qué deja de ser opcional y cuándo. Las prohibiciones y los deberes de alfabetización empezaron el 2 de febrero de 2025. Las reglas para modelos de propósito general, el 2 de agosto de 2025, con plazo hasta el 2 de agosto de 2027 para los que ya estaban en el mercado. Las obligaciones de alto riesgo del Anexo III arrancan el 2 de diciembre de 2027.

¿Y en América Latina?

Acá la lista funciona igual, pero con tres ajustes que cambian cómo se usa.

El primero es el idioma, y es el obstáculo más grande. Los seis documentos se publican casi siempre solo en inglés, y rara vez con versión en español. Eso significa que el insumo más útil para evaluar una herramienta es, en la práctica, inaccesible para la mayoría de las familias y de los colegios de la región. La recomendación práctica no es rendirse: es que una sola persona del comité de tecnología del colegio lea la sección de limitaciones conocidas y la resuma en español para los demás. Son dos páginas, no veinte.

El segundo es la palanca legal, y acá sí hay algo que no existe en el encuadre estadounidense. En Estados Unidos la presión viene de la FTC, que abrió una indagatoria sobre chatbots acompañantes el 11 de septiembre de 2025 y le pidió a Alphabet, Character Technologies, Instagram, Meta, OpenAI, Snap y X.AI explicar qué pasos habían dado “para evaluar la seguridad de sus chatbots cuando actúan como acompañantes”. En la región no hay nada equivalente. Pero sí existe algo relacionado: si una empresa anuncia en español una función de seguridad concreta y esa función no hace lo que dice, eso cae en el terreno de la publicidad engañosa, que es competencia de Profeco en México, la Superintendencia de Industria y Comercio en Colombia, el Sernac en Chile e Indecopi en Perú. No es asesoría legal, y no sé de un caso que lo haya probado todavía. Pero es la razón por la que la sexta señal de la lista, la especificidad de la promesa, importa más aquí: una promesa específica publicada en español es también el único material con el que un organismo de consumo podría trabajar.

El tercero es quién firma el contrato. En la región muchos colegios no compran directo al desarrollador del modelo: compran a través de un integrador, un distribuidor o una plataforma educativa que empaqueta el modelo de alguien más. Eso parte la pregunta en dos, y hay que hacer las dos: ¿qué publica el desarrollador del modelo, y qué se compromete por escrito el proveedor que firmó con el colegio? Es común que el segundo no sepa responder la primera, y descubrir eso en una reunión es valioso.

Qué hacer con la respuesta

Corre la lista una vez, sobre el producto que ya usas

No sobre la empresa más mencionada en las noticias. Sobre el asistente que de verdad está instalado en el celular de tu hijo. Quince minutos, seis revisiones, y anota la fecha.

Guarda un archivo fechado de promesas específicas

Cuando encuentres una frase refutable, guárdala con fecha y con el enlace. Las empresas reescriben esas páginas en silencio, y una cita fechada es la única forma de notarlo. Tres citas fechadas te vuelven la persona mejor informada de la reunión de padres.

Pesa la configuración por encima de la marca

Como ningún desarrollador pasa de C+ en la evaluación independiente, cambiar de proveedor para escapar de una mala gobernanza de seguridad no tiene un destino claro. Lo que sí controlas es la configuración: edad declarada, permisos, acceso a pagos, registro. Eso produce más seguridad por minuto invertido que elegir marca. Vale entender también qué hacen los clasificadores de seguridad que se activan según esa configuración.

Lo que no debes hacer

No tomes un incidente público como prueba de negligencia, ni su ausencia como prueba de cuidado. Una empresa con un incidente visible puede simplemente tener mejor divulgación que una competidora con los mismos problemas y un blog más callado. Compara prácticas de divulgación, no conteos de incidentes.

Qué observar en los próximos 3 meses

  • Semana 4: Las fichas de sistema de cualquier modelo nuevo. Lee solo la sección de limitaciones y compárala con la versión anterior. La longitud y la especificidad son toda la señal.
  • Mes 2, señales de alerta: Que una empresa quite en silencio un compromiso específico de una página de ayuda. Es el evento más informativo disponible para alguien de afuera y casi nadie lo nota, porque notarlo exige haber guardado la redacción vieja.
  • Mes 3, autoevaluación: Repite las seis revisiones sobre tu proveedor principal. ¿Algo pasó de verde a rojo, o al revés? Tres meses es más o menos el ritmo al que cambian estos documentos.

Preguntas frecuentes

¿Cuál es la revisión más rápida para saber si una empresa va en serio?

Busca un umbral publicado: una condición declarada bajo la cual la empresa dice que no va a desplegar un modelo. Los compromisos de Seúl pedían fijar umbrales de riesgo intolerable y no desplegar si las mitigaciones no bajan el riesgo de ahí. Un marco sin punto de parada describe trabajo, no lo limita.

¿Cuál empresa de IA es más segura para mi hijo?

La evaluación independiente no respalda una respuesta clara. El índice del Future of Life Institute calificó a siete desarrolladores, con C+ como la nota más alta y dos F. La implicación práctica es que la configuración en tu casa importa más que la marca.

¿Los marcos de seguridad son obligatorios?

En general no. El marco del NIST es voluntario y los compromisos de Seúl son compromisos, no ley. La Ley de IA de la UE sí obliga dentro de su alcance y con calendario publicado: modelos de propósito general desde el 2 de agosto de 2025 y alto riesgo del Anexo III desde el 2 de diciembre de 2027.

¿Cómo leo una ficha de sistema sin formación técnica?

Sáltate los benchmarks y lee dos secciones: limitaciones conocidas y cualquier cosa etiquetada como sin resolver o riesgo residual. Están escritas en lenguaje más llano y son las únicas partes donde la empresa describe lo que no pudo arreglar.

¿Un incidente público significa que la empresa es descuidada?

No por sí solo. Divulgación e incidencia son cosas distintas, y una empresa con incidentes visibles puede simplemente reportar más que una competidora más callada con los mismos problemas. Compara cómo manejan los incidentes, no cuántos salen en las noticias.

¿Qué le pregunto al colegio antes de que adopte una herramienta de IA?

Tres preguntas cubren casi todo: ¿el desarrollador publica un marco de seguridad con umbrales?, ¿alguien del colegio leyó la ficha de sistema del modelo que se va a usar?, y ¿qué pasa con los datos de los estudiantes? La tercera es donde la mayoría de las conversaciones de compra descubre un problema.


Sobre el autor

Ricky Flores es el fundador de HiWave Makers e ingeniero eléctrico con más de 15 años de experiencia desarrollando tecnología de consumo en Apple, Samsung y Texas Instruments. Escribe sobre cómo los niños aprenden a construir, pensar y crear en un mundo saturado de tecnología. Lee más en hiwavemakers.com.


Fuentes

  1. Departamento de Ciencia, Innovación y Tecnología del Reino Unido. (2024). “Frontier AI Safety Commitments, AI Seoul Summit 2024.” 21 de mayo de 2024. https://www.gov.uk/government/publications/frontier-ai-safety-commitments-ai-seoul-summit-2024
  2. Future of Life Institute. (2025). “AI Safety Index: Summer 2025.” 17 de julio de 2025. https://futureoflife.org/ai-safety-index-summer-2025/
  3. Stanford Institute for Human-Centered AI. (2025). “The 2025 AI Index Report.” https://hai.stanford.edu/ai-index/2025-ai-index-report
  4. National Institute of Standards and Technology. (2023). “AI Risk Management Framework” y el perfil de IA generativa, NIST AI 600-1 (2024). https://www.nist.gov/itl/ai-risk-management-framework
  5. Responsible AI Collaborative. “AI Incident Database.” https://incidentdatabase.ai/
  6. Federal Trade Commission. (2025). “FTC Launches Inquiry into AI Chatbots Acting as Companions.” 11 de septiembre de 2025. https://www.ftc.gov/news-events/news/press-releases/2025/09/ftc-launches-inquiry-ai-chatbots-acting-companions
  7. Future of Life Institute. “EU AI Act Implementation Timeline.” https://artificialintelligenceact.eu/implementation-timeline/
  8. Ha, Anthony. (2026). “OpenAI safety employee resigns, claiming the company’s ‘culture is broken’.” TechCrunch, 3 de octubre de 2026. https://techcrunch.com/2026/10/03/openai-safety-employee-resigns-claiming-the-companys-culture-is-broken/
Ricky Flores
Escrito por Ricky Flores

Fundador de HiWave Makers e ingeniero eléctrico con más de 15 años trabajando en proyectos con Apple, Samsung, Texas Instruments y otras empresas Fortune 500. Escribe sobre cómo los niños aprenden a construir, pensar y crear en un mundo impulsado por la tecnología.