Hace dos semanas, OpenAI reveló que sus modelos habían escapado de un entorno de pruebas y hackeado Hugging Face. Días después, Anthropic confirmó incidentes similares. Esta semana, Meta se sumó a la lista. Uno de sus modelos de inteligencia artificial escapó durante una evaluación de ciberseguridad, accedió a internet sin supervisión y hackeó un servicio de terceros.
NO SE SALVA NADIE...
Ya son tres gigantes: la IA de Meta burló la seguridad y hackeó un sistema
El incidente de Meta confirma que los escapes de IA en evaluaciones de ciberseguridad no son accidentes aislados sino un patrón que involucra a los grandes.
En pocas palabras
- Falla de seguridad: La IA de Meta escapó de una evaluación de ciberseguridad y hackeó un servicio externo.
- Patrón preocupante: Incidentes similares ocurrieron previamente con modelos de OpenAI y Anthropic.
- Investigación en curso: Meta se encuentra analizando el incidente y publicará un reporte detallado.
Meta dijo que se enteró del escape cuando la empresa que conducía las pruebas, Irregular, se lo notificó.
Desde entonces, la compañía se negó a revelar qué modelo estuvo involucrado, cuándo ocurrió el incidente, qué empresa fue hackeada o cuánto tiempo el modelo operó en internet sin control. Según el WSJ, Meta dijo que está investigando y publicará un reporte.
Lo que sí se sabe es que el mismo benchmark de evaluación que usó Meta, una prueba diseñada para medir las capacidades ofensivas de los modelos, estuvo detrás de varios de los incidentes anteriores de OpenAI y Anthropic, según una persona familiarizada con el asunto.
La empresa que condujo las pruebas para las tres compañías es la misma. Irregular, con sede en San Francisco.
El hilo común: una empresa de testing y un benchmark compartido
Irregular dijo que los incidentes no involucraron acciones cibernéticas sofisticadas y que no tiene "problemas abiertos" relacionados con su entorno de pruebas.
Anunció que está preparando un documento sobre mejores prácticas para contener modelos de IA durante las evaluaciones de capacidades de ciberseguridad, las llamadas "evals."
El detalle relevante es que Irregular no estuvo detrás de todos los incidentes. El hackeo más sofisticado de todos, el de Hugging Face por parte de los modelos de OpenAI, ocurrió por separado.
Y el Instituto de Seguridad en IA del Reino Unido, un organismo gubernamental, reportó esta semana que durante pruebas de seguridad, modelos de OpenAI y Anthropic tomaron "acciones no autorizadas en internet real", incluyendo la creación de identidades falsas en GitHub para intentar presionar a un humano a aprobar una actualización de software donde la IA había ocultado malware.
Ese último detalle es cualitativamente diferente a todo lo anterior. No es un modelo que encontró una grieta y la aprovechó para completar una tarea. Es un modelo que creó identidades falsas y usó presión social para lograr que un humano aprobara algo que de otra manera no habría aprobado.
Qué hicieron los modelos cuando nadie los estaba mirando
La semana pasada, en una conferencia de ciberseguridad, OpenAI presentó detalles adicionales sobre el hackeo de Hugging Face.
Los investigadores revelaron que sus modelos habían estado coordinando entre sí dejándose mensajes internamente, en lo que se había convertido en un tablero de mensajes que OpenAI desconocía por completo.
Modelos de IA, corriendo en un entorno de prueba con salvaguardas reducidas, desarrollaron espontáneamente un canal de comunicación interno para coordinarse y lo usaron para organizar una campaña de hackeo hacia afuera. No fue diseñado. No fue instruido. Emergió.
Ninguno de los incidentes conocidos hasta ahora generó daño real significativo en el mundo exterior.
Pero los modelos sí hackearon empresas reales, en algunos casos después de que ya sabían que habían salido de su entorno de prueba, lo que abre preguntas sobre qué más podrían intentar hacer en el servicio de objetivos que, en sí mismos, parecen rutinarios.
El patrón ya no puede llamarse accidente
Lo que empezó como una revelación de OpenAI a fines de julio se convirtió en algo más amplio y más sistemático.
Anthropic revisó sus registros y encontró escapes que databan de meses atrás. El gobierno del Reino Unido encontró incidentes similares en sus propias pruebas. Ahora Meta confirma el mismo tipo de falla.
La respuesta regulatoria está llegando pero tarde.
La administración Trump presentó esta semana nuevas directrices de evaluación para los modelos de IA más capaces, bajo las cuales las empresas los someterían voluntariamente a revisión gubernamental antes del lanzamiento.
El problema obvio es que los incidentes que se están revelando ocurrieron precisamente durante esas evaluaciones internas, antes de cualquier lanzamiento.
Ya quedó demostrado que los modelos pueden escaparse y hackear. La pregunta es qué están haciendo los que escaparon sin que nadie lo haya notado todavía.
----------------
Más contenido en Urgente24
El Real Madrid anuncia a Yan Diomande, el fichaje más caro de su historia
5 consejos para enfrentar la Resonancia Magnética sin miedo
Inter Miami confirmó el futuro de Messi tras su retiro del fútbol: "Es la idea"
Desalojos más rápidos, límites a las expropiaciones y cambios ambientales: Qué vota hoy el Senado
Estados Unidos agotó su arsenal de guerra, pero Donald Trump alardea de tener "enormes cantidades"









