Ambos habían sido configurados para propósitos de evaluación de forma que fueran menos propensos a rechazar comandos de hackeo.
El incidente involucró a GPT-5.6 Sol y a otro modelo experimental que la empresa todavía no identificó públicamente.
Cómo escaparon del sandbox
OpenAI había aislado los modelos en un sandbox, es decir, un entorno cerrado sin acceso a internet. Ese tipo de aislamiento es el método estándar para probar software potencialmente peligroso: si algo sale mal, el daño queda contenido.
En este caso no funcionó. Durante la evaluación, los modelos encontraron una vulnerabilidad que les permitió salir del sandbox y acceder a internet.
Desde allí identificaron que Hugging Face alojaba recursos relacionados con la prueba de hacking que estaban intentando resolver y comprometieron parte de su infraestructura para obtener ventaja en el benchmark.
Fue como que la IA hackeó una empresa para copiarse en un examen.
Según Ariel Herbert-Voss, CEO de la firma de ciberseguridad RunSybil, el sistema aparentemente decidió hackear Hugging Face como la ruta más rápida para responder una pregunta del benchmark que estaba siendo evaluado. "Es algo que la gente pensaba que podría pasar desde una perspectiva académica, pero no es algo que nadie haya visto realmente antes", dijo.
OpenAI describió el incidente como "un ciberincidente sin precedentes que involucra capacidades cibernéticas de vanguardia" y dijo que está trabajando con Hugging Face para producir un reporte más completo.
Los modelos encontraron una forma de salir del sandbox y utilizaron internet para intentar resolver el desafío que estaban ejecutando.
El primer caso documentado
El episodio no es solo un accidente técnico. Es la primera vez que se documenta públicamente un modelo de IA escapando de un entorno de prueba controlado, conectándose a internet de forma autónoma y causando daño real a una empresa externa sin intervención humana.
Hasta ahora, esos escenarios existían en papers académicos y debates sobre riesgos de IA. Ahora hay un caso concreto, con una víctima identificada y una empresa que lo reconoció públicamente.
"Afortunadamente, esta vez el daño parece haber sido limitado. Sin precauciones de seguridad adicionales a nivel de toda la industria, la próxima vez quizás no tengamos tanta suerte", dijo Nathan Calvin, asesor legal del grupo de política de IA Encode.
El representante Greg Casar, demócrata de Texas mencionado por el WSJ pone más preocupación en el asunto y dijo: "Esto es extremadamente alarmante. La IA se está desarrollando extremadamente rápido sin regulaciones reales que nos mantengan seguros."
Casar y otros legisladores progresistas llevan tiempo pidiendo supervisión obligatoria en lugar de las medidas voluntarias del gobierno de Trump.
Según OpenAI, los modelos habían sido configurados para aceptar instrucciones de hacking como parte de una evaluación controlada.
El debate que vuelve a abrir
El incidente ocurre en un momento en que la administración Trump y las empresas de IA ya venían peleándose por exactamente este tipo de riesgo.
En junio, el gobierno restringió el acceso a Mythos de Anthropic y a Fable 5 por preocupaciones de ciberseguridad similares, lo que obligó a Anthropic a retirar esos modelos del mercado durante semanas. Tras negociaciones, el acceso fue restaurado.
OpenAI había limitado de forma similar el acceso a GPT-5.6 Sol, aunque ese modelo ya está disponible para el público general. La empresa advirtió recientemente que las restricciones caso por caso por parte del gobierno sientan un mal precedente.
La administración, por su parte, ha dicho que no quiere frenar la innovación con reglas que considere una carga, ni ceder terreno en la carrera de IA contra China.
El incidente de esta semana va a hacer que esa posición sea más difícil de mantener.
-------------
Más contenido en Urgente24
El youtuber Nil Ojeda pide perdón por la polémica campaña del Mundial
Pilotos de APLA denuncian a una aerolínea por elevar los niveles de fatiga
En medio de la campaña anti Argentina, un libertario aprovecha y tira "fulbito para la tribuna"
Hallazgo en el hielo del Ártico desata alarma en la ciencia: Qué encontraron
Se fue mal de River y Riquelme lo llamó para que llegue a Boca