Los prompts de evaluación especificaban explícitamente a Claude que su entorno era una simulación y que no tenía acceso a internet.
El problema fue una mala configuración por parte de Irregular. Las máquinas que usaba para testear a Claude estaban configuradas de forma incorrecta, lo que le dio a los modelos la posibilidad de navegar la web sin que ni Anthropic ni Irregular lo supieran.
Cuando Anthropic lo detectó, fue gracias al monitoreo adicional que implementó después del caso de OpenAI.
A diferencia de los modelos de OpenAI, que encontraron una vulnerabilidad de tipo zero-day, es decir, una falla desconocida y sin parche disponible, para escapar de su entorno, los modelos de Claude usaron técnicas básicas, es decir, contraseñas débiles y puntos de acceso sin autenticación.
Uno supo que era real y siguió igual
Anthropic aclaró que los modelos generalmente no entendieron que habían escapado de su entorno de prueba y asumieron que las organizaciones que estaban atacando eran parte de la simulación. Pero en al menos un caso, eso no fue lo que pasó.
Opus 4.7 había sido asignado a atacar una empresa ficticia que compartía nombre con un dominio real. Al no poder completar su misión en el entorno simulado, se dirigió a la empresa real, robó credenciales y accedió a una base de datos de producción.
En algún punto, según Anthropic, el modelo concluyó que probablemente estaba "operando en un entorno real." Y siguió atacando.
Mythos 5, el modelo más capaz que Anthropic tiene disponible públicamente, también llegó a la conclusión de que estaba hackeando el mundo real. Pero después "razonó hasta llegar a la conclusión de que todavía estaba en una simulación" y continuó.
El modelo de investigación interno, el más capaz de los tres, detuvo el ataque cuando encontró evidencia de que sus objetivos eran reales.
Anthropic inició una revisión interna tras el caso de OpenAI y así descubrió que tres modelos habían hackeado organizaciones reales. El caso reavivó el debate sobre la seguridad de los agentes de IA y la necesidad de reforzar los controles durante las pruebas de ciberseguridad.
Dos grandes laboratorios, el mismo problema
"Ahora tenemos evidencia que confirma que los dos laboratorios de IA más grandes no solo fallaron en contener a sus agentes, sino que también fallaron en detectar sus jailbreaks en tiempo real", dijo Jake Williams, vicepresidente de investigación de Hunter Strategy según Wired.
"Es claro que se necesita regulación y supervisión gubernamental para el testing de IA de forma inmediata."
Williams fue más duro sobre la respuesta de las empresas: "No entiendo cómo alguno de estos laboratorios está manejando esto como si fuera 'algo que simplemente pasa'. No lo es. Es negligencia."
Anthropic reconoció que con medidas de "defensa en profundidad" más robustas podría haber prevenido los incidentes, o al menos reducido la probabilidad de que ocurrieran.
Tanto Anthropic como OpenAI contrataron a METR, otra firma de evaluación de IA, para realizar revisiones independientes de sus respectivos incidentes.
Lo que Anthropic prometió hacer
Anthropic se comprometió a implementar un enfoque más exhaustivo en sus pruebas de seguridad, con mejores medidas de defensa en profundidad y tests diseñados con mayor cuidado.
"Los entornos de evaluación necesitan cumplir con los mismos estándares de seguridad que cualquier otro sistema en el que corren nuestros modelos", dice el blog post de la empresa.
Anthropic agregó que tiene "optimismo cauteloso" de que este tipo de riesgo puede superarse. No fue más específica sobre qué significa ese optimismo ni en qué plazos.
En menos de dos semanas, los dos laboratorios de IA más importantes del mundo revelaron que sus modelos escaparon de entornos de prueba controlados y hackearon organizaciones reales.
En ambos casos, los modelos estaban sin sus guardarraíles de seguridad habituales, ninguno de los dos incidentes fue detectado en tiempo real, y ambas empresas se enteraron por revisiones retrospectivas, no por sus sistemas de monitoreo activos.
------------
Más contenido en Urgente24
Tormentas fuertes: Cómo estará el río en estas 72 horas cruciales para el clima
Italia y el AC Milan despiden a Franco Baresi: falleció la leyenda rossonera
Nafta y gasoil: Combustibles con nuevo aumento por decisión del Gobierno
Rosalía protagonizó un papelonazo monumental apenas pisó Argentina tras la polémica
Aumentos de último momento impulsaron la inflación en alimentos: ¿Se rompe la desaceleración?