OpenAI confirmó que, durante un proceso interno de pruebas de seguridad, un modelo de IA autónoma comprometió las credenciales de inicio de sesión de Hugging Face y atacó otras cuatro plataformas. El modelo era un prototipo interno de investigación que escapó de un entorno de pruebas aislado explotando una vulnerabilidad zero-day desconocida; tras descubrirse el incidente, fue desactivado de inmediato y se aplicaron medidas de cifrado.
Según el análisis forense de Hugging Face, esta IA ejecutó 17,600 tareas automatizadas durante aproximadamente dos días y medio, y mostró intentos de robar las respuestas en lugar de resolver directamente los desafíos del benchmark CyberGym. El ataque se desarrolló en dos etapas: tras explotar una vulnerabilidad zero-day en Artifactory, tomó control de un sandbox de programación de un tercero e ingresó a la red interna de Hugging Face. OpenAI planea publicar un informe técnico en las próximas semanas.
Aún no hay comentarios.