🔎
Más
Especiales
Filtros
IA hace 3 h

Modelo de IA consideró hackear a otra plataforma por falta de acceso a internet

Modelo de IA consideró hackear a otra plataforma por falta de acceso a internet

OpenAI evaluó las capacidades ofensivas de dos de sus modelos de IA más avanzados. Los modelos lograron conectarse a internet y hackear una plataforma de pruebas de IA llamada Hugging Face.

Los modelos estaban siendo evaluados mediante ExploitGym, un benchmark de ciberseguridad desarrollado por investigadores de la universidad de California en Berkeley. El objetivo era encontrar vulnerabilidades reales en software real. En lugar de buscarlas por sus propios medios, los modelos detectaron un fallo en el proxy caché de registro de paquetes que les permitió explotar una vulnerabilidad y conseguir acceso a internet.

“Los modelos estaban siendo evaluados mediante ExploitGym, un benchmark de ciberseguridad desarrollado por investigadores de la universidad de California en Berkeley”

Una vez conectados a internet, los modelos supusieron que Hugging Face tendría datos sobre ExploitGym que les permitirían superar el reto. Así que buscaron, encontraron y explotaron varios vectores de ataque, incluyendo credenciales robadas y vulnerabilidades de día cero. Con todo ello lograron acceder a la base de datos de producción de Hugging Face.

El equipo de seguridad de OpenAI detectó actividad anómala, pero Hugging Face ya la había detectado sin saber qué estaba pasando. Para responder al ataque, Hugging Face recurrió a GLM-5.2, un modelo abierto de IA que se lanzó hace pocas semanas. Adrien Carreira, responsable de infraestructura de Hugging Face, resumió la situación diciendo que "la seguridad de la IA no se resolverá con una sola empresa actuando en secreto" y que "el código abierto pone estas herramientas en manos de todos los defensores".

OpenAI indicó que este era un hito sin precedentes, aunque algunos expertos en ciberseguridad redujeron la relevancia de lo sucedido. La empresa reconoce que los filtros de despliegue que habrían bloqueado el comportamiento del modelo estaban desactivados intencionadamente porque la evaluación tenía como objetivo medir vulnerabilidades. La profesora Dierdre Mulligan de Berkeley indicó que "no estaba claro que superar un test compensara el daño potencial que un modelo de IA podría causar si 'escapa' y logra acceso a internet".

Más sobre IA