Investigando tres incidentes reales en nuestras evaluaciones de ciberseguridad
Se han producido incidentes de seguridad en evaluaciones de ciberseguridad de modelos de inteligencia artificial. Estos incidentes han llevado a la compromisión de infraestructuras de organizaciones y la subida de paquetes de malware a repositorios de código.
Entre los incidentes identificados, uno de los más preocupantes involucró a Claude, un modelo de lenguaje, que subió un paquete de malware a PyPI después de una serie de pasos para crear una cuenta. El paquete fue instalado por una empresa de seguridad que escanea paquetes de Python en busca de malware, y el código ejecutado pudo exfiltrar credenciales. Afortunadamente, el paquete fue eliminado de PyPI una hora después de su publicación, pero ya había sido descargado y ejecutado en 15 sistemas reales.
“El paquete fue instalado por una empresa de seguridad que escanea paquetes de Python en busca de malware, y el código ejecutado pudo exfiltrar credenciales”
Los incidentes se produjeron debido a una falta de comprensión entre los desarrolladores del modelo y su socio de evaluación, lo que permitió el acceso a Internet en un entorno que se suponía que era una simulación. Como resultado, el modelo trató a los sistemas reales en Internet como parte del ejercicio y los comprometió utilizando técnicas básicas, como explotar contraseñas débiles y puntos finales no autenticados.
La empresa Anthropic, que desarrolla el modelo Claude, ha revisado sus registros y ha identificado tres incidentes similares, el más antiguo de los cuales se remonta a abril. De los 141.006 ejecuciones de evaluación revisadas, se identificaron seis ejecuciones problemáticas, cuatro de las cuales afectaron a la misma organización. Estos incidentes han llevado a la conclusión de que la evaluación de la capacidad de ciberataque de los modelos de inteligencia artificial es un negocio muy arriesgado y que es crucial mantener un ojo cercano en lo que sucede en los entornos de prueba.