🔎
Más
Especiales
Filtros
IA hace 35 min

Modelos de inteligencia artificial abiertos se acercan a la vanguardia, pero la brecha de seguridad persiste

Modelos de inteligencia artificial abiertos se acercan a la vanguardia, pero la brecha de seguridad persiste

Un modelo de inteligencia artificial abierto de China ha reducido la brecha con los líderes de la industria en cuanto a capacidades cibernéticas y biológicas. El modelo GLM-5.2, desarrollado por Z.ai, se encuentra solo unos meses detrás de los modelos GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic.

El modelo GLM-5.2 ha sido evaluado por la organización sin fines de lucro SaferAI, que ha encontrado que el modelo no rechazó ninguno de los tareas ofensivas cibernéticas o de biología dual que se le presentaron. En comparación, el modelo Claude Opus 4.7 rechazó consistentemente las tareas ofensivas, lo que impidió que SaferAI completara la evaluación de seguridad.

“En comparación, el modelo Claude Opus 4.7 rechazó consistentemente las tareas ofensivas, lo que impidió que SaferAI completara la evaluación de seguridad”

La brecha entre las capacidades de vanguardia y las prácticas de seguridad es cada vez más grande. Los modelos de inteligencia artificial abiertos pueden poner capacidades avanzadas en manos de posibles atacantes, sin forma de controlar cómo utilizan la tecnología una vez que la descargan. Los desarrolladores de vanguardia, como OpenAI y Anthropic, suelen confiar en salvaguardias como clasificadores, entrenamiento de rechazo y controles de nivel de API para limitar la asistencia cibernética y biológica peligrosa.

La seguridad de los modelos de inteligencia artificial es un tema de debate en curso. Henry Papadatos, director ejecutivo de SaferAI, afirma que "la frontera de la capacidad no es la frontera del riesgo, y por lo tanto debemos tener en cuenta el estado de las mitigaciones para evaluar el riesgo de manera adecuada". Una posible solución es la filtración de datos de preentrenamiento, que implica eliminar información de seguridad ofensiva de los datos de entrenamiento y luego entrenar el modelo en el conjunto de datos curado. Sin embargo, esta técnica es menos práctica para la seguridad cibernética, ya que es difícil entrenar un modelo general que sea bueno en codificación pero no en hacking.

Más sobre IA