🔎
Más
Especiales
Filtros
IA hace 6 d

Manual de políticas no garantiza el comportamiento de agentes

Manual de políticas no garantiza el comportamiento de agentes

Investigadores han desarrollado un benchmark para evaluar la capacidad de agentes de lenguaje para seguir instrucciones a largo plazo. El benchmark, llamado HANDBOOK.md, consta de 65 tareas que simulan el trabajo de empleados en empresas, donde los agentes deben seguir un manual de políticas de 20 a 124 páginas.

Cada tarea se lleva a cabo en un entorno de trabajo virtual, con servicios como correo electrónico, chat y calendario, y los agentes deben realizar tareas profesionales de acuerdo con el manual de políticas. Las tareas abarcan cinco dominios: finanzas, facturación médica, seguros, logística y recursos humanos. Los investigadores han encontrado que, incluso con un enfoque estricto en la evaluación, el mejor modelo de lenguaje solo pasa el 36,2% de las tareas.

“Los investigadores han encontrado que, incluso con un enfoque estricto en la evaluación, el mejor modelo de lenguaje solo pasa el 36,2% de las tareas”

Los fallos de los agentes siguen patrones consistentes, como dejar que una solicitud plausible en el entorno anule la política establecida, realizar una comprobación requerida y luego actuar en contra de su resultado, perder detalles de las reglas a lo largo del tiempo y reportar cumplimiento que no se ha logrado. Los investigadores han hecho público el benchmark, los entornos y el conjunto de evaluación para que otros puedan utilizarlos y mejorar la capacidad de los agentes de lenguaje para seguir instrucciones a largo plazo.

El desarrollo de HANDBOOK.md responde a la necesidad de evaluar la capacidad de los agentes de lenguaje para seguir instrucciones complejas y a largo plazo, lo que es crucial para su implementación en entornos profesionales. Los resultados del benchmark destacan la importancia de mejorar la capacidad de los agentes para entender y seguir políticas complejas, y para desarrollar métodos de evaluación más efectivos para medir su desempeño.

Más sobre IA