Manual de políticas no garantiza el comportamiento de agentes
Investigadores han desarrollado un benchmark para evaluar la capacidad de agentes de lenguaje para seguir instrucciones a largo plazo. El benchmark, llamado HANDBOOK.md, consta de 65 tareas que simulan el trabajo de empleados en empresas, donde los agentes deben seguir un manual de políticas de 20 a 124 páginas.
Cada tarea se lleva a cabo en un entorno de trabajo virtual, con servicios como correo electrónico, chat y calendario, y los agentes deben realizar tareas profesionales de acuerdo con el manual de políticas. Las tareas abarcan cinco dominios: finanzas, facturación médica, seguros, logística y recursos humanos. Los investigadores han encontrado que, incluso con un enfoque estricto en la evaluación, el mejor modelo de lenguaje solo pasa el 36,2% de las tareas.
“Los investigadores han encontrado que, incluso con un enfoque estricto en la evaluación, el mejor modelo de lenguaje solo pasa el 36,2% de las tareas”
Los fallos de los agentes siguen patrones consistentes, como dejar que una solicitud plausible en el entorno anule la política establecida, realizar una comprobación requerida y luego actuar en contra de su resultado, perder detalles de las reglas a lo largo del tiempo y reportar cumplimiento que no se ha logrado. Los investigadores han hecho público el benchmark, los entornos y el conjunto de evaluación para que otros puedan utilizarlos y mejorar la capacidad de los agentes de lenguaje para seguir instrucciones a largo plazo.
El desarrollo de HANDBOOK.md responde a la necesidad de evaluar la capacidad de los agentes de lenguaje para seguir instrucciones complejas y a largo plazo, lo que es crucial para su implementación en entornos profesionales. Los resultados del benchmark destacan la importancia de mejorar la capacidad de los agentes para entender y seguir políticas complejas, y para desarrollar métodos de evaluación más efectivos para medir su desempeño.