Smevals: una suite de evaluación pequeña para modelos, promotores y arneses
Se ha desarrollado una herramienta llamada smevals para evaluar modelos de inteligencia artificial. Esta herramienta permite a los usuarios crear y ejecutar pruebas para evaluar las capacidades de diferentes modelos.
La herramienta smevals se compone de varios componentes, incluyendo evals, tareas, configuraciones y ejecuciones. Un eval es una colección de desafíos diseñados para responder a una pregunta sobre un modelo, mientras que una tarea es un desafío específico. Las configuraciones especifican el modelo a evaluar y pueden incluir otros parámetros, como prompts o parámetros del modelo.
“Un eval es una colección de desafíos diseñados para responder a una pregunta sobre un modelo, mientras que una tarea es un desafío específico”
Los usuarios pueden ejecutar pruebas utilizando la herramienta smevals y luego evaluar los resultados utilizando un grader. El grader produce una calificación basada en una secuencia de comprobaciones, que pueden ser simples o complicadas. Las comprobaciones pueden incluir la verificación de una cadena específica en la salida o la confirmación de que la salida es un XML válido.
La herramienta smevals ha sido desarrollada por Simon Willison en colaboración con el laboratorio de investigación de inteligencia artificial Prime Radiant. El objetivo de smevals es proporcionar una forma estandarizada de evaluar las capacidades de los modelos de inteligencia artificial y permitir a los usuarios comparar los resultados de diferentes modelos. La herramienta es flexible y se puede utilizar para evaluar una variedad de tareas, desde la generación de SVG hasta la escritura de haikus.