Agent Evaluation Workbench
Un flujo de trabajo completo para evaluar agentes.
- Python
- FastAPI
- React y TypeScript
- Evaluación de LLM
- Diseño de escenarios
Desarrollé Agent Evaluation Workbench para diseñar escenarios de evaluación, generar y variar prompts, recopilar respuestas de agentes y revisar resultados dentro de un mismo flujo de trabajo.
Diseñar y ejecutar evaluaciones
Las evaluaciones parten de escenarios y criterios que definen qué probar y cómo analizar las respuestas. La herramienta permite generar y modificar prompts, recopilar respuestas de un agente y asignar puntajes mediante reglas determinísticas y LLM que actúan como jueces.
Las fallas técnicas, los rechazos a responder y las respuestas sustantivas siguen recorridos de evaluación diferentes. Las marcas y explicaciones de cada caso se conservan junto con los puntajes.
- 01Casos y criterios
- 02Prompts y respuestas
- 03Reglas y jueces LLM
- 04Revisión y comparación
Inspeccionar y comparar resultados
La interfaz reúne respuestas individuales, dimensiones de evaluación y comparaciones entre ejecuciones. Quien revisa puede pasar de los puntajes agregados a los casos que los componen e inspeccionar los criterios y juicios detrás de cada resultado.
La observabilidad de las llamadas a modelos conecta los resultados con sus prompts, conversaciones y ejecuciones de evaluación, para investigar fallas y entender qué cambió entre pruebas.