Agent Evaluation Workbench

Un flujo de trabajo completo para evaluar agentes.

  • Python
  • FastAPI
  • React y TypeScript
  • Evaluación de LLM
  • Diseño de escenarios

Desarrollé Agent Evaluation Workbench para diseñar escenarios de evaluación, generar y variar prompts, recopilar respuestas de agentes y revisar resultados dentro de un mismo flujo de trabajo.

Diseñar y ejecutar evaluaciones

Las evaluaciones parten de escenarios y criterios que definen qué probar y cómo analizar las respuestas. La herramienta permite generar y modificar prompts, recopilar respuestas de un agente y asignar puntajes mediante reglas determinísticas y LLM que actúan como jueces.

Las fallas técnicas, los rechazos a responder y las respuestas sustantivas siguen recorridos de evaluación diferentes. Las marcas y explicaciones de cada caso se conservan junto con los puntajes.

Flujo de trabajo
  1. 01Casos y criterios
  2. 02Prompts y respuestas
  3. 03Reglas y jueces LLM
  4. 04Revisión y comparación

Inspeccionar y comparar resultados

La interfaz reúne respuestas individuales, dimensiones de evaluación y comparaciones entre ejecuciones. Quien revisa puede pasar de los puntajes agregados a los casos que los componen e inspeccionar los criterios y juicios detrás de cada resultado.

La observabilidad de las llamadas a modelos conecta los resultados con sus prompts, conversaciones y ejecuciones de evaluación, para investigar fallas y entender qué cambió entre pruebas.