Arnés de Evaluación (Desarrollo Dirigido por Evals)
Marco formal de evaluación para sesiones de Claude Code que aplica los principios del desarrollo dirigido por evals (EDD): tratar las evals como los tests unitarios del trabajo con IA. Sirve para definir criterios de éxito, medir la fiabilidad del agente con métricas pass@k y crear suites de regresión ante cambios de prompt o de agente. Para equipos que quieren medir y no adivinar el rendimiento de sus agentes.
Incluida en el Pase · para Claude Code
// qué_hace
Proporciona un marco para definir, ejecutar y medir evaluaciones de tareas de agente con criterios pass/fail y métricas de fiabilidad.
// cómo_lo_hace
Distingue evals de capacidad y de regresión, define criterios de éxito antes de implementar, usa graders basados en código y métricas pass@k, y mantiene suites de regresión para detectar cambios entre versiones.
// ejemplo_de_uso
Úsala antes de tocar el prompt o el modelo de un agente para saber si una mejora rompe lo que ya funcionaba. Ej.: defines 20 casos pass/fail y, al cambiar de modelo, detectas que la fiabilidad cae del 90% al 75% antes de publicarlo.
// plataformas
// opiniones_de_la_comunidad
Opiniones
Cargando opiniones…