Saltar al contenido principal
Avanzado8–12 horas

Laboratorio de calibración y fiabilidad de AI graders

Construye un workflow de evaluación en el que un grader basado en modelos se calibre contra evidencia revisada por humanos, con política de desacuerdo, risk slices y un release gate ligado a versión.

calibración de gradersdiseño de evaluaciónrevisión humanarisk slicingrelease gating

Escenario

Tarea

Un equipo evalúa cientos de respuestas de IA con un grader basado en modelos. El score agregado parece estable, pero los edge cases críticos y los desacuerdos con revisores humanos quedan ocultos en el promedio. Hay que demostrar cuándo el grader es apto para decisiones de release y cuándo su veredicto debe bloquearse o enviarse a adjudicación.

Ejecución paso a paso

1. Fija el baseline humano

Resultado: El ground truth tiene provenance y no confunde desacuerdo entre expertos con error del grader.

Tareas

  • Selecciona casos representativos normales, edge y de alto impacto
  • Haz que al menos dos reviewers evalúen de forma independiente el slice crítico
  • Registra el desacuerdo y la razón de adjudicación
  • Versiona dataset y rubric

Comprobaciones

  • Un label crítico no proviene de un único judge no revisado
  • Un caso ambiguo tiene estado explícito unresolved o adjudicated

2. Congela el fingerprint del grader

Resultado: Un run repetido puede reproducirse y explicarse.

Tareas

  • Registra modelo y revisión
  • Guarda el prompt y rubric del grader
  • Registra inference settings y parsing schema
  • Añade estados invalid, refusal y timeout

Comprobaciones

  • No existe fallback silencioso a otra revisión de modelo
  • Invalid output nunca se convierte en PASS

3. Mide fiabilidad por risk slices

Resultado: El score agregado deja de ocultar clases de fallo costosas.

Tareas

  • Calcula agreement y confusion matrix
  • Mide severe false-pass por separado
  • Prueba slices multilingual, no-answer y adversariales
  • Analiza veredictos inestables en trials repetidos

Comprobaciones

  • High-severity false-pass tiene su propio blocking threshold
  • Existe una lista explícita de casos para adjudicación humana

4. Convierte la calibración en un release gate

Resultado: El grader se usa solo dentro del alcance de fiabilidad demostrado.

Tareas

  • Define la política PASS, REVIEW, BLOCKED y UNKNOWN
  • Exige recalibración tras cambios de modelo, prompt o rubric
  • Conecta el disagreement de producción con el regression loop
  • Guarda un informe machine-readable en CI

Comprobaciones

  • Un cambio del fingerprint del grader invalida la evidencia de calibración anterior
  • Un override tiene owner, rationale y audit trail

Criterios de aceptación

  • Existe un calibration set versionado y revisado por humanos
  • El fingerprint del grader es totalmente reproducible
  • High-severity false-pass se mide por separado
  • El desacuerdo tiene una ruta de adjudicación
  • El release gate nunca acepta UNKNOWN o invalid output como PASS