Saltar al contenido principal
Esencial10–16 horas

Quality Gate de IA en CI

Construye un regression gate para una función LLM con comprobaciones deterministas, model graders, casos de seguridad y umbrales de release.

diseño de pruebasdatasets de evaluaciónmodel graderspruebas de seguridadgates de CI

Escenario

Tarea

Un equipo cambia prompts y modelos con frecuencia. Necesita un gate automático que bloquee el release cuando empeoren la calidad, la seguridad o la estabilidad de los structured outputs.

Ejecución paso a paso

1. Construye la taxonomía de pruebas

Resultado: Los riesgos del producto están cubiertos por clases de prueba explícitas.

Tareas

  • Identifica happy paths
  • Añade edge cases
  • Añade casos de prompt injection y hallucination
  • Asigna severity

Comprobaciones

  • Cada riesgo crítico tiene un caso de prueba
  • El dataset no contiene solo happy paths

2. Implementa graders

Resultado: Cada propiedad tiene un método de evaluación adecuado.

Tareas

  • Añade schema checks
  • Añade assertions exact/regex
  • Configura un model grader
  • Calibra el grader con una muestra revisada manualmente

Comprobaciones

  • Los checks deterministas no se sustituyen por un LLM judge
  • El grader tiene evidencia de calibración

3. Define la política de regresión

Resultado: Las decisiones de release siguen reglas registradas.

Tareas

  • Registra el baseline
  • Define blocking thresholds
  • Separa quality y safety gates
  • Añade un proceso de excepciones

Comprobaciones

  • Una regresión de seguridad siempre bloquea el release
  • Los umbrales se almacenan en control de versiones

4. Integra el informe de CI

Resultado: Cada cambio recibe un veredicto transparente.

Tareas

  • Ejecuta evals en CI
  • Publica un resumen
  • Guarda resultados raw
  • Añade ejemplos de fallos

Comprobaciones

  • Un gate fallido hace fallar el job
  • Los resultados se pueden comparar entre runs

Criterios de aceptación

  • El dataset cubre casos normales, edge y adversariales
  • Hay graders deterministas y basados en modelos
  • Las regresiones de seguridad bloquean el release
  • CI conserva evidencia raw
  • Baseline y umbrales están versionados

Rúbrica de evaluación

Cómo se evalúa el resultado

Puntuación mínima: 75/100 · Distinción: 92/100

Cobertura de riesgos

El dataset cubre escenarios normales, edge y adversariales.

25 puntos

Insuficiente

Predominan los happy paths.

Competente

Los riesgos críticos están cubiertos.

Sólido

La cobertura está vinculada a fallos de producción y al threat model.

Evidencia requerida

  • ✓ Enlace al código o artefacto
  • ✓ README con decisiones
  • ✓ Salida de tests o evidencia de runtime
  • ✓ Taxonomía de tests y mapa de severity

Calidad de graders

Los checks deterministas y model graders corresponden a las propiedades evaluadas.

25 puntos

Insuficiente

Un único LLM judge evalúa todo.

Competente

Los checks deterministas y model-based están separados.

Sólido

La calibración y el análisis de desacuerdos están automatizados.

Evidencia requerida

  • ✓ Enlace al código o artefacto
  • ✓ README con decisiones
  • ✓ Salida de tests o evidencia de runtime
  • ✓ Muestra de calibración

Política de regresión

Baseline, umbrales y reglas de bloqueo están versionados.

25 puntos

Insuficiente

El veredicto es subjetivo.

Competente

Los umbrales y condiciones de bloqueo son explícitos.

Sólido

Hay excepciones basadas en riesgo y análisis de tendencias.

Evidencia requerida

  • ✓ Enlace al código o artefacto
  • ✓ README con decisiones
  • ✓ Salida de tests o evidencia de runtime
  • ✓ Política de release

Integración CI

El gate bloquea releases débiles y conserva evidencia.

25 puntos

Insuficiente

El informe no afecta al release.

Competente

Un fallo hace fallar el job.

Sólido

Hay artifacts, diff report y control de flaky evals.

Evidencia requerida

  • ✓ Enlace al código o artefacto
  • ✓ README con decisiones
  • ✓ Salida de tests o evidencia de runtime
  • ✓ Run de CI fallido y exitoso