Zum Hauptinhalt springen
Kern10–16 Stunden

AI-Quality-Gate in CI

Baue ein Regression-Gate für eine LLM-Funktion mit deterministischen Checks, Model Graders, Safety-Fällen und Release-Schwellenwerten.

TestdesignEvaluationsdatensätzeModel GradersSafety TestingCI Gates

Szenario

Aufgabe

Ein Team ändert regelmäßig Prompts und Modelle. Es braucht ein automatisches Gate, das Releases bei Regressionen von Qualität, Sicherheit oder Stabilität strukturierter Ausgaben blockiert.

Schrittweise Umsetzung

1. Testtaxonomie aufbauen

Ergebnis: Produktrisiken werden durch explizite Testklassen abgedeckt.

Aufgaben

  • Happy Paths identifizieren
  • Edge Cases ergänzen
  • Prompt-Injection- und Halluzinationsfälle ergänzen
  • Severity zuweisen

Prüfungen

  • Jedes kritische Risiko besitzt einen Testfall
  • Der Datensatz besteht nicht nur aus Happy Paths

2. Grader implementieren

Ergebnis: Jede Eigenschaft hat eine passende Bewertungsmethode.

Aufgaben

  • Schema Checks hinzufügen
  • Exact/Regex Assertions ergänzen
  • Model Grader konfigurieren
  • Grader an einer manuell geprüften Stichprobe kalibrieren

Prüfungen

  • Deterministische Checks werden nicht durch einen LLM Judge ersetzt
  • Für den Grader existiert Kalibrierungsevidenz

3. Regression Policy festlegen

Ergebnis: Release-Entscheidungen folgen dokumentierten Regeln.

Aufgaben

  • Baseline festhalten
  • Blocking Thresholds definieren
  • Quality- und Safety-Gates trennen
  • Exception Process ergänzen

Prüfungen

  • Eine Safety-Regression blockiert immer den Release
  • Schwellenwerte liegen in der Versionskontrolle

4. CI-Bericht integrieren

Ergebnis: Jede Änderung erhält ein transparentes Urteil.

Aufgaben

  • Evals in CI ausführen
  • Summary veröffentlichen
  • Rohdaten speichern
  • Fehlerbeispiele hinzufügen

Prüfungen

  • Ein fehlgeschlagenes Gate lässt den Job fehlschlagen
  • Ergebnisse sind zwischen Runs vergleichbar

Akzeptanzkriterien

  • Der Datensatz deckt Normal-, Edge- und Adversarial-Fälle ab
  • Deterministische und modellbasierte Grader sind vorhanden
  • Safety-Regressionen blockieren Releases
  • CI speichert Roh-Evidenz
  • Baseline und Schwellenwerte sind versioniert

Bewertungsraster

Wie das Ergebnis bewertet wird

Bestehensgrenze: 75/100 · Auszeichnung: 92/100

Risikoabdeckung

Der Datensatz deckt Normal-, Edge- und Adversarial-Szenarien ab.

25 Punkte

Unzureichend

Happy Paths dominieren.

Kompetent

Kritische Risiken sind abgedeckt.

Stark

Coverage ist mit Production Failures und Threat Model verknüpft.

Erforderliche Nachweise

  • ✓ Link zu Code oder Artefakt
  • ✓ README mit Entscheidungen
  • ✓ Testausgabe oder Runtime-Evidenz
  • ✓ Testtaxonomie und Severity Map

Grader-Qualität

Deterministische Checks und Model Graders passen zu den geprüften Eigenschaften.

25 Punkte

Unzureichend

Ein LLM Judge bewertet alles.

Kompetent

Deterministische und modellbasierte Checks sind getrennt.

Stark

Grader-Kalibrierung und Disagreement Analysis sind automatisiert.

Erforderliche Nachweise

  • ✓ Link zu Code oder Artefakt
  • ✓ README mit Entscheidungen
  • ✓ Testausgabe oder Runtime-Evidenz
  • ✓ Kalibrierungsstichprobe

Regression Policy

Baseline, Schwellenwerte und Blocking Rules sind versioniert.

25 Punkte

Unzureichend

Das Urteil ist subjektiv.

Kompetent

Schwellenwerte und Blocking Conditions sind explizit.

Stark

Risikobasierte Ausnahmen und Trendanalyse sind umgesetzt.

Erforderliche Nachweise

  • ✓ Link zu Code oder Artefakt
  • ✓ README mit Entscheidungen
  • ✓ Testausgabe oder Runtime-Evidenz
  • ✓ Release Policy

CI-Integration

Das Gate blockiert schwache Releases und speichert Evidenz.

25 Punkte

Unzureichend

Der Bericht beeinflusst den Release nicht.

Kompetent

Ein Fehler lässt den Job fehlschlagen.

Stark

Artifacts, Diff Report und Flaky-Eval-Kontrolle sind vorhanden.

Erforderliche Nachweise

  • ✓ Link zu Code oder Artefakt
  • ✓ README mit Entscheidungen
  • ✓ Testausgabe oder Runtime-Evidenz
  • ✓ Fehlgeschlagener und erfolgreicher CI Run