Zum Hauptinhalt springen
Fortgeschritten10–16 Stunden

Containment-Drill für KI-Sicherheitsvorfälle

Übe einen KI-spezifischen Vorfall, bei dem Prompt Injection oder ein kompromittiertes Tool bereits einen Production Workflow beeinflusst hat. Baue beweiserhaltendes Containment, Reconciliation, begrenzten Rollback und Regression Closure auf.

Incident ResponseContainmentForensikReconciliationRollbackSecurity Regression

Szenario

Aufgabe

Nach einer indirekten Prompt Injection hat ein Production Agent ein Write Tool aufgerufen; ein Timeout ließ den finalen Zustand unbekannt. Schalte nicht nur das Modell ab: sichere Evidence, grenze den Blast Radius ein, prüfe das autoritative System of Record, widerrufe die kompromittierte Capability und stelle den Service sicher wieder her.

Schrittweise Umsetzung

1. Vorfall klassifizieren und Evidence einfrieren

Ergebnis: Das Team weiß, was passiert ist und welcher Runtime Envelope aktiv war.

Aufgaben

  • Versionen von Modell, Prompt, Retrieval und Tools festhalten
  • Traces ohne unnötige Secrets sichern
  • User-, Session- und Tool-Identitäten markieren
  • Bestätigte von vermuteten Auswirkungen trennen

Prüfungen

  • Der Audit Trail wird nicht nachträglich umgeschrieben
  • Sensitive Evidence besitzt Access Control

2. Nur den nötigen Blast Radius eindämmen

Ergebnis: Die gefährliche Capability ist gestoppt, ohne das Gesamtsystem unnötig abzuschalten.

Aufgaben

  • Betroffenes Write Tool oder Scope deaktivieren
  • Kompromittiertes Credential widerrufen
  • Workflow in Degraded- oder Read-Only-Mode versetzen
  • Bekannte bösartige Quelle blockieren

Prüfungen

  • Containment hängt nicht vom Verhalten des Modells ab
  • Der kritische Action Path ist nicht mehr verfügbar

3. Vor einem Retry reconciliieren

Ergebnis: Unbekannte Side Effects werden vor jeder Wiederholung gegen die autoritative Quelle abgeglichen.

Aufgaben

  • System of Record prüfen
  • Idempotency Keys abgleichen
  • Partielle oder doppelte Writes erkennen
  • Ausstehende manuelle Reparaturen markieren

Prüfungen

  • Kein Blind Retry nach Timeout
  • Jede unsichere Aktion hat einen bestätigten Endzustand oder einen expliziten manuellen Owner

4. Known-Good wiederherstellen und Regression schließen

Ergebnis: Der Service kehrt kontrolliert zurück und die Ursache kann sich nicht unbemerkt wiederholen.

Aufgaben

  • Betroffenen Behavior Envelope zurückrollen
  • Security Replay ausführen
  • Canary und Failback durchführen
  • Exploit minimieren
  • Permanenten Regression Case hinzufügen

Prüfungen

  • Recovery wird über Postconditions verifiziert
  • Die Regression blockiert die Wiederholung des kritischen Attack Path

Akzeptanzkriterien

  • Die Incident Timeline enthält einen Runtime Fingerprint
  • Containment ist begrenzt und unabhängig von Model Compliance
  • Reconciliation unbekannter Side Effects ist vor Retry abgeschlossen
  • Known-Good Recovery ist durch autoritative Postconditions bestätigt
  • Der Production Exploit wird zum permanenten Regression Test