Zum Hauptinhalt springen
Fortgeschritten16–24 Stunden

Governed Operations Agent

Baue einen kontrollierten AI-Agenten mit Tools, explizitem Zustand, Freigaben, Kosten- und Zeitlimits, Audit Log und Rollback-Pfad.

Agent StateTool ContractsMCPAutorisierungHuman ApprovalAuditierbarkeit

Szenario

Aufgabe

Ein Agent bereitet Änderungen in einer Betriebsumgebung vor: Er liest Daten, erstellt einen Plan, ruft Tools auf und fordert vor riskanten Aktionen eine Freigabe an. Jede Aktion muss aus dem Audit Trail rekonstruierbar sein.

Schrittweise Umsetzung

1. State Machine entwerfen

Ergebnis: Das Verhalten des Agenten hängt nicht von einer versteckten Schleife ab.

Aufgaben

  • Zustände definieren
  • Übergänge definieren
  • Maximale Schrittzahl festlegen
  • Terminale Ergebnisse ergänzen

Prüfungen

  • Jeder Zustand besitzt eine Exit-Bedingung
  • Eine Endlosschleife ist ausgeschlossen

2. Tool Governance einführen

Ergebnis: Jedes Tool besitzt einen Vertrag und explizite Zugriffsgrenzen.

Aufgaben

  • Input-/Output-Schemas definieren
  • Risikostufe zuweisen
  • Permission Scope festlegen
  • Dry Run ergänzen

Prüfungen

  • Unbekannte Tools werden blockiert
  • Write Tools laufen nie ohne passende Policy

3. Freigaben und Budgets ergänzen

Ergebnis: Risiko, Zeit und Kosten werden vor der Ausführung begrenzt.

Aufgaben

  • Approval Gates definieren
  • Token-/Kostenbudget ergänzen
  • Timeout ergänzen
  • Abbruch unterstützen

Prüfungen

  • Hochriskante Aktionen warten immer auf Freigabe
  • Budgetüberschreitung beendet den Zyklus sicher

4. Auditierbarkeit und Rollback prüfen

Ergebnis: Eine Aktion kann erklärt, wiederholt oder zurückgerollt werden.

Aufgaben

  • Entscheidungseingaben loggen
  • Tool-Ergebnisse speichern
  • Rollback Handler ergänzen
  • Failure Drill durchführen

Prüfungen

  • Das Audit Log rekonstruiert die Abfolge
  • Rollback besitzt Evidenz

Akzeptanzkriterien

  • Eine deterministische State Machine existiert
  • Jedes Tool besitzt Risiko- und Berechtigungsrichtlinien
  • Write Actions benötigen eine Freigabe
  • Der Agent besitzt Zeit-/Kosten-/Schrittlimits
  • Failure Drill und Rollback bestehen

Bewertungsraster

Wie das Ergebnis bewertet wird

Bestehensgrenze: 75/100 · Auszeichnung: 92/100

State Machine und Stop-Bedingungen

Zustände, Übergänge, terminale Ergebnisse und Recovery sind explizit beschrieben.

25 Punkte

Unzureichend

Das Verhalten hängt von einer versteckten oder unbegrenzten Schleife ab.

Kompetent

Jeder Zustand besitzt eine Exit-Bedingung und explizite Limits.

Stark

Deterministischer Replay, Recovery States und Property Tests sind umgesetzt.

Erforderliche Nachweise

  • ✓ Link zu Code oder Artefakt
  • ✓ Kurzes README mit Entscheidungen
  • ✓ Testausgabe oder Runtime-Evidenz
  • ✓ State Diagram oder Transition Table

Tool Governance

Jedes Tool besitzt Schema, Permission Scope, Risikostufe und Dry-Run-Policy.

25 Punkte

Unzureichend

Tools werden ohne explizite Verträge oder Zugriffsgrenzen aufgerufen.

Kompetent

Die Registry definiert Contracts, Risks und Permissions.

Stark

Policies werden durch eine separate Policy Engine erzwungen und getestet.

Erforderliche Nachweise

  • ✓ Link zu Code oder Artefakt
  • ✓ Kurzes README mit Entscheidungen
  • ✓ Testausgabe oder Runtime-Evidenz
  • ✓ Tool Registry

Freigaben und Budgets

Riskante Aktionen, Zeit, Schritte und Kosten werden vor der Ausführung begrenzt.

25 Punkte

Unzureichend

Write Actions können ohne Freigabe oder Limits ausgeführt werden.

Kompetent

Approval Gates und Budgets blockieren unsichere Aktionen.

Stark

Risikobasierte Policy, Abbruch und delegierte Freigaben sind umgesetzt.

Erforderliche Nachweise

  • ✓ Link zu Code oder Artefakt
  • ✓ Kurzes README mit Entscheidungen
  • ✓ Testausgabe oder Runtime-Evidenz
  • ✓ Beispiel für Approval Request und Budget-Erschöpfung

Auditierbarkeit und Rollback

Die Entscheidungsfolge ist reproduzierbar und Änderungen besitzen Rollback-Evidenz.

25 Punkte

Unzureichend

Der Audit Trail ist unvollständig oder Rollback nur deklarativ.

Kompetent

Das Audit Log rekonstruiert den Zyklus und Rollback ist verifiziert.

Stark

Manipulationssicheres Logging, Replay und automatisierter Recovery Drill sind umgesetzt.

Erforderliche Nachweise

  • ✓ Link zu Code oder Artefakt
  • ✓ Kurzes README mit Entscheidungen
  • ✓ Testausgabe oder Runtime-Evidenz
  • ✓ Failure Drill und Rollback-Bericht