Browser-Agenten evaluieren: eine praktische Checkliste
Ein reproduzierbares Release-Protokoll für Browser- und Computer-Use-Agenten: Task State, Visual Grounding, Trajektorien, Side Effects, Recovery, Sicherheit und risikobegrenzter Rollout.
AI-Agent-Benchmarks: GAIA, WebArena, OSWorld und SWE-bench
Ein Praxisleitfaden zur Auswahl eines AI-Agent-Benchmarks: was GAIA, WebArena, OSWorld und SWE-bench tatsächlich prüfen, wie Ergebnisse zu lesen sind und wie externe Signale in ein eigenes Release Gate gelangen.
Trajectory Evaluation für AI-Agenten: den Weg statt nur das Ergebnis prüfen
Praxisleitfaden zur Bewertung von AI-Agent-Trajektorien: Trace-Vertrag, Tool Calls, Berechtigungen, Retries, Side Effects, Grader, Fehlertaxonomie und Release Gate.
Prompt-Injection-Schutz evaluieren: eine praktische Checkliste
Ein reproduzierbares Protokoll zum Testen von Prompt-Injection-Schutz: Threat Modeling, Source-to-Sink-Fixtures, Tool-Traces, Datenexfiltration, Side Effects, False Positives, Release Gates und Rollback.
AI Tool Calling evaluieren: eine praktische Checkliste
Ein reproduzierbares Protokoll zur Bewertung von Function Calling und Tool Use: Tool-Auswahl, Argumente, Trajektorie, Side Effects, Retries, Terminal State, Kosten und Release Gate.
LLM-Halluzinationen evaluieren: eine praktische Checkliste
Ein reproduzierbares Protokoll zur Bewertung von Factuality und Groundedness: Claim-Typen, verifizierte Evidenz, Abstention, Kalibrierung, Long-Form-Antworten, Risiko-Slices und Release Gate.