Zum Hauptinhalt springen
← Wissenskarte

Wissensbibliothek

Artikel

30 praktische Materialien in der kanonischen Wissensbasis.

Gefunden: 6 von 30
AI-EvaluationFortgeschritten · 7 Min.

Browser-Agenten evaluieren: eine praktische Checkliste

Ein reproduzierbares Release-Protokoll für Browser- und Computer-Use-Agenten: Task State, Visual Grounding, Trajektorien, Side Effects, Recovery, Sicherheit und risikobegrenzter Rollout.

Browser-Agenten evaluierenBrowser Agent EvaluationComputer Use Agent Eval
Lesen →
AI-EvaluationKern · 7 Min.

AI-Agent-Benchmarks: GAIA, WebArena, OSWorld und SWE-bench

Ein Praxisleitfaden zur Auswahl eines AI-Agent-Benchmarks: was GAIA, WebArena, OSWorld und SWE-bench tatsächlich prüfen, wie Ergebnisse zu lesen sind und wie externe Signale in ein eigenes Release Gate gelangen.

AI-Agent-BenchmarksGAIA BenchmarkWebArena
Lesen →
AI-EvaluationFortgeschritten · 6 Min.

Trajectory Evaluation für AI-Agenten: den Weg statt nur das Ergebnis prüfen

Praxisleitfaden zur Bewertung von AI-Agent-Trajektorien: Trace-Vertrag, Tool Calls, Berechtigungen, Retries, Side Effects, Grader, Fehlertaxonomie und Release Gate.

AI-Agent Trajectory EvaluationAgent Trace EvaluationTrajectory Grading
Lesen →
AI-EvaluationFortgeschritten · 7 Min.

Prompt-Injection-Schutz evaluieren: eine praktische Checkliste

Ein reproduzierbares Protokoll zum Testen von Prompt-Injection-Schutz: Threat Modeling, Source-to-Sink-Fixtures, Tool-Traces, Datenexfiltration, Side Effects, False Positives, Release Gates und Rollback.

Prompt Injection Schutz evaluierenPrompt Injection EvaluationPrompt Injection Testing
Lesen →
AI-EvaluationFortgeschritten · 6 Min.

AI Tool Calling evaluieren: eine praktische Checkliste

Ein reproduzierbares Protokoll zur Bewertung von Function Calling und Tool Use: Tool-Auswahl, Argumente, Trajektorie, Side Effects, Retries, Terminal State, Kosten und Release Gate.

AI Tool Calling evaluierenTool Calling EvaluationFunction Calling Evals
Lesen →
AI-EvaluationFortgeschritten · 7 Min.

LLM-Halluzinationen evaluieren: eine praktische Checkliste

Ein reproduzierbares Protokoll zur Bewertung von Factuality und Groundedness: Claim-Typen, verifizierte Evidenz, Abstention, Kalibrierung, Long-Form-Antworten, Risiko-Slices und Release Gate.

LLM Halluzinationen evaluierenLLM Hallucination EvaluationFactuality Evaluation
Lesen →