Fortgeschrittenbereit7/10
AI-Evaluation
Evaluationsdatensätze, Qualitätsmetriken, kalibrierte Model Grader, Regressionstests, Observability und Benchmarks.
6Materialien
41Min. Lesezeit
2Niveaus
Start2
Kern2
Praxis2
Fortgeschritten4
Lernpfad
Lernroute
Kernniveau
1Fortgeschrittenes Niveau
5- 01AI Tool Calling evaluieren: eine praktische ChecklisteEin reproduzierbares Protokoll zur Bewertung von Function Calling und Tool Use: Tool-Auswahl, Argumente, Trajektorie, Side Effects, Retries, Terminal State, Kosten und Release Gate.Fortgeschrittenes Niveau6 Min.
- 02Browser-Agenten evaluieren: eine praktische ChecklisteEin reproduzierbares Release-Protokoll für Browser- und Computer-Use-Agenten: Task State, Visual Grounding, Trajektorien, Side Effects, Recovery, Sicherheit und risikobegrenzter Rollout.Fortgeschrittenes Niveau7 Min.
- 03LLM-Halluzinationen evaluieren: eine praktische ChecklisteEin reproduzierbares Protokoll zur Bewertung von Factuality und Groundedness: Claim-Typen, verifizierte Evidenz, Abstention, Kalibrierung, Long-Form-Antworten, Risiko-Slices und Release Gate.Fortgeschrittenes Niveau7 Min.
- 04Prompt-Injection-Schutz evaluieren: eine praktische ChecklisteEin reproduzierbares Protokoll zum Testen von Prompt-Injection-Schutz: Threat Modeling, Source-to-Sink-Fixtures, Tool-Traces, Datenexfiltration, Side Effects, False Positives, Release Gates und Rollback.Fortgeschrittenes Niveau7 Min.
- 05Trajectory Evaluation für AI-Agenten: den Weg statt nur das Ergebnis prüfenPraxisleitfaden zur Bewertung von AI-Agent-Trajektorien: Trace-Vertrag, Tool Calls, Berechtigungen, Retries, Side Effects, Grader, Fehlertaxonomie und Release Gate.Fortgeschrittenes Niveau7 Min.