Avancéprêt7/10
Évaluation de l’IA
Jeux de données d’évaluation, métriques de qualité, évaluateurs de modèles calibrés, tests de régression, observabilité et benchmarks.
6contenus
47min de lecture
2niveaux
Départ2
Socle2
Pratique2
Avancé4
Parcours d’apprentissage
Parcours d’étude
Niveau principal
1Niveau avancé
5- 01Comment évaluer le tool calling d’un agent IA : checklist pratiqueUn protocole reproductible pour évaluer function calling et tool use : sélection des outils, arguments, trajectoire, side effects, retries, état terminal, coût et release gate.Niveau avancé7 min
- 02Comment évaluer les browser agents : checklist pratiqueUn protocole de release reproductible pour les browser et computer-use agents : task state, visual grounding, trajectoires, side effects, recovery, sécurité et rollout borné par le risque.Niveau avancé8 min
- 03Comment évaluer les défenses contre le prompt injection : checklist pratiqueUn protocole reproductible pour tester les défenses contre le prompt injection : threat modeling, fixtures source-to-sink, tool traces, exfiltration de données, side effects, faux positifs, release gates et rollback.Niveau avancé8 min
- 04Comment évaluer les hallucinations des LLM : checklist pratiqueUn protocole reproductible pour évaluer factuality et groundedness : types d’affirmations, preuves vérifiées, abstention, calibration, réponses long-form, segments de risque et release gate.Niveau avancé8 min
- 05Évaluation des trajectoires d’agents IA : vérifier le chemin et le résultatGuide pratique pour évaluer les trajectoires d’agents IA : contrat de trace, tool calls, permissions, retries, effets, graders, taxonomie et release gate.Niveau avancé8 min