Aller au contenu principal
← Carte des connaissances

Bibliothèque de connaissances

Articles

30 contenus pratiques dans la base de connaissances canonique.

Trouvés : 6 sur 30
Évaluation de l’IAAvancé · 7 min

Comment évaluer les browser agents : checklist pratique

Un protocole de release reproductible pour les browser et computer-use agents : task state, visual grounding, trajectoires, side effects, recovery, sécurité et rollout borné par le risque.

évaluer les browser agentsévaluation browser agentcomputer use agent eval
Lire →
Évaluation de l’IAPrincipal · 7 min

Benchmarks d’agents IA : GAIA, WebArena, OSWorld et SWE-bench

Un guide pratique pour choisir un benchmark d’agent IA : ce que GAIA, WebArena, OSWorld et SWE-bench évaluent réellement, comment lire les résultats et transférer ce signal externe vers son propre release gate.

benchmarks agents IAbenchmark GAIAWebArena
Lire →
Évaluation de l’IAAvancé · 6 min

Évaluation des trajectoires d’agents IA : vérifier le chemin et le résultat

Guide pratique pour évaluer les trajectoires d’agents IA : contrat de trace, tool calls, permissions, retries, effets, graders, taxonomie et release gate.

évaluation trajectoire agent IAagent trace evaluationtrajectory grading
Lire →
Évaluation de l’IAAvancé · 7 min

Comment évaluer les défenses contre le prompt injection : checklist pratique

Un protocole reproductible pour tester les défenses contre le prompt injection : threat modeling, fixtures source-to-sink, tool traces, exfiltration de données, side effects, faux positifs, release gates et rollback.

évaluer défense prompt injectionprompt injection evaluationprompt injection testing
Lire →
Évaluation de l’IAAvancé · 6 min

Comment évaluer le tool calling d’un agent IA : checklist pratique

Un protocole reproductible pour évaluer function calling et tool use : sélection des outils, arguments, trajectoire, side effects, retries, état terminal, coût et release gate.

évaluer AI tool callingtool calling evaluationfunction calling evals
Lire →
Évaluation de l’IAAvancé · 7 min

Comment évaluer les hallucinations des LLM : checklist pratique

Un protocole reproductible pour évaluer factuality et groundedness : types d’affirmations, preuves vérifiées, abstention, calibration, réponses long-form, segments de risque et release gate.

évaluer les hallucinations LLMévaluation hallucinations LLMfactuality evaluation
Lire →