Bibliothèque de connaissances
Articles
30 contenus pratiques dans la base de connaissances canonique.
Comment évaluer les browser agents : checklist pratique
Un protocole de release reproductible pour les browser et computer-use agents : task state, visual grounding, trajectoires, side effects, recovery, sécurité et rollout borné par le risque.
Benchmarks d’agents IA : GAIA, WebArena, OSWorld et SWE-bench
Un guide pratique pour choisir un benchmark d’agent IA : ce que GAIA, WebArena, OSWorld et SWE-bench évaluent réellement, comment lire les résultats et transférer ce signal externe vers son propre release gate.
Évaluation des trajectoires d’agents IA : vérifier le chemin et le résultat
Guide pratique pour évaluer les trajectoires d’agents IA : contrat de trace, tool calls, permissions, retries, effets, graders, taxonomie et release gate.
Comment évaluer les défenses contre le prompt injection : checklist pratique
Un protocole reproductible pour tester les défenses contre le prompt injection : threat modeling, fixtures source-to-sink, tool traces, exfiltration de données, side effects, faux positifs, release gates et rollback.
Comment évaluer le tool calling d’un agent IA : checklist pratique
Un protocole reproductible pour évaluer function calling et tool use : sélection des outils, arguments, trajectoire, side effects, retries, état terminal, coût et release gate.
Comment évaluer les hallucinations des LLM : checklist pratique
Un protocole reproductible pour évaluer factuality et groundedness : types d’affirmations, preuves vérifiées, abstention, calibration, réponses long-form, segments de risque et release gate.