Aller au contenu principal
Avancé16–24 heures

Agent d’opérations gouverné

Construisez un agent IA gouverné avec tools, état explicite, approbations, limites de coût et de temps, journal d’audit et chemin de rollback.

état de l’agentcontrats de toolsMCPautorisationapprobation humaineauditabilité

Scénario

Tâche

Un agent prépare des changements dans un environnement opérationnel : il lit les données, construit un plan, appelle des tools et demande une approbation avant les actions risquées. Chaque action doit pouvoir être reconstruite depuis l’audit trail.

Exécution pas à pas

1. Concevoir la machine à états

Résultat: Le comportement de l’agent ne dépend pas d’une boucle cachée.

Tâches

  • Définir les états
  • Définir les transitions
  • Ajouter une limite de pas
  • Ajouter les résultats terminaux

Vérifications

  • Chaque état possède une condition de sortie
  • Une boucle infinie est impossible

2. Introduire la gouvernance des tools

Résultat: Chaque tool possède un contrat et des limites d’accès explicites.

Tâches

  • Définir les schémas entrée/sortie
  • Attribuer un niveau de risque
  • Définir le scope de permissions
  • Ajouter un dry-run

Vérifications

  • Les tools inconnus sont bloqués
  • Un write tool ne s’exécute jamais sans policy applicable

3. Ajouter approbations et budgets

Résultat: Le risque, le temps et le coût sont bornés avant l’exécution.

Tâches

  • Définir les approval gates
  • Ajouter des budgets tokens/coût
  • Ajouter un timeout
  • Ajouter l’annulation

Vérifications

  • Les actions à haut risque attendent toujours une approbation
  • L’épuisement du budget termine le cycle en sécurité

4. Vérifier auditabilité et rollback

Résultat: Une action peut être expliquée, rejouée ou annulée.

Tâches

  • Journaliser les inputs de décision
  • Persister les résultats des tools
  • Ajouter un rollback handler
  • Exécuter un failure drill

Vérifications

  • Le journal d’audit reconstruit la séquence
  • Le rollback possède des preuves

Critères d’acceptation

  • Une machine à états déterministe existe
  • Chaque tool possède une policy de risque et de permissions
  • Les write actions nécessitent une approbation
  • L’agent possède des limites de temps/coût/pas
  • Le failure drill et le rollback réussissent

Grille d’évaluation

Comment le résultat est évalué

Score de réussite: 75/100 · Distinction: 92/100

Machine à états et conditions d’arrêt

Les états, transitions, résultats terminaux et mécanismes de récupération sont explicites.

25 points

Insuffisant

Le comportement dépend d’une boucle cachée ou non bornée.

Compétent

Chaque état possède une condition de sortie et des limites explicites.

Solide

Replay déterministe, états de récupération et property tests sont implémentés.

Preuves requises

  • ✓ Lien vers le code ou l’artefact
  • ✓ README court expliquant les décisions
  • ✓ Sortie des tests ou preuve runtime
  • ✓ Diagramme d’états ou table de transitions

Gouvernance des tools

Chaque tool possède un schéma, un scope de permissions, un niveau de risque et une policy de dry-run.

25 points

Insuffisant

Les tools sont appelés sans contrats explicites ni limites d’accès.

Compétent

Le registre définit contracts, risques et permissions.

Solide

Les policies sont appliquées par un policy engine séparé et testées.

Preuves requises

  • ✓ Lien vers le code ou l’artefact
  • ✓ README court expliquant les décisions
  • ✓ Sortie des tests ou preuve runtime
  • ✓ Registre des tools

Approbations et budgets

Les actions risquées, le temps, les étapes et le coût sont bornés avant l’exécution.

25 points

Insuffisant

Les write actions peuvent s’exécuter sans approbation ni limites.

Compétent

Les approval gates et budgets bloquent les actions dangereuses.

Solide

Policy basée sur le risque, annulation et approbations déléguées sont implémentées.

Preuves requises

  • ✓ Lien vers le code ou l’artefact
  • ✓ README court expliquant les décisions
  • ✓ Sortie des tests ou preuve runtime
  • ✓ Exemple d’approval request et d’épuisement du budget

Auditabilité et rollback

La séquence de décisions est reproductible et les changements disposent de preuves de rollback.

25 points

Insuffisant

L’audit trail est incomplet ou le rollback reste déclaratif.

Compétent

Le journal d’audit reconstruit le cycle et le rollback est vérifié.

Solide

Journal inviolable, replay et recovery drill automatisé sont implémentés.

Preuves requises

  • ✓ Lien vers le code ou l’artefact
  • ✓ README court expliquant les décisions
  • ✓ Sortie des tests ou preuve runtime
  • ✓ Failure drill et rapport de rollback