Aller au contenu principal
Avancé8–12 heures

Laboratoire de calibration et de fiabilité des AI graders

Construisez un workflow d’évaluation dans lequel un grader fondé sur un modèle est calibré sur des preuves revues par des humains, avec une politique de désaccord, des risk slices et un release gate lié à la version.

calibration de gradersconception d’évaluationrevue humainerisk slicingrelease gating

Scénario

Tâche

Une équipe évalue des centaines de réponses IA avec un grader fondé sur un modèle. Le score agrégé paraît stable, mais les edge cases critiques et les désaccords avec les reviewers humains disparaissent dans la moyenne. Il faut démontrer quand le grader est apte aux décisions de release et quand son verdict doit être bloqué ou transmis à une adjudication.

Exécution pas à pas

1. Fixer le baseline humain

Résultat: Le ground truth possède une provenance et ne confond pas désaccord d’experts et erreur du grader.

Tâches

  • Sélectionner des cas représentatifs normaux, edge et à fort impact
  • Faire évaluer indépendamment le slice critique par au moins deux reviewers
  • Enregistrer le désaccord et la justification de l’adjudication
  • Versionner le dataset et la rubric

Vérifications

  • Un label critique ne provient pas d’un seul judge non vérifié
  • Un cas ambigu possède un état explicite unresolved ou adjudicated

2. Geler le fingerprint du grader

Résultat: Un run répété peut être reproduit et expliqué.

Tâches

  • Enregistrer le modèle et sa révision
  • Conserver le prompt et la rubric du grader
  • Enregistrer les inference settings et le parsing schema
  • Ajouter les états invalid, refusal et timeout

Vérifications

  • Aucun fallback silencieux vers une autre révision de modèle
  • Un invalid output n’est jamais converti en PASS

3. Mesurer la fiabilité par risk slices

Résultat: Le score agrégé ne masque plus les classes de panne coûteuses.

Tâches

  • Calculer l’agreement et la confusion matrix
  • Mesurer séparément le severe false-pass
  • Tester les slices multilingual, no-answer et adversarial
  • Analyser les verdicts instables sur des trials répétés

Vérifications

  • Le high-severity false-pass possède son propre blocking threshold
  • Une liste explicite de cas existe pour l’adjudication humaine

4. Transformer la calibration en release gate

Résultat: Le grader n’est utilisé que dans le périmètre où sa fiabilité est démontrée.

Tâches

  • Définir la politique PASS, REVIEW, BLOCKED et UNKNOWN
  • Exiger une recalibration après modification du modèle, du prompt ou de la rubric
  • Renvoyer le disagreement de production vers la regression loop
  • Conserver un rapport machine-readable dans la CI

Vérifications

  • Une modification du fingerprint du grader invalide les anciennes preuves de calibration
  • Un override possède un owner, une justification et un audit trail

Critères d’acceptation

  • Un jeu de calibration versionné et revu par des humains existe
  • Le fingerprint du grader est entièrement reproductible
  • Le high-severity false-pass est mesuré séparément
  • Le désaccord possède un chemin d’adjudication
  • Le release gate ne traite jamais UNKNOWN ou invalid output comme PASS