Aller au contenu principal
Essentiel12–20 heures

Assistant de connaissances fondé sur les preuves

Construisez un assistant RAG qui répond uniquement à partir de preuves vérifiées, affiche ses citations et mesure la qualité du retrieval.

ingestionchunkingretrieval hybridererankingcitationsévaluation RAG

Scénario

Tâche

Une équipe a besoin d’un assistant pour les politiques internes. Le système ne doit pas inventer de réponses, doit exposer ses sources et doit s’abstenir lorsque les preuves sont insuffisantes.

Exécution pas à pas

1. Préparer le corpus

Résultat: Les documents possèdent un owner, une version et des métadonnées d’accès.

Tâches

  • Sélectionner 20–50 documents
  • Nettoyer la structure
  • Ajouter les métadonnées
  • Conserver le source URI

Vérifications

  • Chaque chunk possède une source
  • Le versioning est reproductible

2. Configurer le retrieval

Résultat: Les passages pertinents atteignent régulièrement le top-k.

Tâches

  • Comparer les tailles de chunks
  • Ajouter recherche lexicale + vectorielle
  • Configurer le reranking
  • Ajouter un filtre ACL

Vérifications

  • Un jeu de requêtes de test existe
  • ACL est couvert par des tests négatifs

3. Construire le contrat de preuve

Résultat: Le modèle ne peut pas masquer l’absence de preuve.

Tâches

  • Définir le schéma de citations
  • Ajouter l’abstention
  • Valider les source IDs
  • Rejeter les affirmations non étayées

Vérifications

  • Chaque affirmation possède une citation ou une abstention
  • Un source ID inconnu bloque la réponse

4. Lancer l’évaluation

Résultat: La qualité du retrieval et de la génération est mesurée séparément.

Tâches

  • Créer un golden set
  • Calculer recall@k
  • Évaluer citation correctness
  • Construire une taxonomie des échecs

Vérifications

  • Une baseline existe
  • Un seuil de régression est enregistré

Critères d’acceptation

  • Toutes les citations ouvrent une source réelle
  • ACL empêche les fuites de données
  • Une preuve faible déclenche l’abstention
  • Le rapport d’évaluation contient une baseline et des exemples d’échecs

Grille d’évaluation

Comment le résultat est évalué

Score de réussite: 70/100 · Distinction: 90/100

Corpus et provenance

Documents, chunks, métadonnées, versions et source URIs sont reproductibles.

20 points

Insuffisant

Les sources n’ont pas de version ou d’owner, ou les chunks perdent leur provenance.

Compétent

Chaque chunk possède une source, des métadonnées et une version.

Solide

Freshness policy, lineage et contrôle des changements sont implémentés.

Preuves requises

  • ✓ Lien vers le code ou l’artefact
  • ✓ README court expliquant les décisions
  • ✓ Sortie des tests ou preuve runtime
  • ✓ Exemple de document et de ses chunks

Qualité du retrieval

Hybrid retrieval, filtres et reranking sont mesurés sur un jeu de requêtes.

30 points

Insuffisant

Il n’existe pas de jeu de test ou le retrieval est évalué subjectivement.

Compétent

Une baseline, un query set et un top-k mesurable existent.

Solide

Plusieurs stratégies sont comparées avec seuil de régression et taxonomie des échecs.

Preuves requises

  • ✓ Lien vers le code ou l’artefact
  • ✓ README court expliquant les décisions
  • ✓ Sortie des tests ou preuve runtime
  • ✓ Recall@k ou métrique équivalente

Grounding et citations

Les affirmations sont soutenues par des preuves et l’absence de preuve entraîne une abstention.

30 points

Insuffisant

Le modèle peut répondre sans preuve ou les citations n’ouvrent pas la source.

Compétent

Les affirmations non étayées sont bloquées et les citations sont valides.

Solide

Groundedness et citation correctness sont mesurés automatiquement.

Preuves requises

  • ✓ Lien vers le code ou l’artefact
  • ✓ README court expliquant les décisions
  • ✓ Sortie des tests ou preuve runtime
  • ✓ Exemples de citation correcte et d’abstention

Contrôle d’accès et sécurité

ACL est appliqué pendant le retrieval et vérifié par des tests négatifs.

20 points

Insuffisant

Le filtrage intervient après le retrieval ou une fuite reste possible.

Compétent

ACL est appliqué à la recherche et couvert par des tests négatifs.

Solide

Isolation des tenants, audit log et policy tests sont implémentés.

Preuves requises

  • ✓ Lien vers le code ou l’artefact
  • ✓ README court expliquant les décisions
  • ✓ Sortie des tests ou preuve runtime
  • ✓ Test ACL négatif

Ressources avant l’exécution