Zum Hauptinhalt springen
Kern12–20 Stunden

Evidenzbasierter Wissensassistent

Baue einen RAG-Assistenten, der nur auf verifizierter Evidenz antwortet, Quellen zitiert und die Retrieval-Qualität misst.

IngestionChunkingHybrid RetrievalRerankingZitationenRAG-Evaluation

Szenario

Aufgabe

Ein Team benötigt einen Assistenten für interne Richtlinien. Das System darf keine Antworten erfinden, muss Quellen offenlegen und bei unzureichender Evidenz die Antwort verweigern.

Schrittweise Umsetzung

1. Korpus vorbereiten

Ergebnis: Dokumente besitzen Owner-, Versions- und Zugriffsmetadaten.

Aufgaben

  • 20–50 Dokumente auswählen
  • Struktur bereinigen
  • Metadaten ergänzen
  • Source URI speichern

Prüfungen

  • Jeder Chunk besitzt eine Quelle
  • Versionierung ist reproduzierbar

2. Retrieval konfigurieren

Ergebnis: Relevante Passagen gelangen stabil in die Top-k.

Aufgaben

  • Chunk-Größen vergleichen
  • Lexical + Vector Search hinzufügen
  • Reranking konfigurieren
  • ACL-Filter hinzufügen

Prüfungen

  • Ein Test-Query-Set existiert
  • ACL wird mit negativen Tests geprüft

3. Evidenzvertrag bauen

Ergebnis: Das Modell kann fehlende Evidenz nicht verbergen.

Aufgaben

  • Citation-Schema definieren
  • Abstention ergänzen
  • Source IDs validieren
  • Unsupported Claims ablehnen

Prüfungen

  • Jede Aussage hat eine Citation oder Abstention
  • Eine unbekannte Source ID blockiert die Antwort

4. Evaluation durchführen

Ergebnis: Retrieval- und Generierungsqualität werden getrennt gemessen.

Aufgaben

  • Golden Set erstellen
  • Recall@k berechnen
  • Citation Correctness bewerten
  • Fehlertaxonomie erstellen

Prüfungen

  • Eine Baseline existiert
  • Ein Regression Threshold ist dokumentiert

Akzeptanzkriterien

  • Alle Zitationen öffnen eine reale Quelle
  • ACL verhindert Datenlecks
  • Schwache Evidenz führt zu Abstention
  • Der Evaluationsbericht enthält Baseline und Fehlerbeispiele

Bewertungsraster

Wie das Ergebnis bewertet wird

Bestehensgrenze: 70/100 · Auszeichnung: 90/100

Korpus und Provenienz

Dokumente, Chunks, Metadaten, Versionen und Source URIs sind reproduzierbar.

20 Punkte

Unzureichend

Quellen besitzen keine Version oder Owner-Metadaten, oder Chunks verlieren ihre Provenienz.

Kompetent

Jeder Chunk besitzt Quelle, Metadaten und Version.

Stark

Freshness Policy, Lineage und Change Control sind umgesetzt.

Erforderliche Nachweise

  • ✓ Link zu Code oder Artefakt
  • ✓ Kurzes README mit Entscheidungen
  • ✓ Testausgabe oder Runtime-Evidenz
  • ✓ Beispieldokument und zugehörige Chunks

Retrieval-Qualität

Hybrid Retrieval, Filter und Reranking werden auf einem Query Set gemessen.

30 Punkte

Unzureichend

Es gibt kein Testset oder Retrieval wird subjektiv bewertet.

Kompetent

Baseline, Query Set und messbares Top-k existieren.

Stark

Mehrere Strategien werden mit Regression Threshold und Fehlertaxonomie verglichen.

Erforderliche Nachweise

  • ✓ Link zu Code oder Artefakt
  • ✓ Kurzes README mit Entscheidungen
  • ✓ Testausgabe oder Runtime-Evidenz
  • ✓ Recall@k oder vergleichbare Retrieval-Metrik

Grounding und Zitationen

Aussagen werden durch Evidenz gestützt; fehlende Evidenz führt zu Abstention.

30 Punkte

Unzureichend

Das Modell kann ohne Evidenz antworten oder Zitationen öffnen die Quelle nicht.

Kompetent

Unsupported Claims werden blockiert und Zitationen sind valide.

Stark

Groundedness und Citation Correctness werden automatisch gemessen.

Erforderliche Nachweise

  • ✓ Link zu Code oder Artefakt
  • ✓ Kurzes README mit Entscheidungen
  • ✓ Testausgabe oder Runtime-Evidenz
  • ✓ Beispiele korrekter Zitation und Abstention

Zugriffskontrolle und Sicherheit

ACL wird bereits im Retrieval angewendet und mit negativen Tests geprüft.

20 Punkte

Unzureichend

Filterung erfolgt erst nach Retrieval oder Leaks sind weiterhin möglich.

Kompetent

ACL wird in der Suche angewendet und negativ getestet.

Stark

Tenant Isolation, Audit Log und Policy Tests sind umgesetzt.

Erforderliche Nachweise

  • ✓ Link zu Code oder Artefakt
  • ✓ Kurzes README mit Entscheidungen
  • ✓ Testausgabe oder Runtime-Evidenz
  • ✓ Negativer ACL-Test

Materialien vor der Umsetzung