Перейти к основному содержимому
Основной12–20 часов

Ассистент знаний с приоритетом доказательств

Создайте RAG-ассистента, который отвечает только по проверенным доказательствам, показывает цитаты и измеряет качество retrieval.

ingestionchunkinghybrid retrievalrerankingcitationsRAG evaluation

Сценарий

Задача

Команде нужен ассистент для внутренних политик. Система не должна выдумывать ответы, должна показывать источники и отказываться от ответа при недостаточных доказательствах.

Пошаговое выполнение

1. Подготовьте корпус

Результат: Документы имеют owner, version и access metadata.

Задачи

  • Выберите 20–50 документов
  • Очистите структуру
  • Добавьте metadata
  • Сохраните source URI

Проверки

  • Каждый chunk имеет источник
  • Versioning воспроизводим

2. Настройте retrieval

Результат: Релевантные фрагменты стабильно попадают в top-k.

Задачи

  • Сравните размеры chunk
  • Добавьте lexical + vector search
  • Настройте reranking
  • Добавьте ACL filter

Проверки

  • Есть тестовый query set
  • ACL покрыт негативными тестами

3. Постройте контракт доказательств

Результат: Модель не может скрыть отсутствие доказательств.

Задачи

  • Определите citation schema
  • Добавьте abstention
  • Проверяйте source IDs
  • Отклоняйте unsupported claims

Проверки

  • Каждое утверждение имеет citation или abstention
  • Неизвестный source ID блокирует ответ

4. Проведите evaluation

Результат: Качество retrieval и generation измеряется отдельно.

Задачи

  • Создайте golden set
  • Посчитайте recall@k
  • Оцените citation correctness
  • Соберите failure taxonomy

Проверки

  • Есть baseline
  • Зафиксирован regression threshold

Критерии приёмки

  • Все citations открывают реальный источник
  • ACL не допускает утечки данных
  • При слабых доказательствах есть abstention
  • Evaluation report содержит baseline и примеры сбоев

Рубрика оценки

Как оценивается результат

Проходной балл: 70/100 · Отличие: 90/100

Корпус и provenance

Документы, chunks, metadata, versions и source URI воспроизводимы.

20 баллов

Недостаточно

У источников нет version/owner metadata или chunks теряют provenance.

Компетентно

Каждый chunk имеет source, metadata и version.

Сильно

Добавлены freshness policy, lineage и контроль изменений.

Необходимые доказательства

  • ✓ Ссылка на код или артефакт
  • ✓ Короткий README с решениями
  • ✓ Вывод тестов или runtime evidence
  • ✓ Пример документа и его chunks

Качество retrieval

Hybrid retrieval, filters и reranking измеряются на query set.

30 баллов

Недостаточно

Нет тестового набора или retrieval оценивается субъективно.

Компетентно

Есть baseline, query set и измеримый top-k.

Сильно

Сравниваются несколько стратегий, есть regression threshold и failure taxonomy.

Необходимые доказательства

  • ✓ Ссылка на код или артефакт
  • ✓ Короткий README с решениями
  • ✓ Вывод тестов или runtime evidence
  • ✓ Recall@k или аналогичная retrieval-метрика

Grounding и citations

Утверждения поддерживаются доказательствами, а отсутствие доказательств ведёт к abstention.

30 баллов

Недостаточно

Модель может отвечать без доказательств или citations не открывают источник.

Компетентно

Unsupported claims блокируются, citations валидны.

Сильно

Groundedness и citation correctness измеряются автоматически.

Необходимые доказательства

  • ✓ Ссылка на код или артефакт
  • ✓ Короткий README с решениями
  • ✓ Вывод тестов или runtime evidence
  • ✓ Примеры корректной citation и abstention

Access control и безопасность

ACL применяется во время retrieval и проверяется негативными тестами.

20 баллов

Недостаточно

Фильтрация происходит после retrieval или утечка всё ещё возможна.

Компетентно

ACL применяется к поиску и покрыт негативными тестами.

Сильно

Реализованы tenant isolation, audit log и policy tests.

Необходимые доказательства

  • ✓ Ссылка на код или артефакт
  • ✓ Короткий README с решениями
  • ✓ Вывод тестов или runtime evidence
  • ✓ Негативный ACL test

Материалы перед выполнением