Перейти к основному содержимому
Продвинутый8–12 часов

Лаборатория калибровки и надёжности AI graders

Постройте evaluation workflow, в котором model-based grader калибруется на evidence, проверенном людьми, имеет disagreement policy, risk slices и release gate, привязанный к версии.

калибровка graderevaluation designhuman reviewrisk slicingrelease gating

Сценарий

Задача

Команда оценивает сотни AI-ответов model-based grader-ом. Aggregate score выглядит стабильным, но критические edge cases и disagreement с людьми скрываются в среднем. Нужно доказать, когда grader пригоден для release decisions, а когда его verdict должен быть заблокирован или передан на adjudication.

Пошаговое выполнение

1. Зафиксируйте human baseline

Результат: Ground truth имеет provenance и не смешивает disagreement экспертов с ошибкой grader-а.

Задачи

  • Выберите репрезентативные normal, edge и high-impact cases
  • Попросите минимум двух reviewers независимо оценить critical slice
  • Зафиксируйте disagreement и rationale adjudication
  • Версионируйте dataset и rubric

Проверки

  • Critical label не происходит от одного непроверенного judge
  • Ambiguous case имеет явный unresolved или adjudicated state

2. Заморозьте grader fingerprint

Результат: Повторный run можно воспроизвести и объяснить.

Задачи

  • Зафиксируйте model и revision
  • Сохраните grader prompt и rubric
  • Зафиксируйте inference settings и parsing schema
  • Добавьте invalid, refusal и timeout states

Проверки

  • Нет silent fallback на другую model revision
  • Invalid output никогда не конвертируется в PASS

3. Измерьте reliability по risk slices

Результат: Aggregate score больше не скрывает дорогие failure classes.

Задачи

  • Посчитайте agreement и confusion matrix
  • Отдельно измерьте severe false-pass
  • Проверьте multilingual, no-answer и adversarial slices
  • Проанализируйте нестабильные verdicts в повторных trials

Проверки

  • High-severity false-pass имеет отдельный blocking threshold
  • Есть явный список cases для human adjudication

4. Превратите calibration в release gate

Результат: Grader используется только в границах доказанной надёжности.

Задачи

  • Определите policy PASS, REVIEW, BLOCKED и UNKNOWN
  • Требуйте повторную калибровку при изменении model, prompt или rubric
  • Возвращайте production disagreement в regression loop
  • Сохраняйте machine-readable report в CI

Проверки

  • Изменение grader fingerprint инвалидирует старое calibration evidence
  • Override имеет owner, rationale и audit trail

Критерии приёмки

  • Есть versioned human-reviewed calibration set
  • Grader fingerprint полностью воспроизводим
  • High-severity false-pass измеряется отдельно
  • Disagreement имеет adjudication path
  • Release gate никогда не принимает UNKNOWN или invalid output как PASS