Перейти до основного вмісту
Просунутий8–12 годин

AI Grader Calibration & Reliability Lab

Побудуйте evaluation workflow, у якому model-based grader калібрується на human-reviewed evidence, має disagreement policy, risk slices і version-bound release gate.

grader calibrationevaluation designhuman reviewrisk slicingrelease gating

Сценарій

Задача

Команда оцінює сотні AI-відповідей model-based grader-ом. Aggregate score виглядає стабільно, але критичні edge cases та disagreement з людьми ховаються в середньому. Потрібно довести, коли grader придатний для release decisions, а коли його verdict має бути заблокований або переданий на adjudication.

Покрокове виконання

1. Зафіксуйте human baseline

Результат: Ground truth має provenance і не змішує незгоду експертів із помилкою grader-а.

Завдання

  • Виберіть representative normal/edge/high-impact cases
  • Дайте мінімум двом reviewers незалежно оцінити critical slice
  • Зафіксуйте disagreement та adjudication rationale
  • Версіонуйте dataset і rubric

Перевірки

  • Critical label не походить з одного неперевіреного judge
  • Ambiguous case має explicit unresolved/adjudicated state

2. Заморозьте grader fingerprint

Результат: Повторний run можна відтворити та пояснити.

Завдання

  • Зафіксуйте model/revision
  • Збережіть grader prompt/rubric
  • Зафіксуйте inference settings і parsing schema
  • Додайте invalid/refusal/timeout states

Перевірки

  • Немає silent fallback на іншу model revision
  • Invalid output не конвертується у PASS

3. Виміряйте reliability по risk slices

Результат: Aggregate score більше не приховує дорогі failure classes.

Завдання

  • Порахуйте agreement і confusion matrix
  • Окремо виміряйте severe false-pass
  • Перевірте multilingual/no-answer/adversarial slices
  • Проаналізуйте нестабільні verdicts у повторних trials

Перевірки

  • High-severity false-pass має окремий blocking threshold
  • Є список cases для human adjudication

4. Перетворіть calibration на release gate

Результат: Grader використовується лише в межах доведеної придатності.

Завдання

  • Задайте PASS/REVIEW/BLOCKED/UNKNOWN policy
  • Додайте re-calibration при model/prompt/rubric change
  • Додайте production disagreement → regression loop
  • Збережіть machine-readable report у CI

Перевірки

  • Зміна grader fingerprint інвалідовує старий calibration evidence
  • Override має owner, rationale й audit trail

Критерії приймання

  • Є versioned human-reviewed calibration set
  • Grader fingerprint повністю відтворюваний
  • High-severity false-pass вимірюється окремо
  • Disagreement має adjudication path
  • Release gate не приймає UNKNOWN/invalid як PASS

Матеріали перед виконанням

Оцінювання LLM-систем у production

Як побудувати evaluation set, автоматичні та людські метрики, regression gates і спостережуваність для промптів, RAG та агентів.

Model graders: калібрування і ризики

Model grader масштабує оцінювання відкритих відповідей, але може успадковувати упередження, позиційний ефект і помилки самої моделі. Розбираємо rubric, blinded judging, калібрування з людьми, стабільність, захист від grader hacking і контроль версій.

Метрики якості LLM

Метрики якості LLM мають відображати продуктову задачу, а не зводити складну поведінку до одного числа. Пояснюємо exact та semantic metrics, rubric scores, calibration, сегментацію, статистичну невизначеність і правила release gate.

Incident response для AI

AI incident response адаптує Detect–Respond–Recover до помилок моделей, retrieval, tools, даних і політик. Розглядаємо severity, evidence preservation, containment, safe rollback, комунікації, відновлення та перетворення інцидентів на контрольні тести.