Перейти к основному содержимому
Основной10–16 часов

AI Quality Gate в CI

Создайте regression gate для LLM-функции с deterministic checks, model graders, safety cases и release thresholds.

test designevaluation datasetsmodel graderssafety testingCI gates

Сценарий

Задача

Команда регулярно меняет prompts и модели. Нужен автоматический gate, который блокирует релиз при ухудшении качества, безопасности или стабильности structured outputs.

Пошаговое выполнение

1. Постройте test taxonomy

Результат: Риски продукта покрыты явными классами тестов.

Задачи

  • Выделите happy paths
  • Добавьте edge cases
  • Добавьте prompt injection и hallucination cases
  • Назначьте severity

Проверки

  • Каждый критический риск имеет test case
  • Dataset не состоит только из happy paths

2. Реализуйте graders

Результат: Для каждого свойства есть подходящий способ оценки.

Задачи

  • Добавьте schema checks
  • Добавьте exact/regex assertions
  • Настройте model grader
  • Откалибруйте grader на вручную проверенной выборке

Проверки

  • Deterministic checks не заменены LLM judge
  • У grader есть calibration evidence

3. Определите regression policy

Результат: Решения о релизе принимаются по зафиксированным правилам.

Задачи

  • Зафиксируйте baseline
  • Определите blocking thresholds
  • Разделите quality и safety gates
  • Добавьте exception process

Проверки

  • Safety regression всегда блокирует релиз
  • Thresholds хранятся в version control

4. Интегрируйте CI report

Результат: Каждое изменение получает прозрачный verdict.

Задачи

  • Запускайте evals в CI
  • Публикуйте summary
  • Сохраняйте raw results
  • Добавляйте failure examples

Проверки

  • Провал gate завершает job с failure
  • Результаты можно сравнивать между runs

Критерии приёмки

  • Dataset покрывает normal, edge и adversarial cases
  • Есть deterministic и model-based graders
  • Safety regressions блокируют релиз
  • CI сохраняет raw evidence
  • Baseline и thresholds версионируются

Рубрика оценки

Как оценивается результат

Проходной балл: 75/100 · Отличие: 92/100

Покрытие рисков

Dataset покрывает normal, edge и adversarial сценарии.

25 баллов

Недостаточно

Преобладают happy paths.

Компетентно

Критические риски покрыты.

Сильно

Coverage связано с production failures и threat model.

Необходимые доказательства

  • ✓ Ссылка на код или артефакт
  • ✓ README с решениями
  • ✓ Вывод тестов или runtime evidence
  • ✓ Test taxonomy и severity map

Качество graders

Deterministic checks и model graders соответствуют проверяемым свойствам.

25 баллов

Недостаточно

Всё оценивает один LLM judge.

Компетентно

Deterministic и model-based checks разделены.

Сильно

Grader calibration и disagreement analysis автоматизированы.

Необходимые доказательства

  • ✓ Ссылка на код или артефакт
  • ✓ README с решениями
  • ✓ Вывод тестов или runtime evidence
  • ✓ Calibration sample

Regression policy

Baseline, thresholds и blocking rules версионируются.

25 баллов

Недостаточно

Verdict субъективен.

Компетентно

Thresholds и blocking conditions явные.

Сильно

Есть risk-based exceptions и trend analysis.

Необходимые доказательства

  • ✓ Ссылка на код или артефакт
  • ✓ README с решениями
  • ✓ Вывод тестов или runtime evidence
  • ✓ Release policy

CI интеграция

Gate блокирует слабый релиз и сохраняет evidence.

25 баллов

Недостаточно

Отчёт не влияет на релиз.

Компетентно

Failure завершает job с ошибкой.

Сильно

Есть artifacts, diff report и flaky-eval control.

Необходимые доказательства

  • ✓ Ссылка на код или артефакт
  • ✓ README с решениями
  • ✓ Вывод тестов или runtime evidence
  • ✓ Failed и passed CI run