Перейти к основному содержимому
Продвинутый10–16 часов

Учение по восстановлению и сверке после AI-инцидента

Проведите production drill для provider outage, model regression и неопределённых side effects: containment, сохранение evidence, reconcile-first recovery, known-good rollback, failback и превращение инцидента в regression control.

AI incident responsecontainmentreconciliationrollbackfailbackpost-incident regression

Сценарий

Задача

AI workflow вызывает внешнюю модель и tools, после чего request завершается timeout. Неизвестно, произошёл ли tool-side effect. Слепой retry может создать дубль, а rollback только application code не гарантирует возврат model/prompt/retrieval configuration. Проведите drill, в котором команда восстанавливает authoritative state, а не просто перезапускает сервис.

Пошаговое выполнение

1. Классифицируйте инцидент по фактическому impact

Результат: Containment приоритизирует authority, data exposure и необратимые side effects, а не громкость алерта.

Задачи

  • Определите затронутые tasks, users, data и actions
  • Проверьте model/provider/retrieval/tool state
  • Оцените unknown или pending side effects
  • Активируйте самый узкий достаточный kill switch или degraded mode

Проверки

  • Containment сохраняет необходимые forensic artifacts
  • High-impact write path можно остановить отдельно от read-only functions
  • Unknown side effect не помечается failed без проверки

2. Сохраните evidence и сверяйте authoritative state

Результат: Команда знает, что реально произошло, до любого retry или compensation.

Задачи

  • Соберите correlation/runtime envelope
  • Сверьте tool request с system-of-record state
  • Проверьте idempotency key и duplicate history
  • Классифицируйте outcome как completed, not completed, pending или unknown

Проверки

  • Retry запрещён для pending/unknown до reconciliation
  • Authoritative system имеет приоритет над agent transcript
  • Evidence не содержит лишних secrets или PII

3. Выполните rollback, compensation и staged recovery

Результат: Система возвращается к known-good behavior и консистентному business state.

Задачи

  • Откатите full behavior envelope
  • Выполняйте compensation только для подтверждённых side effects
  • Проведите smoke/eval checks
  • Открывайте traffic поэтапно с hold period

Проверки

  • Rollback включает версии model/prompt/retrieval/tool/policy
  • Compensation сама является idempotent или reconciled
  • Recovery PASS требует runtime и authoritative-state evidence

4. Превратите инцидент в regression control

Результат: Та же failure family больше не зависит от памяти команды.

Задачи

  • Минимизируйте reproducer
  • При необходимости добавьте deterministic/model-based checks
  • Привяжите case к blocking severity
  • Обновите runbook, alert и owner

Проверки

  • Regression test воспроизводит original failure signal
  • Критический incident-derived case входит в release gate
  • Postmortem содержит control change, а не только призыв быть внимательнее

Критерии приёмки

  • Incident map содержит scoped containment для model/provider/retrieval/tool/write failures
  • Unknown или pending side effect проходит authoritative reconciliation до retry
  • Rollback возвращает полный behavior envelope, а не только code commit
  • Recovery подтверждена runtime fingerprint и authoritative business state
  • Production incident минимизирован в permanent regression case с owner и severity