Перейти до основного вмісту
Просунутий10–16 годин

AI Incident Recovery & Reconciliation Drill

Проведіть production drill для provider outage, model regression і невизначених side effects: containment, evidence preservation, reconcile-first recovery, known-good rollback, failback та incident-to-regression.

AI incident responsecontainmentreconciliationrollbackfailbackpost-incident regression

Сценарій

Задача

AI workflow викликає зовнішню модель та tools, після чого request завершується timeout. Невідомо, чи tool-side effect уже стався. Сліпий retry може створити дубль, а rollback лише application code не гарантує повернення model/prompt/retrieval configuration. Потрібен drill, де команда відновлює authoritative state, а не просто перезапускає сервіс.

Покрокове виконання

1. Класифікуйте інцидент за фактичним impact

Результат: Containment пріоритезує authority, data exposure і irreversible side effects, а не гучність алерту.

Завдання

  • Визначте affected tasks/users/data/actions
  • Перевірте model/provider/retrieval/tool state
  • Оцініть unknown/pending side effects
  • Активуйте найвужчий достатній kill switch або degraded mode

Перевірки

  • Containment не знищує потрібні forensic artifacts
  • High-impact write path може бути зупинений окремо від read-only functions
  • Unknown side effect не позначається як failed без перевірки

2. Збережіть evidence і reconciliate authoritative state

Результат: Команда знає, що реально відбулося до будь-якого retry або compensation.

Завдання

  • Зберіть correlation/runtime envelope
  • Зіставте tool request з system-of-record state
  • Перевірте idempotency key та duplicate history
  • Класифікуйте outcome як completed/not-completed/pending/unknown

Перевірки

  • Retry заборонений для pending/unknown до reconciliation
  • Authoritative system має пріоритет над agent transcript
  • Evidence не містить зайвих secrets/PII

3. Виконайте rollback, compensation і staged recovery

Результат: Система повертається до known-good behavior та консистентного business state.

Завдання

  • Rollback full behavior envelope
  • Виконайте compensation лише для підтверджених side effects
  • Проведіть smoke/eval checks
  • Відкривайте traffic поетапно з hold period

Перевірки

  • Rollback включає model/prompt/retrieval/tool/policy versions
  • Compensation itself is idempotent або reconciled
  • Recovery PASS вимагає runtime і authoritative-state evidence

4. Перетворіть інцидент на regression control

Результат: Та сама failure family більше не залежить від пам’яті команди.

Завдання

  • Мінімізуйте reproducer
  • Додайте deterministic/model-based checks за потреби
  • Прив’яжіть case до blocking severity
  • Оновіть runbook, alert і owner

Перевірки

  • Regression test відтворює original failure signal
  • Критичний incident-derived case входить у release gate
  • Postmortem містить control change, а не лише “бути уважнішими”

Критерії приймання

  • Incident map має scoped containment для model/provider/retrieval/tool/write failures
  • Unknown або pending side effect проходить authoritative reconciliation до retry
  • Rollback повертає повний behavior envelope, а не лише code commit
  • Recovery підтверджена runtime fingerprint та authoritative business state
  • Production incident мінімізований у permanent regression case з owner і severity

Матеріали перед виконанням