Перейти к основному содержимому
Продвинутый12–18 часов

Production Observability для AI-системы

Постройте monitoring и incident workflow для AI-нагрузки с evidence по latency, cost, quality, fallback и rollback.

SLOtracingcost monitoringquality signalsincident responsefallbacks

Сценарий

Задача

AI-функция использует внешнюю модель и внутренний retrieval. Команда должна видеть деградацию latency, cost, error rate и answer quality до того, как её заметят пользователи.

Пошаговое выполнение

1. Определите сигналы

Результат: Операционное состояние AI-функции измеряется по всему pipeline.

Задачи

  • Добавьте latency и error rate
  • Измеряйте token/cost usage
  • Добавьте retrieval и quality signals
  • Коррелируйте request ID

Проверки

  • Есть end-to-end trace
  • PII и prompts не попадают в logs без явной политики

2. Постройте SLO

Результат: У команды есть явные границы допустимой деградации.

Задачи

  • Определите availability SLO
  • Добавьте latency SLO
  • Определите quality proxy
  • Рассчитайте error budget

Проверки

  • Alerts привязаны к user impact
  • Одиночный transient error не вызывает alert

3. Добавьте control plane

Результат: Система безопасно переходит в degraded mode.

Задачи

  • Добавьте rate limits
  • Настройте fallback model
  • Добавьте queue backpressure
  • Реализуйте kill switch

Проверки

  • Fallback тестируется
  • Kill switch не требует нового deploy

4. Проведите incident drill

Результат: Восстановление подтверждено evidence.

Задачи

  • Симулируйте provider outage
  • Симулируйте cost spike
  • Проверьте rollback
  • Создайте postmortem

Проверки

  • Timeline восстанавливается из telemetry
  • Recovery соответствует runbook

Критерии приёмки

  • Есть end-to-end observability
  • SLO и error budget зафиксированы
  • Cost и quality имеют alerts
  • Fallback и kill switch проверены
  • Incident drill завершён postmortem

Рубрика оценки

Как оценивается результат

Проходной балл: 75/100 · Отличие: 92/100

Покрытие телеметрией

Model, retrieval и application layers имеют end-to-end visibility.

25 баллов

Недостаточно

Есть только application logs.

Компетентно

Latency, errors, cost и quality коррелируются.

Сильно

Есть distributed tracing и redaction policy.

Необходимые доказательства

  • ✓ Ссылка на код или артефакт
  • ✓ README с решениями
  • ✓ Вывод тестов или runtime evidence
  • ✓ Карта traces и metrics

SLO и alerts

Alerts отражают user impact и error budget.

25 баллов

Недостаточно

Alerts шумные или без SLO.

Компетентно

SLO и thresholds зафиксированы.

Сильно

Burn-rate alerts и capacity signals автоматизированы.

Необходимые доказательства

  • ✓ Ссылка на код или артефакт
  • ✓ README с решениями
  • ✓ Вывод тестов или runtime evidence
  • ✓ SLO document и примеры alerts

Fallback и control plane

Rate limits, fallback, backpressure и kill switch проверены.

25 баллов

Недостаточно

Нет безопасного degraded mode.

Компетентно

Fallback и kill switch работают.

Сильно

Есть автоматическое routing и rollback policy.

Необходимые доказательства

  • ✓ Ссылка на код или артефакт
  • ✓ README с решениями
  • ✓ Вывод тестов или runtime evidence
  • ✓ Fallback test

Готовность к инцидентам

Failure drill содержит timeline, recovery и postmortem.

25 баллов

Недостаточно

Runbook только декларативный.

Компетентно

Drill пройден с evidence.

Сильно

Recovery автоматизирован и регулярно тестируется.

Необходимые доказательства

  • ✓ Ссылка на код или артефакт
  • ✓ README с решениями
  • ✓ Вывод тестов или runtime evidence
  • ✓ Incident report