Перейти к основному содержимому
Основной8–14 часов

Лаборатория AI Observability, SLO и Runtime Evidence

Постройте observability contract для AI workload: сквозные traces, SLI/SLO с разделением по риску, сигналы quality и cost, privacy-aware telemetry, авторитетные postconditions и runtime evidence, которое отличает реальное состояние production от красивого dashboard.

AI observabilitydistributed tracingSLI/SLO designruntime evidencecost attributionprivacy-aware telemetry

Сценарий

Задача

AI-сервис показывает зелёный uptime и приемлемую median latency, но high-risk задачи деградируют после изменения model revision, retrieval или tool dependency. Общий dashboard этого не показывает, а raw prompts в traces создают privacy-риск. Постройте observability contract, который связывает request с behavior fingerprint, spans model/retrieval/tool, фактическим business outcome и cost, не превращая telemetry в новое хранилище секретов.

Пошаговое выполнение

1. Спроектируйте trace как evidence graph, а не log dump

Результат: Одна задача прослеживается через model, retrieval, tool, approval и авторитетный outcome без потери release identity.

Задачи

  • Определить correlation/run ID и parent-child span contract
  • Добавить behavior fingerprint без secrets
  • Разделить spans model/retrieval/tool/approval/outcome
  • Пометить состояния telemetry sampled, dropped и unavailable

Проверки

  • Trace позволяет установить конкретную model/config revision
  • Missing span не интерпретируется как успех
  • High-cardinality labels не создают неконтролируемый cost explosion

2. Установите границу privacy и data minimization

Результат: Observability даёт достаточно evidence для диагностики без неконтролируемого копирования prompt, PII и tool payloads.

Задачи

  • Классифицировать metadata, content и sensitive fields
  • Применить redaction или hashing перед экспортом
  • Определить retention и access policy
  • Рассматривать provider/exporter path как отдельную data-egress boundary

Проверки

  • Secrets и credentials не попадают в spans
  • Sensitive content не включён по умолчанию для всех traces
  • Retention и deletion имеют owner и проверяемый policy state

3. Постройте risk-sliced SLO и unit economics

Результат: Команда видит не только uptime, но и quality, verified outcome и стоимость для разных классов задач.

Задачи

  • Определить SLI для latency, availability, quality и authoritative task success
  • Разделить normal/high-risk/no-answer/tool-write slices
  • Добавить cost per successful verified task
  • Назначить error budget и blocking threshold для critical slices

Проверки

  • Aggregate average не скрывает critical-slice regression
  • Failed или unsafe task не считается successful outcome
  • У каждого SLO есть конкретные data source, window и owner

4. Проведите runtime-evidence и incident drill

Результат: Alert приводит к воспроизводимой причине, а incident становится regression control.

Задачи

  • Инжектировать stale model/retrieval fingerprint
  • Симулировать tool timeout с неопределённым side effect
  • Проверить путь UNKNOWN → reconciliation → verified outcome
  • Минимизировать failure в replay/regression case и привязать к release gate

Проверки

  • Runtime mismatch не может завершиться PASS
  • Retry не происходит до reconciliation неопределённого side effect
  • Incident report содержит trace/evidence link, control change, owner и regression test

Критерии приёмки

  • End-to-end trace связывает release fingerprint, этапы model/retrieval/tool и авторитетный outcome
  • Telemetry имеет контракт data minimization, redaction, retention и access
  • SLI/SLO разделены по risk/task slices и включают cost per successful verified task
  • Missing или stale runtime evidence завершается UNKNOWN/FAIL, но не false-green PASS
  • Как минимум один injected incident преобразован в minimized replay и permanent regression case