Перейти до основного вмісту
Основний8–14 годин

AI Observability, SLO & Runtime Evidence Lab

Побудуйте observability contract для AI workload: наскрізні traces, risk-sliced SLI/SLO, quality та cost signals, privacy-aware telemetry, authoritative postconditions і runtime evidence, яке відрізняє справжній production стан від красивого dashboard.

AI observabilitydistributed tracingSLI/SLO designruntime evidencecost attributionprivacy-aware telemetry

Сценарій

Задача

AI сервіс має зелений uptime і прийнятну median latency, але high-risk задачі деградують після зміни model revision, retrieval або tool dependency. Загальний dashboard цього не показує, а raw prompts у traces створюють privacy-ризик. Потрібен observability contract, який пов’язує request із behavior fingerprint, model/retrieval/tool spans, фактичним business outcome і cost — без перетворення telemetry на нове сховище секретів.

Покрокове виконання

1. Спроєктуйте trace як evidence graph, а не log dump

Результат: Одна задача простежується через model, retrieval, tool, approval і authoritative outcome без втрати release identity.

Завдання

  • Визначте correlation/run ID і parent-child span contract
  • Додайте behavior fingerprint без secrets
  • Розділіть model/retrieval/tool/approval/outcome spans
  • Позначте sampled, dropped і unavailable telemetry states

Перевірки

  • Trace дозволяє встановити конкретний model/config revision
  • Missing span не інтерпретується як успіх
  • High-cardinality labels не створюють неконтрольований cost explosion

2. Встановіть privacy та data-minimization boundary

Результат: Observability дає достатньо evidence для діагностики без безконтрольного копіювання prompt, PII і tool payloads.

Завдання

  • Класифікуйте metadata, content і sensitive fields
  • Застосуйте redaction або hashing до експорту
  • Визначте retention і access policy
  • Перевірте provider/exporter path як окремий data-egress boundary

Перевірки

  • Secrets і credentials не потрапляють у spans
  • Sensitive content не увімкнений за замовчуванням для всіх traces
  • Retention та deletion мають owner і перевірюваний policy state

3. Побудуйте risk-sliced SLO та unit economics

Результат: Команда бачить не лише uptime, а якість, verified outcome і вартість для різних класів задач.

Завдання

  • Визначте SLI для latency, availability, quality і authoritative task success
  • Розділіть normal/high-risk/no-answer/tool-write slices
  • Додайте cost per successful verified task
  • Призначте error budget і blocking threshold для critical slices

Перевірки

  • Aggregate average не приховує critical-slice regression
  • Failed або unsafe task не рахується як successful outcome
  • SLO має конкретний data source, window і owner

4. Проведіть runtime-evidence та incident drill

Результат: Alert веде до відтворюваної причини, а incident стає regression control.

Завдання

  • Інжектуйте stale model/retrieval fingerprint
  • Симулюйте tool timeout із невизначеним side effect
  • Перевірте UNKNOWN → reconciliation → verified outcome path
  • Мінімізуйте failure у replay/regression case і прив’яжіть до release gate

Перевірки

  • Runtime mismatch не може завершитися PASS
  • Retry не відбувається до reconciliation невизначеного side effect
  • Incident report містить trace/evidence link, control change, owner і regression test

Критерії приймання

  • End-to-end trace зв’язує release fingerprint, model/retrieval/tool stages і authoritative outcome
  • Telemetry має data-minimization, redaction, retention та access contract
  • SLI/SLO розділені за risk/task slices і включають cost per successful verified task
  • Missing або stale runtime evidence завершується UNKNOWN/FAIL, але не false-green PASS
  • Щонайменше один injected incident перетворено на minimized replay і permanent regression case

Матеріали перед виконанням