Перейти к основному содержимому
Основной6–10 часов

Контроль приватности и lineage для аналитики

Постройте privacy-aware AI analytics pipeline с минимизацией данных, проверками прав, lineage, egress-контролями, retention и негативными тестами до передачи чувствительного контекста модели.

минимизация данныхклассификация PIIконтроль доступаlineageegress governanceтестирование приватности

Сценарий

Задача

Аналитику нужно исследовать поведение клиентов, но исходный dataset содержит идентификаторы, контактные данные, внутренние заметки и поля, не нужные для задачи. AI-инструмент может ускорить анализ, однако «мы не просили модель показывать PII» не является контролем. Докажите, что чувствительные поля не попадают в контекст модели или инструмента без необходимости, доступы соответствуют задаче, а каждый опубликованный insight имеет lineage до разрешённого source slice.

Пошаговое выполнение

1. Классифицируйте данные по назначению, а не по удобству

Результат: В pipeline попадают только поля, необходимые для конкретной аналитической задачи.

Задачи

  • Инвентаризируйте columns и derived fields
  • Отметьте прямые и косвенные идентификаторы и чувствительные категории
  • Привяжите каждое поле к явному purpose
  • Удалите или агрегируйте поля без task necessity

Проверки

  • «Может пригодиться» не является purpose
  • Derived field наследует privacy classification от source inputs
  • Минимизированное представление воспроизводится из version-controlled transformation

2. Отделите identity/permission plane от model reasoning

Результат: LLM не решает, какие данные пользователь имеет право видеть.

Задачи

  • Проверяйте user/service identity до retrieval/query
  • Применяйте row/column/tenant filters до model context
  • Считайте внешние processors/tools отдельными egress boundaries
  • Установите read-only как default для analytics tools

Проверки

  • Неавторизованные данные не появляются в prompt даже по прямому запросу
  • Tool schema не расширяет business authority
  • Cross-tenant negative test завершается deterministic deny

3. Постройте end-to-end lineage

Результат: Каждый claim и artifact можно воспроизвести до конкретной версии разрешённых данных.

Задачи

  • Запишите source snapshot/version
  • Сохраните transformations и query hash
  • Свяжите output claims с source slices
  • Зафиксируйте model/tool configuration и timestamp

Проверки

  • Lineage не обрывается на «AI generated»
  • Stale source или permission version видны в trace
  • Published artifact имеет reproducible evidence path

4. Проведите инъекцию privacy failures

Результат: Защита подтверждается негативными тестами, а не презентацией политики.

Задачи

  • Попробуйте запросить excluded PII через prompt
  • Симулируйте stale group membership
  • Проверьте tool/result leakage и logs
  • Проверьте propagation удаления и retention

Проверки

  • Критическая утечка блокирует rollout
  • Logs не хранят raw sensitive payload без явной policy
  • Удаление или отзыв доступа распространяется по analytical cache, index и context path

Критерии приёмки

  • Каждое поле в AI-visible dataset имеет явные purpose и classification
  • Permission filtering происходит до model/tool context и имеет negative tests
  • Есть end-to-end lineage от source snapshot до опубликованного claim/artifact
  • External egress, logs, retention и propagation удаления описаны и проверены
  • Cross-tenant или unauthorized-field leakage является hard blocker независимо от aggregate quality score