Saltar al contenido principal
Esencial6–10 horas

Gate de privacidad y linaje para analítica

Construye un pipeline de analítica con IA consciente de privacidad mediante minimización de datos, controles de permisos, linaje, controles de egress, retención y pruebas negativas antes de enviar contexto sensible al modelo.

minimización de datosclasificación de PIIcontrol de accesolinajegobernanza de egresspruebas de privacidad

Escenario

Tarea

Un analista debe estudiar el comportamiento de clientes, pero el dataset fuente contiene identificadores, datos de contacto, notas internas y campos innecesarios para la tarea. Una herramienta de IA puede acelerar el análisis, pero “no pedimos al modelo que mostrara PII” no es un control. Demuestra que los campos sensibles no entran en el contexto del modelo o herramienta sin necesidad, que los permisos corresponden a la tarea y que cada insight publicado tiene linaje hasta un source slice autorizado.

Ejecución paso a paso

1. Clasifica los datos por propósito, no por comodidad

Resultado: Solo los campos necesarios para el trabajo analítico específico entran en el pipeline.

Tareas

  • Inventaria columnas y campos derivados
  • Marca identificadores directos e indirectos y categorías sensibles
  • Vincula cada campo a un propósito explícito
  • Elimina o agrega campos sin necesidad para la tarea

Comprobaciones

  • “Podría ser útil” no es un propósito
  • Un campo derivado hereda la clasificación de privacidad de sus inputs
  • La vista minimizada se reproduce desde una transformación versionada

2. Separa identidad y permisos del razonamiento del modelo

Resultado: El LLM no decide qué datos puede ver un usuario.

Tareas

  • Valida identidad de usuario o servicio antes de retrieval o query
  • Aplica filtros de fila, columna y tenant antes del contexto del modelo
  • Trata procesadores y herramientas externos como límites de egress separados
  • Configura read-only como default para herramientas analíticas

Comprobaciones

  • Los datos no autorizados no pueden aparecer en el prompt ni ante una petición directa
  • El schema de la herramienta no amplía la autoridad de negocio
  • Una prueba cross-tenant termina en deny determinista

3. Construye linaje end-to-end

Resultado: Cada claim y artefacto puede reproducirse hasta una versión concreta de datos autorizados.

Tareas

  • Registra snapshot y versión de la fuente
  • Guarda transformaciones y hash de la query
  • Vincula claims de salida con source slices
  • Registra configuración de modelo/herramienta y timestamp

Comprobaciones

  • El linaje no termina en “AI generated”
  • Una versión stale de fuente o permiso queda visible en la traza
  • El artefacto publicado tiene un evidence path reproducible

4. Inyecta fallos de privacidad

Resultado: La protección se demuestra con pruebas negativas, no con una presentación de políticas.

Tareas

  • Intenta solicitar PII excluida mediante el prompt
  • Simula membresía de grupo stale
  • Prueba leakage de herramienta/resultado y logs
  • Prueba propagación de borrado y retención

Comprobaciones

  • Una fuga crítica bloquea el rollout
  • Los logs no conservan payloads sensibles en bruto sin política explícita
  • El borrado o revocación de acceso se propaga por cache, index y context path analíticos

Criterios de aceptación

  • Cada campo visible para IA tiene propósito y clasificación explícitos
  • El filtrado de permisos ocurre antes del contexto de modelo/herramienta y tiene pruebas negativas
  • Existe linaje end-to-end desde el snapshot fuente hasta el claim o artefacto publicado
  • Egress externo, logs, retención y propagación de borrado están documentados y probados
  • La fuga cross-tenant o de campos no autorizados es un hard blocker sin importar el quality score agregado