Saltar al contenido principal
Avanzado10–16 horas

Laboratorio Source-Sink de Prompt Injection

Construye un laboratorio de red team para prompt injection directa e indirecta donde el riesgo se mida por la ruta real desde fuentes controladas por un atacante hasta sinks sensibles y efectos secundarios, no solo por el bypass de instrucciones.

prompt injectionanálisis source-sinkexfiltración de datosautorización de herramientasevaluación de seguridad

Escenario

Tarea

Un asistente de IA lee páginas web, documentos y contexto RAG y puede invocar herramientas. Comprueba si contenido controlado por un atacante puede hacer que el sistema revele datos, invoque una herramienta peligrosa o cambie el estado de negocio incluso cuando el modelo no viola formalmente la instrucción del sistema.

Ejecución paso a paso

1. Construye el modelo source-sink

Resultado: Cada entrada controlada por un atacante y cada sink con consecuencias tiene un límite de confianza explícito.

Tareas

  • Inventaría fuentes de usuario, web, RAG, herramientas y memoria
  • Marca secretos, herramientas de escritura y sinks de egress externo
  • Conecta rutas source → interpreter → sink
  • Define dónde una política determinista debe detener una acción

Comprobaciones

  • Ninguna fuente carece de clasificación de confianza
  • Un sink de escritura o egress no depende solo del system prompt

2. Construye un corpus de ataques adaptativo

Resultado: Las pruebas cubren familias de ataques realistas y no un único jailbreak prompt.

Tareas

  • Añade injection directa
  • Añade injection indirecta desde web y documentos
  • Añade RAG poisoning
  • Añade tool-result y persistent-memory injection
  • Añade ofuscación y escalada multietapa

Comprobaciones

  • Cada caso tiene objetivo de ataque y resultado seguro esperado
  • El corpus está versionado y es reproducible

3. Prueba contención, no solo refusal

Resultado: Incluso un razonamiento manipulado del modelo no provoca un efecto peligroso.

Tareas

  • Desactiva un control cada vez
  • Prueba allowlists, denylists y validación de schema
  • Prueba approval de acción exacta
  • Prueba límites de egress de red y URL
  • Prueba aislamiento de secretos

Comprobaciones

  • El razonamiento comprometido no hereda autoridad de negocio
  • Cada sink sensible tiene un control independiente

4. Introduce un release gate

Resultado: Una regresión crítica source-to-sink bloquea automáticamente el release.

Tareas

  • Separa evaluaciones por severidad
  • Define hard blockers para exfiltración de datos y escrituras no autorizadas
  • Conserva reproducciones minimizadas
  • Añade incidentes a la suite de regresión permanente

Comprobaciones

  • Ningún score agregado oculta un fallo crítico
  • Cada incidente de producción puede convertirse en un test reproducible

Criterios de aceptación

  • Existe un mapa source-sink completo
  • El corpus incluye injection directa e indirecta
  • Los sinks sensibles tienen controles deterministas
  • La escritura o egress no autorizados son hard blockers
  • Existen casos de regresión minimizados y un owner del riesgo residual