1. Постройте source-sink модель
Результат: Каждый контролируемый атакующим input и каждый consequential sink имеют явную trust boundary.
Задачи
- →Инвентаризируйте user, web, RAG, tool и memory sources
- →Отметьте secrets, write tools и external egress sinks
- →Свяжите пути source → interpreter → sink
- →Определите, где deterministic policy должна остановить действие
Проверки
- ✓Нет source без trust classification
- ✓Write или egress sink не защищён только system prompt