1. Постройте workload model
Результат: Capacity planning учитывает AI-specific demand, а не среднее число HTTP requests.
Задачи
- →Измерьте arrival rate и burstiness
- →Соберите распределения input/output tokens
- →Зафиксируйте tool-call fan-out и самую медленную dependency
- →Разделите user-facing, batch и high-priority workloads
Проверки
- ✓P95/P99 workload отличается от среднего случая
- ✓Неизвестные quota или provider limits помечены как риск
- ✓Priority policy не допускает starvation критических задач