1. Побудуйте workload model
Результат: Capacity planning враховує AI-specific demand, а не середню кількість HTTP requests.
Завдання
- →Виміряйте arrival rate і burstiness
- →Зберіть distribution input/output tokens
- →Зафіксуйте tool-call fan-out і slowest dependency
- →Розділіть user-facing, batch і high-priority workloads
Перевірки
- ✓P95/P99 workload відрізняється від average case
- ✓Unknown quota або provider limit позначений як risk
- ✓Priority policy не дозволяє starvation критичних задач