1. Construisez le modèle de workload
Résultat: Le capacity planning reflète la demande propre à l’IA plutôt qu’un nombre moyen de requêtes HTTP.
Tâches
- →Mesurer le taux d’arrivée et les rafales
- →Collecter les distributions de tokens input/output
- →Enregistrer le fan-out des tools et la dépendance la plus lente
- →Séparer les workloads user-facing, batch et haute priorité
Vérifications
- ✓Le workload P95/P99 diffère du cas moyen
- ✓Les quotas ou limites fournisseur inconnus sont marqués comme risques
- ✓La policy de priorité n’affame pas les tâches critiques