1. Workload-Modell erstellen
Ergebnis: Kapazitätsplanung berücksichtigt AI-spezifische Nachfrage statt nur durchschnittlicher HTTP-Requests.
Aufgaben
- →Arrival Rate und Burstiness messen
- →Input-/Output-Token-Verteilungen erfassen
- →Tool-Call-Fan-out und langsamste Dependency festhalten
- →User-facing, Batch und High-Priority Workloads trennen
Prüfungen
- ✓P95/P99-Workload unterscheidet sich vom Durchschnitt
- ✓Unbekannte Quota- oder Provider-Limits werden als Risiko markiert
- ✓Priority Policy führt nicht zum Starvation kritischer Aufgaben