1. Construye el modelo de carga
Resultado: La planificación de capacidad refleja demanda específica de IA y no el promedio de peticiones HTTP.
Tareas
- →Medir tasa de llegada y ráfagas
- →Recoger distribuciones de tokens de entrada/salida
- →Registrar fan-out de tools y dependencia más lenta
- →Separar cargas user-facing, batch y de alta prioridad
Comprobaciones
- ✓La carga P95/P99 difiere del caso medio
- ✓Cuotas o límites desconocidos se marcan como riesgo
- ✓La política de prioridad no provoca starvation de tareas críticas