Saltar al contenido principal

Roadmap interactivo

DevOps / SRE + IA

Operación fiable de cargas de trabajo de IA

Serving, autoscaling, observabilidad, control de costes, seguridad y respuesta a incidentes para sistemas de IA.

10–16 semanasIngenieros DevOpsSREIngenieros de plataforma
Abrir como curso →Todos los nodos tienen una ruta de evidencia
3etapas
8nodos
1proyectos y milestones
  1. 01

    Núcleo común de IA

    Modos de fallo probabilísticos y comportamiento verificable de los modelos.

    Resultado de la etapaSRE comprende los riesgos operativos y los límites de los sistemas de IA.
    Materiales listos
    Materiales listos
    Prerrequisitos: Alfabetización en IA y límites de los modelos
    Materiales listos
    Prerrequisitos: Ingeniería de prompts y contexto
  2. 02

    Runtime y serving de IA

    Inferencia, batching, colas y escalado para workloads de producción.

    Resultado de la etapaUn servicio de inferencia controlado con señales explícitas de capacidad y salud.
    Materiales listosAssessment disponible
    Materiales listosAssessment disponible
  3. 03

    Observabilidad e incidentes

    Tracing, costes, alertas, rollback y simulacros operativos.

    Resultado de la etapaUna plataforma de IA con SLO medibles y un camino de recuperación probado.
    Materiales listosAssessment disponible
    Materiales listosAssessment disponible
    Materiales listosAssessment disponible