Zum Hauptinhalt springen

Interaktive Roadmap

DevOps / SRE + AI

Zuverlässiger Betrieb von AI-Workloads

Serving, Autoscaling, Observability, Kostenkontrolle, Sicherheit und Incident Response für AI-Systeme.

10–16 WochenDevOps EngineersSREPlatform Engineers
Als Kurs öffnen →Jeder Knoten hat eine Evidence-Route
3Phasen
8Knoten
1Projekte und Meilensteine
  1. 01

    Gemeinsamer AI-Kern

    Probabilistische Fehlermodi und überprüfbares Modellverhalten.

    Ergebnis der PhaseSRE versteht die operativen Risiken und Grenzen von AI-Systemen.
    Materialien bereit
    Materialien bereit
    Voraussetzungen: AI-Grundverständnis und Modellgrenzen
    Materialien bereit
    Voraussetzungen: Prompt- und Context Engineering
  2. 02

    AI Runtime und Serving

    Inference, Batching, Queues und Skalierung für Production-Workloads.

    Ergebnis der PhaseEin kontrollierter Inference-Service mit expliziten Kapazitäts- und Health-Signalen.
    Materialien bereitAssessment verfügbar
    Materialien bereitAssessment verfügbar
  3. 03

    Observability und Incidents

    Tracing, Kosten, Alerts, Rollback und operative Übungen.

    Ergebnis der PhaseEine AI-Plattform mit messbaren SLOs und einem getesteten Recovery-Pfad.
    Materialien bereitAssessment verfügbar
    Materialien bereitAssessment verfügbar
    Materialien bereitAssessment verfügbar