Перейти к основному содержимому

Интерактивный roadmap

DevOps / SRE + AI

Надёжная эксплуатация AI workloads

Serving, autoscaling, observability, контроль стоимости, безопасность и incident response.

10–16 недельDevOps engineersSREPlatform engineers
Открыть как курс →У каждого узла есть evidence route
3этапов
8узлов
1проектов и milestones
  1. 01

    Общий AI Core

    Вероятностные режимы отказа и проверяемое поведение моделей.

    Результат этапаSRE понимает эксплуатационные риски и ограничения AI-систем.
    Материалы готовы
    Материалы готовы
    Предпосылки: AI-грамотность и границы моделей
    Материалы готовы
    Предпосылки: Prompt и context engineering
  2. 02

    AI runtime и serving

    Inference, batching, очереди и scaling для production workloads.

    Результат этапаКонтролируемый inference service с явными сигналами capacity и health.
    Материалы готовыЕсть assessment
    Материалы готовыЕсть assessment
  3. 03

    Observability и incidents

    Tracing, расходы, alerts, rollback и операционные учения.

    Результат этапаAI-платформа с измеримыми SLO и проверенным recovery path.
    Материалы готовыЕсть assessment
    Материалы готовыЕсть assessment
    Материалы готовыЕсть assessment