Aller au contenu principal

Roadmap interactive

DevOps / SRE + IA

Exploitation fiable des workloads IA

Serving, autoscaling, observabilité, maîtrise des coûts, sécurité et réponse aux incidents pour les systèmes IA.

10–16 semainesIngénieurs DevOpsSREIngénieurs plateforme
Ouvrir comme cours →Chaque nœud dispose d’un parcours de preuve
3étapes
8nœuds
1projets et milestones
  1. 01

    Socle IA commun

    Modes de défaillance probabilistes et comportement vérifiable des modèles.

    Résultat de l’étapeLe SRE comprend les risques opérationnels et les limites des systèmes IA.
    Supports prêts
    Supports prêts
    Prérequis : Culture IA et limites des modèles
    Supports prêts
    Prérequis : Prompt et context engineering
  2. 02

    Runtime et serving IA

    Inférence, batching, files de tâches et scaling pour les workloads de production.

    Résultat de l’étapeUn service d’inférence contrôlé avec des signaux explicites de capacité et de santé.
    Supports prêtsAssessment disponible
    Supports prêtsAssessment disponible
  3. 03

    Observabilité et incidents

    Tracing, coûts, alertes, rollback et exercices opérationnels.

    Résultat de l’étapeUne plateforme IA avec des SLO mesurables et un parcours de reprise testé.
    Supports prêtsAssessment disponible
    Supports prêtsAssessment disponible
    Supports prêtsAssessment disponible