Systèmes IA en production et opérations runtime Déploiement, serving, observabilité, preuves runtime, contrôle des changements de modèle/fournisseur, coût, fiabilité et réponse aux incidents.
Résultat de l’étape Un système IA avec des SLO, une runtime truth traçable, des changements de modèle/fournisseur gouvernés, un rollback vers une configuration known-good et une économie vérifiée.
Obligatoire Serving, streaming et batching API managées, self-hosting, vLLM, files, backpressure, quotas et limites de capacité. Supports prêts
Obligatoire Tracing, SLO et monitoring de production Traces end-to-end à travers les appels modèle, retrieval et outils, ainsi que latence, coût, qualité, erreurs, drift et alertes. Supports prêts
Prérequis : Serving, streaming et batching
Obligatoire Preuves runtime et prévention des faux positifs verts Capturer le fingerprint du commit/config déployé, les postconditions faisant autorité, la vérification en production et des vérités séparées pour CI, déploiement et indexation. Supports prêts
Prérequis : Tracing, SLO et monitoring de production
Obligatoire Contrôle des changements de modèle, prompt, retrieval et fournisseur Release envelope versionné pour la révision du modèle, le prompt, retrieval/index, les outils, la policy et le fournisseur ; replay, canary, holdback et rollback comme un seul contrat de changement. Supports prêts
Prérequis : Preuves runtime et prévention des faux positifs verts, Gates de régression et de release
Recommandé Budgets de capacité, de coût et de routage Concurrence, rate limits, budgets tokens/outils, coût par tâche vérifiée avec succès et économie du fallback entre modèles ou fournisseurs. Supports prêts
Prérequis : Serving, streaming et batching
Obligatoire Confidentialité, secrets et gouvernance PII, politiques de données, supply chain, sandboxing, policy engines et accès aux outils selon le principe de moindre autorité. Supports prêts
Recommandé Injection de pannes, failover et réconciliation Tests 429/5xx, timeout, panne fournisseur, effets partiels et livraison en double ; réconcilier d’abord, réessayer ensuite ; vérifier le fallback avant un incident réel. Supports prêts
Prérequis : Preuves runtime et prévention des faux positifs verts, Contrôle des changements de modèle, prompt, retrieval et fournisseur
Recommandé Réponse aux incidents et rollback Runbooks, kill switches ciblés, fallback modèle/fournisseur, retour à une configuration known-good et postmortem → test de régression permanent. Supports prêts
Prérequis : Injection de pannes, failover et réconciliation
Milestone Capstone : système IA en production Système end-to-end avec contrats, RAG/agents, evals, release envelope versionné, deployment gates, preuves runtime, exercices de panne et récupération vérifiée. Supports prêts
Prérequis : Réponse aux incidents et rollback, Confidentialité, secrets et gouvernance, Budgets de capacité, de coût et de routage