Production-AI-Systeme und Runtime-Betrieb Deployment, Serving, Observability, Runtime-Evidenz, kontrollierte Modell-/Provider-Änderungen, Kosten, Zuverlässigkeit und Incident Response.
Ergebnis der Phase Ein AI-System mit SLOs, nachvollziehbarer Runtime Truth, kontrollierten Modell-/Provider-Änderungen, Rollback auf einen Known-Good-Stand und verifizierter Wirtschaftlichkeit.
Pflicht Serving, Streaming und Batching Managed APIs, Self-Hosting, vLLM, Queues, Backpressure, Quotas und Kapazitätsgrenzen. Materialien bereit
Pflicht Tracing, SLOs und Production Monitoring End-to-End-Traces über Modell-, Retrieval- und Tool-Aufrufe hinweg sowie Latenz, Kosten, Qualität, Fehler, Drift und Alerts. Materialien bereit
Voraussetzungen: Serving, Streaming und Batching
Pflicht Runtime-Evidenz und False-Green-Prävention Erfassung des deployten Commit-/Config-Fingerprints, autoritativer Postconditions, Production-Verifikation und getrennter Wahrheiten für CI, Deploy und Indexierung. Materialien bereit
Voraussetzungen: Tracing, SLOs und Production Monitoring
Pflicht Change Control für Modell, Prompt, Retrieval und Provider Versionierter Release-Envelope für Modellrevision, Prompt, Retrieval/Index, Tools, Policy und Provider; Replay, Canary, Holdback und Rollback als ein Change Contract. Materialien bereit
Voraussetzungen: Runtime-Evidenz und False-Green-Prävention, Regression- und Release-Gates
Empfohlen Kapazitäts-, Kosten- und Routing-Budgets Concurrency, Rate Limits, Token-/Tool-Budgets, Kosten pro erfolgreich verifizierter Aufgabe und Fallback-Ökonomie zwischen Modellen oder Providern. Materialien bereit
Voraussetzungen: Serving, Streaming und Batching
Pflicht Datenschutz, Secrets und Governance PII, Datenrichtlinien, Supply Chain, Sandboxing, Policy Engines und Tool-Zugriff nach dem Least-Authority-Prinzip. Materialien bereit
Empfohlen Fehlerinjektion, Failover und Reconciliation Tests für 429/5xx, Timeouts, Provider-Ausfälle, partielle Side Effects und doppelte Zustellung; zuerst reconciliieren, dann erneut versuchen; Fallback vor einem realen Incident verifizieren. Materialien bereit
Voraussetzungen: Runtime-Evidenz und False-Green-Prävention, Change Control für Modell, Prompt, Retrieval und Provider
Empfohlen Incident Response und Rollback Runbooks, begrenzte Kill Switches, Modell-/Provider-Fallback, Wiederherstellung einer Known-Good-Konfiguration und Postmortem → permanenter Regressionstest. Materialien bereit
Voraussetzungen: Fehlerinjektion, Failover und Reconciliation
Meilenstein Capstone: Production-AI-System End-to-End-System mit Contracts, RAG/Agents, Evals, versioniertem Release-Envelope, Deployment-Gates, Runtime-Evidenz, Failure Drills und verifizierter Recovery. Materialien bereit
Voraussetzungen: Incident Response und Rollback, Datenschutz, Secrets und Governance, Kapazitäts-, Kosten- und Routing-Budgets