Zum Hauptinhalt springen
Kern10–16 Stunden

Dossier zur Discovery einer KI-Funktion

Erstelle ein entscheidungsreifes Dossier für eine KI-Funktion mit Problem, Capability Fit, UX, Metriken, Risiken, Wirtschaftlichkeit und Experimentplan.

Product DiscoveryKI-UXMetrikenUnit EconomicsRisikomanagement

Szenario

Aufgabe

Ein Team schlägt eine KI-Funktion ohne klare Wertmetrik vor. Es muss entschieden werden, ob sie gebaut werden soll, wie Qualität gemessen wird und unter welchen Bedingungen der Rollout gestoppt werden muss.

Schrittweise Umsetzung

1. Problemevidenz belegen

Ergebnis: Das Problem ist validiert und nicht zur Rechtfertigung von KI erfunden.

Aufgaben

  • Nutzerevidenz sammeln
  • Aktuellen Workflow beschreiben
  • Non-AI-Baseline definieren

Prüfungen

  • Eine praktikable Non-AI-Alternative ist dokumentiert

2. Capability Fit bewerten

Ergebnis: Stärken und Grenzen des Modells sind bekannt.

Aufgaben

  • Repräsentative Aufgaben auswählen
  • Auswirkung von Fehlern beschreiben
  • Freigabebedarf definieren

Prüfungen

  • Kein Capability-Versprechen ohne Eval-Plan

3. Metriken und Wirtschaftlichkeit aufbauen

Ergebnis: Wert wird zusammen mit Qualität, Latenz und Kosten bewertet.

Aufgaben

  • Metrikbaum erstellen
  • Kosten pro Aufgabe berechnen
  • Schwellenwerte definieren

Prüfungen

  • Vanity Metrics dienen nicht als Release-Gates

4. Rollout entwerfen

Ergebnis: Es gibt ein begrenztes Experiment und einen Rollback-Pfad.

Aufgaben

  • Offline-Eval durchführen
  • Pilotkohorte definieren
  • Monitoring ergänzen
  • Stop-Bedingungen festlegen

Prüfungen

  • Der Rollout ist kein Big-Bang-Release

Akzeptanzkriterien

  • Eine Non-AI-Baseline existiert
  • Metriken besitzen Schwellenwerte
  • Risiken besitzen Controls
  • Kosten pro Aufgabe sind geschätzt
  • Rollback-Kriterien sind dokumentiert

Bewertungsraster

Wie das Ergebnis bewertet wird

Bestehensgrenze: 72/100 · Auszeichnung: 90/100

Problemnachweis

Das Problem ist durch Nutzer-Evidenz und eine Non-AI-Baseline belegt.

25 Punkte

Unzureichend

KI sucht nach einem Problem.

Kompetent

Evidenz und eine Baseline sind vorhanden.

Stark

Quantifizierter Pain, Alternativen und Segmentunterschiede sind dokumentiert.

Erforderliche Nachweise

  • ✓ Link zu Artefakt oder Code
  • ✓ README mit Entscheidungen und Kompromissen
  • ✓ Nachweis der ausgeführten Prüfungen
  • ✓ Problem-Brief

Capability Fit und Risiken

Modellgrenzen, Failure Impact und Controls sind dokumentiert.

25 Punkte

Unzureichend

Capabilities werden ohne Tests behauptet.

Kompetent

Repräsentative Tasks und Controls sind vorhanden.

Stark

Eval-Datensatz, Approval Policy und Restrisiko sind dokumentiert.

Erforderliche Nachweise

  • ✓ Link zu Artefakt oder Code
  • ✓ README mit Entscheidungen und Kompromissen
  • ✓ Nachweis der ausgeführten Prüfungen
  • ✓ Capability-Risk-Matrix

Metriken und Wirtschaftlichkeit

Value, Qualität, Safety, Latenz und Kosten besitzen Schwellenwerte.

30 Punkte

Unzureichend

Es gibt nur Vanity Metrics.

Kompetent

Release-Metriken besitzen Schwellenwerte.

Stark

Sensitivitätsanalyse, Routing-Optionen und Margenmodell sind dokumentiert.

Erforderliche Nachweise

  • ✓ Link zu Artefakt oder Code
  • ✓ README mit Entscheidungen und Kompromissen
  • ✓ Nachweis der ausgeführten Prüfungen
  • ✓ Metrikbaum und Unit Economics

Experiment und Rollout

Offline Eval, Pilot, Monitoring und Rollback sind begrenzt.

20 Punkte

Unzureichend

Ein Big-Bang-Launch ist geplant.

Kompetent

Phasenweiser Rollout und Stop Conditions sind vorhanden.

Stark

Holdout, kontrafaktische Baseline und Sunset-Kriterien sind definiert.

Erforderliche Nachweise

  • ✓ Link zu Artefakt oder Code
  • ✓ README mit Entscheidungen und Kompromissen
  • ✓ Nachweis der ausgeführten Prüfungen
  • ✓ Experimentplan