Modul 06 · Mit Sprachmodellen bauen

Evaluation und Produktivbetrieb

Einen Evaluationsdatensatz erstellen, ein Modell als Gutachter einsetzen und kalibrieren, jeden Schritt protokollieren, Kosten und Latenz senken, Leitplanken für Ein- und Ausgabe ergänzen und RepoBot schließlich als Webdienst in Betrieb nehmen.

Lektionen

  1. 01
    Einen Evaluationsdatensatz erstellen

    36 Fragen für RepoBot vorbereiten – Dokumentationsfragen, Quellcodefragen, Fragen zum Ablehnen, Fragen ohne Antwort und Injections. Als JSONL speichern, mit einem Befehl durchlaufen lassen, Schritte, Dauer und Kosten nach Kategorie auswerten und mit Regeln grob prüfen.

    40 Minuten · Fortgeschritten
  2. 02
    Ein Modell als Gutachter

    Bewertungskriterien für 36 Antworten schreiben, ein Modell als Gutachter einsetzen und Punkt für Punkt mit menschlichen Bewertungen vergleichen. Mit den Lehren aus Modul 04 stimmten Gutachter und Mensch bei allen 36 Fragen überein, und der Gutachter fand sogar einen in der Erklärung versteckten Fehler.

    45 Minuten · Fortgeschritten
  3. 03
    Logging und Beobachtbarkeit

    Einen Tracer in ein paar Dutzend Zeilen schreiben, der jeden Modellaufruf und jeden Tool-Aufruf des Agenten als eine JSON-Zeile protokolliert. Allein aus dem Log lässt sich hinterher berechnen, was jede Frage an Geld und Zeit gekostet hat, welcher Schritt am langsamsten war und welches Tool Fehler macht.

    40 Minuten · Fortgeschritten
  4. 04
    Kosten sparen, schneller werden

    Fünf kleine Experimente – feste Unterlagen nach vorn gestellt spart 64 % der Kosten, eine Bitte um Kürze senkt die Ausgabe um 92 %, Denken bei einfachen Fragen abschalten, ein eigener Ergebnis-Cache, und Parallelität drückt 10 Anfragen von 9,5 auf 2,3 Sekunden.

    35 Minuten · Fortgeschritten
  5. 05
    Leitplanken: aufhalten, was nicht hinein- und was nicht hinausdarf

    Die Eingabe-Leitplanke klassifiziert Fragen mit einem billigen Aufruf – 41 von 42 richtig, nach einer zusätzlichen Regel alle; die Ausgabe-Leitplanke schwärzt Schlüssel und Handynummern in Antworten per Regex und löst das Problem, dass beim Streaming ein Geheimnis in zwei Hälften zerteilt wird.

    40 Minuten · Fortgeschritten
  6. 06
    Projekt: den Frage-Antwort-Assistenten in Betrieb nehmen

    RepoBot wird zum Webdienst – FastAPI-Streaming-Schnittstelle, gestreamte Agentenschleife, Ein- und Ausgabe-Leitplanken, Trace-Log, Eingabeprüfung, und wie man es auf einem Server bereitstellt. Hier endet das durchgehende Projekt von Teil 1.

    90 Minuten · Fortgeschritten

Dass eine KI-Anwendung auf deinem Rechner läuft, heißt noch lange nicht, dass man sie anderen geben kann. Du musst wissen, wie gut sie antwortet, ob sie nach einer Änderung schlechter geworden ist, ob sich bei Problemen die Ursache finden lässt, was sie im Monat kostet und ob sie missbraucht werden kann.

Dieses Modul beantwortet diese Fragen. Die ersten zwei Lektionen behandeln Evaluation: Fragen vorbereiten, ein Modell als Gutachter einsetzen und mit menschlichen Bewertungen prüfen, ob der Gutachter verlässlich ist. Lektion 3 behandelt Logging, Lektion 4 Kosten und Geschwindigkeit, Lektion 5 Leitplanken. Die letzte Lektion baut alles in RepoBot ein und macht daraus einen Webdienst.

Warum diese Reihenfolge

Die Evaluation steht ganz vorn, weil jede spätere Änderung (Kosten optimieren, Leitplanken ergänzen, zum Webdienst umbauen) mit ihr bestätigen muss, dass nichts schlechter geworden ist. Das Logging kommt vor der Optimierung, weil man erst wissen muss, wo Geld und Zeit hingehen, bevor man weiß, was zu optimieren ist. Die Leitplanken kommen zuletzt, weil sie Anfragen abfangen und der Evaluationsdatensatz bestätigen muss, dass sie keine normalen Fragen treffen.

Du bist fertig, wenn

  • du für deine Anwendung einen Evaluationsdatensatz vorbereiten kannst, der normale Fälle, Grenzfälle, Ablehnungen und Injections abdeckt, und ihn mit einem Befehl durchlaufen lässt.
  • du den Prompt eines Modell-Gutachters schreiben und mit einigen Dutzend menschlichen Bewertungen prüfen kannst, wie sehr er mit dem Urteil von Menschen übereinstimmt.
  • du einem Agenten ein Trace-Log hinzufügen und daraus Schrittzahl, Dauer und Kosten jeder Anfrage berechnen kannst.
  • du mindestens drei Wege nennen kannst, Kosten zu sparen oder schneller zu werden, und ihre Wirkung an deiner eigenen Anwendung misst.
  • du eine Leitplanke zur Eingabeklassifizierung und eine zur Schwärzung der Ausgabe umsetzen kannst und weißt, wogegen sie jeweils nicht schützen.
  • RepoBot v4 auf deinem Rechner als Webdienst läuft und du sagen kannst, was vor dem Produktivbetrieb noch fehlt.

Code zu diesem Modul

Code und Programmausgaben stehen genau so da, wie sie gelaufen sind – Kommentare und Ausgaben sind daher auf Chinesisch.