Modul 01 · Mit Sprachmodellen bauen

Was ein Sprachmodell eigentlich ist

Ohne jede Mathematik, nur durch Experimente, die Grundtatsachen von Sprachmodellen verstehen – Tokens, Vorhersage des nächsten Tokens, Temperatur, Kontext und Kosten, Embeddings und wie man ein Modell auswählt.

Lektionen

  1. 01
    Tokens: Text aus Sicht des Modells

    Mit den Tokenizern von DeepSeek und OpenAI einen chinesischen, englischen, klassisch-chinesischen und einen Code-Text tatsächlich zerlegen, um zu sehen, in was das Modell Text zerschneidet, warum das den Preis bestimmt und warum Modelle Zeichen schlecht zählen.

    35 Minuten · Einsteiger
  2. 02
    Das Modell tut nur eines: das nächste Token vorhersagen

    Das Modell die Kandidaten und Wahrscheinlichkeiten jedes Schritts zeigen lassen und sehen, wie eine Antwort Token für Token entsteht; dann, wie aus einer Fortsetzungsmaschine ein Assistent wird und woher Halluzinationen kommen.

    35 Minuten · Einsteiger
  3. 03
    Temperatur und Sampling: warum dieselbe Frage jedes Mal anders beantwortet wird

    Die echten Kandidaten-Wahrscheinlichkeiten eines Modells holen, Temperatur und top_p-Sampling mit numpy selbst implementieren, dann per API messen, wie die Temperatur die Vielfalt der Antworten beeinflusst, und erklären, warum auch Temperatur 0 keine identischen Ergebnisse garantiert.

    40 Minuten · Einsteiger
  4. 04
    Kontextfenster und Kosten

    Die gesamte httpx-Dokumentation in eine einzige Anfrage packen und sehen, was das kostet und ob das Modell einen in der Mitte versteckten Satz findet; dann, wie der Cache den zweiten Aufruf über 30-mal billiger macht; zum Schluss eine Funktion, die aus usage die Kosten berechnet.

    40 Minuten · Einsteiger
  5. 05
    Embeddings: Bedeutung in Zahlen verwandeln

    Mit einem Open-Source-Embedding-Modell für Chinesisch lokal Sätze in Vektoren verwandeln und ihre Bedeutung per Kosinus-Ähnlichkeit vergleichen; sehen, was es gut kann und was es nicht unterscheidet. Das ist die Grundlage für semantische Suche und RAG.

    35 Minuten · Einsteiger
  6. 06
    Wie man ein Modell auswählt

    Ranglisten zeigen das Durchschnittsniveau eines Modells, aber nicht, wie es bei deiner Aufgabe abschneidet. Mit 20 Fragen Trefferquote, Geschwindigkeit und Kosten von vier Modellkonfigurationen vergleichen und lernen, mit einem eigenen kleinen Testset zu entscheiden.

    40 Minuten · Einsteiger

Dieses Modul erklärt nicht, wie ein neuronales Netz innen rechnet; das ist Sache von Teil 2. Hier geht es nur um das, was ein Anwender unbedingt wissen muss: was das Modell sieht, wie seine Ausgabe entsteht und wofür das Geld ausgegeben wird.

Jede Lektion stützt sich auf Experimente. Du zerlegst mit dem Tokenizer von DeepSeek selbst einen chinesischen Satz, siehst mit dem Parameter logprobs, zwischen welchen Wörtern das Modell bei jedem Schritt schwankt, holst eine echte Wahrscheinlichkeitsverteilung auf deinen Rechner und simulierst mit numpy die Temperatur, und du packst die gesamte httpx-Dokumentation in eine einzige Anfrage, um zu sehen, wie viel der Cache spart. Manche Ergebnisse widersprechen dem, was im Netz verbreitet wird; ich habe sie so aufgeschrieben, wie sie waren.

Warum diese Reihenfolge

Zuerst Tokens, denn alles Weitere wird in dieser Einheit gemessen: Preis, Kontextlänge, Ausgabegrenze. Dann, wie das Modell eine Antwort Token für Token erzeugt; das erklärt Halluzinationen und Zufälligkeit. Temperatur baut auf „Losziehen nach Wahrscheinlichkeit“ auf und steht deshalb in Lektion 3. Lektion 4 überträgt das Bisherige auf Geld und Kontext. Die Embeddings in Lektion 5 sind eine andere Art von Modell, die keinen Text erzeugt, sondern Text in Vektoren verwandelt; RAG in Modul 04 braucht sie. Die letzte Lektion zeigt, wie man ein Modell für die eigene Aufgabe auswählt, und nutzt dafür alles Vorherige.

Du bist fertig, wenn

  • du für einen Text mit einem Tokenizer die Zahl der Tokens bestimmen und abschätzen kannst, was es kostet, ihn an das Modell zu senden.
  • du erklären kannst, warum dieselbe Frage zweimal gestellt unterschiedliche Antworten bekommt und warum auch Temperatur 0 keine völlige Gleichheit garantiert.
  • du weißt, dass eine vom Modell genannte konkrete Versionsnummer oder ein API-Parameter überprüft werden muss, und auch, wo man das prüft.
  • du eine Funktion schreiben kannst, die aus usage die Kosten eines Aufrufs berechnet, einschließlich der Cache-Treffer.
  • du mit 20 selbst vorbereiteten Fragen vergleichen kannst, welches von zwei Modellen für deine Aufgabe besser geeignet ist.

Code zu diesem Modul

Code und Programmausgaben stehen genau so da, wie sie gelaufen sind – Kommentare und Ausgaben sind daher auf Chinesisch.