Was ein Sprachmodell eigentlich ist
Ohne jede Mathematik, nur durch Experimente, die Grundtatsachen von Sprachmodellen verstehen – Tokens, Vorhersage des nächsten Tokens, Temperatur, Kontext und Kosten, Embeddings und wie man ein Modell auswählt.
Lektionen
- 01Tokens: Text aus Sicht des Modells
Mit den Tokenizern von DeepSeek und OpenAI einen chinesischen, englischen, klassisch-chinesischen und einen Code-Text tatsächlich zerlegen, um zu sehen, in was das Modell Text zerschneidet, warum das den Preis bestimmt und warum Modelle Zeichen schlecht zählen.
35 Minuten · Einsteiger - 02Das Modell tut nur eines: das nächste Token vorhersagen
Das Modell die Kandidaten und Wahrscheinlichkeiten jedes Schritts zeigen lassen und sehen, wie eine Antwort Token für Token entsteht; dann, wie aus einer Fortsetzungsmaschine ein Assistent wird und woher Halluzinationen kommen.
35 Minuten · Einsteiger - 03Temperatur und Sampling: warum dieselbe Frage jedes Mal anders beantwortet wird
Die echten Kandidaten-Wahrscheinlichkeiten eines Modells holen, Temperatur und top_p-Sampling mit numpy selbst implementieren, dann per API messen, wie die Temperatur die Vielfalt der Antworten beeinflusst, und erklären, warum auch Temperatur 0 keine identischen Ergebnisse garantiert.
40 Minuten · Einsteiger - 04Kontextfenster und Kosten
Die gesamte httpx-Dokumentation in eine einzige Anfrage packen und sehen, was das kostet und ob das Modell einen in der Mitte versteckten Satz findet; dann, wie der Cache den zweiten Aufruf über 30-mal billiger macht; zum Schluss eine Funktion, die aus usage die Kosten berechnet.
40 Minuten · Einsteiger - 05Embeddings: Bedeutung in Zahlen verwandeln
Mit einem Open-Source-Embedding-Modell für Chinesisch lokal Sätze in Vektoren verwandeln und ihre Bedeutung per Kosinus-Ähnlichkeit vergleichen; sehen, was es gut kann und was es nicht unterscheidet. Das ist die Grundlage für semantische Suche und RAG.
35 Minuten · Einsteiger - 06Wie man ein Modell auswählt
Ranglisten zeigen das Durchschnittsniveau eines Modells, aber nicht, wie es bei deiner Aufgabe abschneidet. Mit 20 Fragen Trefferquote, Geschwindigkeit und Kosten von vier Modellkonfigurationen vergleichen und lernen, mit einem eigenen kleinen Testset zu entscheiden.
40 Minuten · Einsteiger
Dieses Modul erklärt nicht, wie ein neuronales Netz innen rechnet; das ist Sache von Teil 2. Hier geht es nur um das, was ein Anwender unbedingt wissen muss: was das Modell sieht, wie seine Ausgabe entsteht und wofür das Geld ausgegeben wird.
Jede Lektion stützt sich auf Experimente. Du zerlegst mit dem Tokenizer von DeepSeek selbst einen chinesischen Satz, siehst mit dem Parameter logprobs, zwischen welchen Wörtern das Modell bei jedem Schritt schwankt, holst eine echte Wahrscheinlichkeitsverteilung auf deinen Rechner und simulierst mit numpy die Temperatur, und du packst die gesamte httpx-Dokumentation in eine einzige Anfrage, um zu sehen, wie viel der Cache spart. Manche Ergebnisse widersprechen dem, was im Netz verbreitet wird; ich habe sie so aufgeschrieben, wie sie waren.
Warum diese Reihenfolge
Zuerst Tokens, denn alles Weitere wird in dieser Einheit gemessen: Preis, Kontextlänge, Ausgabegrenze. Dann, wie das Modell eine Antwort Token für Token erzeugt; das erklärt Halluzinationen und Zufälligkeit. Temperatur baut auf „Losziehen nach Wahrscheinlichkeit“ auf und steht deshalb in Lektion 3. Lektion 4 überträgt das Bisherige auf Geld und Kontext. Die Embeddings in Lektion 5 sind eine andere Art von Modell, die keinen Text erzeugt, sondern Text in Vektoren verwandelt; RAG in Modul 04 braucht sie. Die letzte Lektion zeigt, wie man ein Modell für die eigene Aufgabe auswählt, und nutzt dafür alles Vorherige.
Du bist fertig, wenn
- du für einen Text mit einem Tokenizer die Zahl der Tokens bestimmen und abschätzen kannst, was es kostet, ihn an das Modell zu senden.
- du erklären kannst, warum dieselbe Frage zweimal gestellt unterschiedliche Antworten bekommt und warum auch Temperatur 0 keine völlige Gleichheit garantiert.
- du weißt, dass eine vom Modell genannte konkrete Versionsnummer oder ein API-Parameter überprüft werden muss, und auch, wo man das prüft.
- du eine Funktion schreiben kannst, die aus
usagedie Kosten eines Aufrufs berechnet, einschließlich der Cache-Treffer. - du mit 20 selbst vorbereiteten Fragen vergleichen kannst, welches von zwei Modellen für deine Aufgabe besser geeignet ist.
Code zu diesem Modul
Code und Programmausgaben stehen genau so da, wie sie gelaufen sind – Kommentare und Ausgaben sind daher auf Chinesisch.