Comment fonctionne un grand modèle
Sans aucune mathématique, comprendre par l'expérience quelques faits de base sur les grands modèles de langage – tokens, prédiction du token suivant, température, contexte et coût, embeddings, et comment choisir un modèle.
Leçons
- 01Les tokens : le texte vu par le modèle
Découper pour de vrai du chinois, de l'anglais, du chinois classique et du code avec les tokenizers de DeepSeek et d'OpenAI, voir en quoi le modèle transforme réellement le texte, pourquoi cela détermine le prix, et pourquoi le modèle n'arrive pas à compter les caractères.
35 minutes · Débutant - 02Le modèle ne fait qu'une chose : prédire le token suivant
Faire afficher au modèle ses tokens candidats et leurs probabilités à chaque étape, pour voir comment une réponse est générée token par token ; puis comment il est passé de machine à continuer du texte à assistant, et d'où viennent les hallucinations.
35 minutes · Débutant - 03Température et échantillonnage : pourquoi la même question donne des réponses différentes
Récupérer les vraies probabilités des tokens candidats du modèle, implémenter soi-même la température et l'échantillonnage top_p avec numpy, mesurer avec l'API l'effet de la température sur la diversité des réponses, et expliquer pourquoi une température de 0 ne garantit pas non plus un résultat identique.
40 minutes · Débutant - 04Fenêtre de contexte et coût
Mettre toute la documentation de httpx dans une seule requête, voir combien cela coûte et si le modèle retrouve une phrase cachée au milieu, puis voir comment le cache rend le deuxième appel plus de 30 fois moins cher, et enfin écrire une fonction qui calcule le coût à partir de usage.
40 minutes · Débutant - 05Les embeddings : transformer le sens en nombres
Transformer des phrases en vecteurs en local avec un modèle d'embedding chinois open source, comparer leur sens par similarité cosinus, et voir ce qu'il fait bien et ce qu'il ne sait pas distinguer. C'est la base de la recherche sémantique et du RAG qui viendront ensuite.
35 minutes · Débutant - 06Comment choisir un modèle
Les classements donnent le niveau moyen d'un modèle, mais pas son comportement sur votre tâche. Comparer la précision, la vitesse et le coût de quatre configurations sur 20 questions, et apprendre à choisir avec son propre petit jeu de test.
40 minutes · Débutant
Ce module n'explique pas comment un réseau de neurones calcule en interne ; c'est l'affaire de la seconde partie. Il ne traite que de ce qu'un utilisateur doit savoir : ce que voit le modèle, comment sa sortie est produite, et où part l'argent.
Chaque leçon s'appuie sur des expériences. Vous découperez vous-même une phrase chinoise avec le tokenizer de DeepSeek, verrez avec le paramètre logprobs entre quels mots le modèle hésite à chaque étape, simulerez la température en local avec numpy sur une vraie distribution de probabilités, et mettrez toute la documentation de httpx dans une seule requête pour voir combien le cache fait économiser. Certains résultats contredisent ce qui circule sur le web ; je les ai rapportés tels quels.
Pourquoi cet ordre
D'abord les tokens, parce que tout ce qui suit se mesure en tokens : le prix, la longueur du contexte, la limite de sortie. Puis comment le modèle génère une réponse token par token, ce qui explique les hallucinations et l'aléatoire. La température repose sur ce « tirage au sort selon les probabilités », d'où sa place en leçon 3. La leçon 4 applique tout cela à l'argent et au contexte. Les embeddings de la leçon 5 sont un autre type de modèle : il ne génère pas de texte, il transforme le texte en vecteurs ; le RAG du module 04 en a besoin. La dernière leçon explique comment choisir un modèle pour votre tâche, en mobilisant tout ce qui précède.
Vous avez terminé quand
- face à un texte, vous savez compter ses tokens avec un tokenizer et estimer combien coûte son envoi au modèle.
- vous savez expliquer pourquoi la même question posée deux fois donne des réponses différentes, et pourquoi une température de 0 ne garantit pas non plus une réponse identique.
- quand le modèle donne un numéro de version ou un paramètre d'API précis, vous savez qu'il faut vérifier, et où vérifier.
- vous savez écrire une fonction qui calcule le coût d'un appel à partir de
usage, y compris la partie servie depuis le cache. - vous savez comparer deux modèles sur votre tâche avec 20 questions que vous avez préparées vous-même.
Le code de ce module
Le code et les sorties des programmes sont reproduits tels qu’ils ont tourné : commentaires et sorties sont donc en chinois.