Faire réfléchir le modèle avant de répondre
6 questions pièges, 5 essais chacune – réponse directe, 21 justes ; raisonnement écrit d'abord, 29 justes ; mode réflexion activé, toutes justes. Pourquoi réfléchir avant de répondre aide, et combien cela coûte.
- Environ 35 minutes
- Niveau : Débutant
- Testé : 2026-09-14 deepseek-flash
Le code et les sorties des programmes sont reproduits tels qu’ils ont tourné : commentaires et sorties sont donc en chinois.
« Lequel est le plus grand, 9.11 ou 9.9 ? » Un écolier répond juste, mais les grands modèles se trompent souvent. Dans l'expérience du module précédent, deepseek-flash sans réflexion a répondu 9.11.
Le même modèle répond juste si on pose la question autrement : lui faire d'abord écrire son raisonnement, puis la réponse. Cette leçon mesure à quel point cette astuce est utile, ce qu'elle coûte, et quel rapport elle a avec le « mode réflexion ».
Pourquoi écrire le raisonnement d'abord aide
Souvenez-vous de la leçon 2 du module 01 : le modèle génère un seul token à la fois, chacun s'appuyant sur tout ce qui précède.
Si on exige « la réponse seulement », le modèle doit conclure dès le premier token. Pour comparer 9.11 et 9.9, il n'a pas d'endroit où « calculer » et ne peut se fier qu'à son intuition. Or cette intuition peut être faussée par les nombreux numéros de version des données d'entraînement : en versions de logiciel, 9.11 est bien plus récent que 9.9.
Si on lui fait d'abord écrire le raisonnement, par exemple « 9.9 peut s'écrire 9.90, on compare le premier chiffre après la virgule, 9 est plus grand que 1… », ces étapes deviennent l'entrée des tokens suivants. Quand il écrit la conclusion, il la tire du raisonnement déjà écrit, au lieu de deviner à partir de rien.
Faire réfléchir le modèle avant de répondre, c'est donc au fond lui donner un brouillon. Ce qu'il peut « penser » dépend de ce qu'il écrit.
Expérience : trois méthodes comparées
J'ai choisi 6 questions pièges : celles déjà vues (comparer des décimaux, compter des caractères, aire d'un carré, compter des lettres), plus deux nouvelles :
- On plie une corde trois fois en deux, puis on la coupe en plein milieu : en combien de morceaux se retrouve-t-elle ? (Réponse : 9. Pliée trois fois, elle forme 8 épaisseurs ; un coup de ciseaux au milieu donne 16 extrémités coupées, qui avec les deux bouts d'origine forment 9 morceaux.)
- J'ai 3 pommes, j'en mange 1, j'en achète 2, puis j'en donne la moitié à un ami : combien m'en reste-t-il ? (Réponse : 2.)
Trois méthodes, toutes avec deepseek-flash :
DIRECT = "只回答最终答案,一个数,不要任何解释。"
STEP_BY_STEP = "先一步一步写出推理过程,最后单独一行写“答案:”加上一个数。"
METHODS = [
("直接回答", DIRECT, False), # 关掉思考
("先推理再回答", STEP_BY_STEP, False), # 关掉思考,但要求在回答里写推理过程
("开启思考", DIRECT, True), # 打开思考模式,回答里只要答案
]
Chaque question est posée 5 fois par méthode ; on extrait le nombre après « 答案: » (réponse :) et on le compare à la réponse type (code complet dans code/02-prompting/reasoning.py). Mon résultat :
直接回答:21/30 正确,平均输出 1 词元,共 0.0003 美元
9.11 和 9.9 哪个大?(正确答案 9.9)→ ['9.11', '9.11', '9.11', '9.9', '9.9']
“秋天的叶子一片片落下”这句话有几个字?(正确答案 10)→ ['11', '11', '11', '11', '12']
单词 raspberry 里有几个字母 r?(正确答案 3)→ ['3', '2', '3', '3', '3']
先推理再回答:29/30 正确,平均输出 244 词元,共 0.0091 美元
9.11 和 9.9 哪个大?(正确答案 9.9)→ ['9.11', '9.9', '9.9', '9.9', '9.9']
开启思考:30/30 正确,平均输出 431 词元,共 0.0160 美元
Lire les résultats
La réponse directe s'est trompée 9 fois. La question sur le nombre de caractères est fausse 5 fois sur 5, et de façons différentes, 11 ou 12. La comparaison de décimaux est fausse 3 fois sur 5. Fait intéressant : la corde et les pommes, qui paraissent plus compliquées, sont toujours justes en réponse directe, peut-être parce que ce genre de problème est fréquent dans les données d'entraînement.
Écrire le raisonnement fait passer les erreurs de 9 à 1. Il a suffi d'ajouter au prompt une phrase « écris d'abord ton raisonnement étape par étape ». L'erreur restante porte encore sur 9.11 : écrire le raisonnement n'est pas infaillible. Si la première étape part de travers (par exemple en posant d'emblée « 11 est plus grand que 9 »), la suite ne fait que prolonger l'erreur.
Le mode réflexion est toujours juste. Le mode réflexion fait en réalité la même chose, mais plus à fond : le modèle réfléchit d'abord dans reasoning_content, une partie spécialement entraînée qui se vérifie elle-même et revient en arrière quand elle trouve une contradiction. Le content final ne contient que la réponse, ce qui est aussi plus pratique à traiter.
Le prix, ce sont les tokens. La réponse directe produit en moyenne 1 token, le raisonnement écrit 244, le mode réflexion 431. Le coût des 30 questions passe de 0,0003 à 0,016 dollar, plus de 50 fois plus. Le temps de réponse s'allonge d'autant.
Raisonnement écrit à la main ou mode réflexion ?
En septembre 2026, les principaux modèles de DeepSeek prennent en charge le mode réflexion ; dans la plupart des cas, il suffit donc de l'activer, sans demander « réfléchis étape par étape » dans le prompt.
Exiger à la main un raisonnement écrit reste utile dans ces cas :
- Votre modèle ne prend pas en charge le mode réflexion.
- Vous voulez que l'utilisateur voie le raisonnement, par exemple pour du soutien scolaire ou pour justifier une décision. Le
reasoning_contentdu mode réflexion est un brouillon destiné au développeur, dont vous ne contrôlez ni le contenu ni la forme ; on ne le montre généralement pas tel quel à l'utilisateur. - Vous voulez contrôler la manière de raisonner, par exemple « liste d'abord les données connues, puis ce qu'on cherche, puis calcule pas à pas ».
Avec la méthode manuelle, un point d'attention : le modèle doit écrire le raisonnement d'abord, la réponse ensuite. Si le prompt demande « donne d'abord la réponse, puis explique », le modèle donne d'abord une réponse intuitive, puis invente une justification pour elle, et le raisonnement ne sert à rien.
Quand vaut-il la peine de faire réfléchir le modèle
Réfléchir avant de répondre n'est pas gratuit. Dans cette expérience, la réflexion a multiplié le coût par plus de 50.
Ça vaut la peine : calculs en plusieurs étapes, raisonnement logique, tâches demandant des comparaisons minutieuses, écriture de code, planification complexe. Pour ces tâches, une mauvaise réponse coûte généralement bien plus que le surcoût.
Ça ne vaut pas la peine : classification simple, traduction, reformulation, extraction d'un champ dans un texte, bavardage. Le modèle les fait bien « à l'intuition » ; la réflexion n'ajoute que de la latence et des frais. La classification de messages de la leçon précédente obtenait 20/20 sans réflexion.
En cas de doute, reprenez la méthode de la leçon 6 du module 01 : sur votre tâche réelle, lancez une fois avec et une fois sans réflexion, et comparez précision et coût.
Exercices
- Ajoutez aux questions de
reasoning.py3 questions où, selon vous, le modèle se trompe facilement (par exemple « quel jour de la semaine dans une semaine », « combien de minutes entre deux heures »), et voyez quelle méthode s'en sort le mieux. - Remplacez
STEP_BY_STEPpar « donne d'abord la réponse, puis explique ta raison », en gardant « 答案: » sur la dernière ligne. Relancez : comment la précision évolue-t-elle ? - Avec la réflexion activée, affichez
reasoning_contentet regardez comment le modèle réfléchit sur la question 9.11. Change-t-il d'avis en cours de route ?
Auto-test
1. Pourquoi exiger du modèle qu'il « écrive d'abord son raisonnement puis la réponse » améliore-t-il la précision ?
Le modèle ne génère qu'un token à la fois, et la suite s'appuie sur ce qui est déjà écrit. S'il doit donner la réponse directement, il conclut dès le premier token, à l'intuition. S'il écrit d'abord le raisonnement, ces étapes deviennent l'entrée de la suite, et la conclusion découle du raisonnement. Cela revient à lui donner un brouillon.
2. Quel problème pose un prompt qui demande « donne d'abord la réponse, puis explique ta raison » ?
Le modèle écrit d'abord une réponse intuitive, et la « raison » qui suit ne fait que chercher des arguments pour cette réponse, sans la corriger. Le raisonnement doit précéder la réponse pour aider à l'obtenir.
3. Votre application doit classer des avis d'utilisateurs en « positif » et « négatif », 100 000 par jour. Faut-il activer le mode réflexion ?
En général non. La classification de sentiment est une tâche simple, qui se fait généralement très bien sans réflexion ; l'activer multiplierait le coût et allongerait la latence. Testez d'abord sur un petit lot d'avis réels, avec et sans réflexion ; si la précision diffère peu, désactivez-la.
Questions et discussion
Bloqué sur cette leçon ? Posez votre question ici. Et si vous pouvez répondre à quelqu'un, n'hésitez pas.
Une question rapporte 3 points, une réponse 6. Les messages paraissent après vérification.
Chargement de la discussion…