Modèle / jeu de données
mlabonne/llm-datasets avatar
mlabonne/llm-datasets

mlabonne/llm-datasets : un inventaire de jeux de données pour le post-entraînement

Curated list of datasets and tools for post-training.

4 777 étoiles395 forksUnknownLa licence varie

En bref

De quoi s’agit-il ?
Le dépôt recense des corpus d'instruction, de mathématiques, de science et de code, avec une colonne Thinking et des notes de licence. C'est un point de départ documentaire, pas un outil exécutable, et la sélection reste celle d'un auteur unique.
À qui s’adresse-t-il ?
Adoptez ce dépôt si vous cherchez un point de départ documenté pour choisir un corpus de SFT ou de raisonnement, en gardant en tête qu'il s'agit d'une liste tenue par un auteur unique et non d'un registre maintenu par une institution. Passez votre chemin si vous avez besoin d'un catalogue exhaustif, d'une garantie de licence vérifiée ou de données sur les coûts de calcul.
Puis-je l’utiliser commercialement ?
Pas sans autorisation. GitHub ne trouve aucun fichier de licence dans ce dépôt, et sans licence tous les droits sont réservés par défaut : vous pouvez lire le code, mais pas le réutiliser. Consultez le README ou demandez l’accord des auteurs avant de l’utiliser.
Est-il encore maintenu ?
Oui. Les derniers commits datent d’il y a 139 jours.
En quel langage est-il écrit ?
GitHub n’indique pas de langage principal pour ce dépôt.

Ces réponses reposent sur les données GitHub du projet (dernière synchronisation le 15 septembre 2026) et sur notre analyse. Elles ne constituent pas un avis juridique.

ANALYSE OPEN SOURCE APPROFONDIE

Le problème concret : choisir un corpus sans se noyer dans les fiches

Le post-entraînement commence par une question pratique : quel corpus utiliser pour le SFT, puis pour la distillation de raisonnement. Hugging Face héberge des milliers de jeux de données, les fiches se ressemblent, et rien n'indique a priori si un corpus convient à un modèle de 7B ou à un mélange multilingue. Le dépôt mlabonne/llm-datasets répond à ce problème de tri. Il se présente comme une liste sélectionnée de jeux de données et d'outils pour le post-entraînement, et son README est organisé par domaine : général, mathématiques, science, code. Chaque entrée indique un volume en millions d'exemples, une colonne Thinking (oui, non, ou Mixed) et une note sur l'origine des réponses. Le public visé est l'ingénieur qui doit arbitrer entre plusieurs corpus avant de lancer un entraînement, pas le chercheur qui veut une revue de littérature. Le README ouvre d'ailleurs sur une définition de ce qu'est un bon jeu de données, autour de trois caractéristiques : exactitude, diversité, complexité. Cette grille sert de filtre implicite pour la suite de la liste.

Ce que les tableaux contiennent réellement

La structure est répétitive et c'est volontaire. Chaque section thématique contient un tableau à quatre colonnes : nom du jeu de données avec lien Hugging Face, nombre d'exemples, indicateur Thinking, et notes. Les notes sont l'endroit où se trouve l'information utile. Pour Nemotron-Cascade-2-SFT-Data, la note précise qu'il s'agit d'un mélange à grande échelle utilisé pour entraîner Nemotron-Cascade-2-30B-A3B, couvrant mathématiques, science, chat, suivi d'instructions, agents de codage et SWE, avec des réponses générées par DeepSeek-V3.2, GPT-OSS-120B et Qwen3. Pour Dolci-Instruct-SFT, la note signale une licence CC-BY-NC-4.0 et une composition mêlant environ 800 000 échantillons publics et environ 1,3 million d'échantillons synthétiques, sur plus de 70 langues. Pour Nemotron-Math-Proofs-v1, elle mentionne environ 580 000 problèmes de preuve en langage naturel, environ 550 000 formalisations Lean 4 et environ 900 000 trajectoires de preuve vérifiées, issues d'AoPS, Math StackExchange et MathOverflow. Ces notes sont ce qui distingue la liste d'un simple annuaire de liens. Elles ne sont pas normalisées pour autant : certaines entrées détaillent la provenance des réponses, d'autres se contentent d'un renvoi vers un article. Le lecteur doit donc accepter une profondeur inégale d'une ligne à l'autre.

Le critère Thinking comme axe de sélection

La colonne Thinking mérite qu'on s'y arrête, car elle traduit un choix éditorial. Elle vaut Yes pour les corpus contenant des traces de raisonnement, No pour les corpus d'instruction classiques, et Mixed pour les mélanges. Cette distinction est plus opérante que le volume brut. Un modèle qui doit produire des réponses longues avec étapes intermédiaires n'a pas les mêmes besoins qu'un modèle d'assistant conversationnel. Le README rattache cette colonne à sa troisième caractéristique, la complexité, définie comme des échantillons multi-tours, multilingues, bien écrits, avec un raisonnement étape par étape lorsque c'est pertinent. La liste range donc OpenThoughts3-1.2M, NuminaMath-CoT ou AM-Thinking-v1-Distilled côté Thinking, et open-perfectblend ou orca-agentinstruct-1M-v1 côté non Thinking. Ce classement binaire a ses limites. Un corpus étiqueté Yes peut contenir des traces courtes et peu informatives, et l'étiquette ne dit rien du taux d'erreur des traces. Le README le reconnaît indirectement en recommandant de combiner relecture manuelle, heuristiques de filtrage par règles, et notation par LLM juge ou modèle de récompense. Autrement dit, la liste aide à présélectionner, elle ne dispense pas d'un contrôle qualité sur le corpus retenu.

Licences : signalées, pas garanties

Le dépôt affiche une note en début de section Instruction : sauf indication contraire, tous les jeux de données listés sont sous licence permissive (Apache 2.0, MIT, CC-BY-4.0, etc.). Cette formulation est honnête mais fragile. Elle signifie que la licence par défaut est supposée permissive, et que les exceptions sont annotées au cas par cas. Or les exceptions sont nombreuses et de nature différente. Nemotron-Cascade-2-SFT-Data est sous NVIDIA Open Model License, Dolci-Instruct-SFT sous CC-BY-NC-4.0 (donc non commercial), MegaScience sous CC-BY-NC-SA-4.0, Nemotron-Science-v1 sous CC-BY-4.0, Nemotron-Math-Proofs-v1 sous CC-BY-SA-4.0. Une clause NC ou SA change l'usage possible d'un corpus dans un produit. Le README ne fournit pas de tableau récapitulatif des licences, et il ne prétend pas faire office d'avis juridique. Pour un projet commercial, la seule pratique raisonnable est d'ouvrir la fiche Hugging Face de chaque jeu de données retenu et de lire la licence à la source. La liste sert d'indice, pas de preuve.

Mise en route : ce qu'on peut réellement exécuter

Il faut être clair sur un point que la nature du dépôt impose : rien ici ne s'installe. Le dépôt n'est pas un paquet, il n'expose pas de commande d'installation, et aucune version publiée n'apparaît dans les informations disponibles. La « mise en route » consiste donc à lire le README, repérer une entrée, puis charger le jeu de données depuis Hugging Face avec l'outil habituel. Le README donne les liens directs vers les fiches, par exemple huggingface.co/datasets/nvidia/Nemotron-Cascade-2-SFT-Data ou huggingface.co/datasets/allenai/Dolci-Instruct-SFT. Le chargement se fait ensuite avec la bibliothèque datasets, du type load_dataset("nvidia/Nemotron-Cascade-2-SFT-Data"), mais cette commande n'est pas écrite dans le matériel fourni et doit être adaptée au format réel de chaque dépôt. Le README mentionne aussi des ressources liées : le blog de l'auteur sur mlabonne.github.io, le LLM Engineer's Handbook, et des articles de publication pour certains corpus comme SYNTHETIC-2. Ces renvois sont la partie opérationnelle du dépôt. Le reste est de la curation.

Quand la liste ne suffit pas

La limitation principale tient au mode de maintenance. Un catalogue de jeux de données vieillit vite : les corpus sont révisés, les licences changent, de nouvelles versions remplacent les anciennes. Le README porte des dates dans les notes (Mar 2026, Dec 2025, Jun 2025, Jul 2024), ce qui permet de repérer l'ancienneté d'une entrée, mais aucune procédure de mise à jour n'est décrite dans le matériel disponible. Il n'y a pas non plus de critère explicite d'inclusion ou d'exclusion. On ne sait pas pourquoi un corpus figure dans la liste et un autre non, ni si une entrée a été retirée après un problème de qualité. La colonne du nombre d'exemples est utile pour dimensionner un entraînement, mais elle ne dit rien du coût de calcul, de la taille en tokens, ni de la difficulté de filtrage. Enfin, le dépôt est porté par un auteur unique, avec un blog et un ouvrage associés. Ce n'est pas un défaut en soi, mais cela signifie que la couverture reflète une trajectoire de lecture personnelle. Pour un inventaire exhaustif ou un suivi institutionnel, ce n'est pas le bon outil.

Alternatives et différences d'approche

Deux approches voisines existent, et elles ne répondent pas à la même question. Le catalogue de jeux de données de Hugging Face permet de filtrer par tâche, taille, langue et licence directement dans l'interface. La différence est celle du contrôle éditorial : le filtre de Hugging Face est mécanique et exhaustif, il ne hiérarchise pas la qualité, alors que la liste de mlabonne/llm-datasets opère une sélection assumée avec des notes de provenance. À l'inverse, des projets comme DataComp-LM ou les collections de post-entraînement publiées par des laboratoires (la collection Nemotron Post-Training v3 est citée dans le README) documentent un pipeline complet, avec les étapes de filtrage et les résultats d'ablation. Là, on obtient une traçabilité méthodologique que la liste ne fournit pas. Le compromis est net : la liste est plus rapide à parcourir et plus large en domaines, mais elle ne remplace ni un catalogue interrogeable ni un rapport de construction de corpus. Pour un choix ponctuel, elle suffit souvent. Pour reproduire une recette d'entraînement, il faut remonter aux publications citées.

Coût de maintenance et portée du dépôt

Le coût de maintenance se lit dans la structure du README. Chaque nouvelle entrée demande de vérifier le volume, la licence, la présence de traces de raisonnement et la provenance des réponses. Sur les sections les plus fournies (général, mathématiques), cela représente un travail de veille régulier. Le dépôt n'ayant pas de version publiée ni de mécanisme de validation automatique apparent, la qualité dépend entièrement de la rigueur de cette veille. Côté licence du dépôt lui-même, les informations disponibles ne mentionnent aucune licence pour le contenu de la liste. C'est un point à ne pas confondre avec les licences des jeux de données référencés : la licence du dépôt, si elle existe, et celles des corpus listés sont deux choses distinctes. Avant de réutiliser le texte de la liste, il faut donc vérifier ce point directement dans le dépôt. Rien dans le matériel fourni ne permet de trancher.

Conclusion éditoriale

Adoptez ce dépôt si vous cherchez un point de départ documenté pour choisir un corpus de SFT ou de raisonnement, en gardant en tête qu'il s'agit d'une liste tenue par un auteur unique et non d'un registre maintenu par une institution. Passez votre chemin si vous avez besoin d'un catalogue exhaustif, d'une garantie de licence vérifiée ou de données sur les coûts de calcul. Avant toute décision, ouvrez la fiche Hugging Face du jeu de données visé et lisez la licence exacte : le README signale les cas restrictifs, mais il ne remplace pas la vérification à la source.

Sources officielles

  1. Issues
  2. mlabonne/llm-datasets on GitHub
  3. Project website
  4. README
Notes de la communauté

Notes de la communauté