llm-datasets:一份後訓練資料集的索引,以及它不打算替你做的事
Curated list of datasets and tools for post-training.
秒懂
- 它是什麼?
- mlabonne/llm-datasets 是一份以 Markdown 表格維護的後訓練資料集清單,涵蓋 SFT 指令、數學、科學、程式碼等類別。它的價值在於選型時的分類與欄位設計,代價是它本身不含任何資料、不下載、不驗證,授權欄位也只在部分條目出現。
- 適合誰用?
- 如果你正在為 SFT 或推理蒸餾挑選起點,這份清單的 Thinking 欄位與樣本數欄位能讓你在半小時內排出候選順序,值得先讀。如果你的流程需要自動化,它幫不上忙:沒有 manifest、沒有 checksum、沒有 API,你得自己把表格解析成結構化資料,而表格隨時可能被改動。
- 可以商用嗎?
- 未經許可不行。GitHub 在這個儲存庫中沒有找到授權檔案;沒有授權,預設即「保留所有權利」:你可以閱讀程式碼,但不能重複使用。使用前請看看 README,或先取得作者同意。
- 還在維護嗎?
- 有在維護。儲存庫最近一次提交在 139 天前。
- 用什麼語言寫的?
- GitHub 沒有提供這個儲存庫的主要語言。
以上回答依據專案的 GitHub 資料(最近同步於 2026年9月15日)與我們的分析,不構成法律意見。
開源專案深度解析
這份清單要解決的是選型前的資訊散落問題
後訓練的資料集散落在 Hugging Face、arXiv 論文附錄與各家實驗室的 release blog 裡。同一個領域可能同時存在十幾個候選,規模從數十萬到上千萬樣本,標註方式從人工驗證到蒸餾自某個特定模型都有。要判斷哪一份適合當起點,你得先知道有哪些、各自多大、有沒有推理軌跡、授權是什麼。llm-datasets 把這四件事壓縮成表格欄位,這是它存在的理由。
它的目標讀者不是剛接觸微調的人。README 開頭直接討論 Accuracy、Diversity、Complexity 三個維度,並提到用 solver 驗數學、用 unit test 驗程式碼、用 judge LLM 或 reward model 打分。這些是已經跑過至少一輪 SFT、正在為第二輪或領域特化找資料的人會關心的問題。清單預設你已經知道 SFT 與 RL 資料的差別,也知道 chat template 是什麼。
表格的四個欄位,以及 Thinking 欄位為什麼最值得看
每一張表都是 Dataset、#、Thinking、Notes 四欄。Dataset 欄放的是 Hugging Face 連結加上發布年月,例如 Nemotron-Cascade-2-SFT-Data 標的是 Mar 2026。這個年月標註比看起來有用:後訓練資料的迭代速度很快,同一系列常有 v1、v3 並存,年份月份是你判斷該不該往下找新版本的唯一線索。
Thinking 欄只有三種值:Yes、No、Mixed。它標的是資料是否包含推理軌跡,也就是回答裡有沒有 step-by-step 的思考段落。這個欄位決定了資料能不能直接用來訓練推理模型,也決定了 token 預算。一份標 Yes 的資料,同樣樣本數下訓練成本通常高於標 No 的,因為序列長得多。清單把 Mixed 獨立出來是誠實的做法,Nemotron-Cascade-2-SFT-Data 就是 Mixed,代表它同時混了有推理與無推理的樣本,你無法從欄位判斷比例,只能點進去看。
Notes 欄承擔了其餘所有資訊:樣本數以外的規模描述、授權標註、蒸餾來源、以及指向論文的連結。要注意授權只寫在 Notes 裡,而且是選擇性的。README 用一個 NOTE 區塊聲明「除非另有註明,所有資料集都在寬鬆授權下(Apache 2.0、MIT、CC-BY-4.0 等)」,實際表格裡則零星出現 CC-BY-NC-4.0、CC-BY-SA-4.0、CC-BY-NC-SA-4.0、NVIDIA Open Model License 這幾種標註。這個結構意味著:沒有標註的條目,你只能依賴那句通則,而通則本身沒有涵蓋清單裡所有來源。
從清單到可訓練資料之間,缺的是驗證環節
README 對「好資料集」的定義寫得很清楚,要 Accuracy、Diversity、Complexity 三者兼顧,並且要靠人工審閱、規則過濾、judge LLM 評分三種手段交叉檢查。但這份清單本身不做這些事。它不下載資料、不跑過濾腳本、不驗證樣本品質,只提供連結。
這是一個明確的分工選擇,不是缺陷,但使用時要意識到後果。清單裡每一條 Notes 的品質描述,來源是該資料集的發布者自己的說法,清單作者沒有獨立複核。以 Nemotron-Math-Proofs-v1 為例,Notes 寫的是約 580k 自然語言證明題、約 550k 個 Lean 4 形式化、約 900k 條已驗證的證明軌跡,這些數字來自發布方,清單只是轉述。當你看到「verified」出現在資料集名稱裡,那是命名,不是這份清單替你做的背書。
所以實際流程會是:清單幫你縮小到三到五個候選,接著你必須自己去 Hugging Face 上看 dataset card、抽樣檢查、確認 chat template 格式是否與你的訓練框架相容。這一步無法省略。
類別切分反映的是訓練目標,不是主題
清單分成 General、Math、Science、Code 幾類,但這個切分不是單純按學科。General 類的定義是「涵蓋 chat、code、math 的均衡混合」,用來訓練通用模型;其餘類別則是針對模型已知的弱項做特化。README 對數學那一節的說明是「LLM 常在數學推理與形式邏輯上掙扎」,對程式碼那一節則直接寫「Code 是另一個對 LLM 有挑戰性的領域」。
這個框架會影響你的選型順序。如果你的目標是通用助手,應該從 General 表開始,注意裡面的樣本數落差極大,從 693k 到 15.87M 都有。如果你的目標是補特定能力,就直接跳到對應表,並優先看 Thinking 欄為 Yes 的條目。
Science 表只有兩條,其中 MegaScience 標的是 CC-BY-NC-SA-4.0,Nemotron-Science-v1 標的是 CC-BY-4.0。兩者的授權差異直接決定了能不能商用,這是清單在這一節最有價值的資訊,比樣本數更重要。
它與 open-perfectblend 是兩種不同的東西
清單裡有一條是 mlabonne/open-perfectblend,1.42M 樣本,Oct 2024,Thinking 欄為 No。Notes 說明它是某篇論文所述資料集的開放重現,屬於含 chat、math、code、instruction following 的基線指令資料集。
把這條和清單本身放在一起看,差別就清楚了。open-perfectblend 是一個具體產物:一份你可以直接下載、直接餵進訓練腳本的資料。llm-datasets 是一個索引:它指向產物,本身不可訓練。兩者的維護成本也不同。資料集需要處理格式、去重、授權與版本;索引只需要更新表格,而表格的正確性依賴作者是否跟得上新發布。
如果你的問題是「我該用哪份資料」,索引有用。如果你的問題是「我現在就要開始訓練」,索引幫不了你,你得先回答前一個問題。這個區別聽起來廢話,但實際專案裡經常被混為一談,尤其是當清單被當成「資源包」引用的時候。
維護狀態與你該自己確認的事
倉庫沒有檢索到任何 release,預設分支是 main,首頁指向作者的部落格。這意味著沒有版本化的快照可以鎖定。表格內容會隨 commit 變動,如果你把清單內容寫進內部文件或腳本,需要記下當時的 commit hash,否則日後無法還原你當初依據的是哪一版。
授權方面,README 的通則聲明與表格中的個別標註並不完全一致,這不是錯誤,而是清單的粒度限制。CC-BY-NC 系列的 NC 條款限制商業使用,CC-BY-SA 系列要求衍生作品以相同方式分享,這兩者在訓練模型並部署時都可能產生義務。清單不會替你判斷這些義務是否適用於你的情境。
具體該做的核對動作是:打開目標資料集在 Hugging Face 上的頁面,找 dataset card 裡的 license 欄位,與清單 Notes 對照。若清單沒標、dataset card 也沒標,就當作授權不明處理,不要套用 README 那句通則。
誰該用它,以及什麼時候它會誤導你
已經有訓練流程、正在為特定能力找資料的人,用這份清單效率很高。Thinking 欄加上樣本數,讓你能在短時間內排出候選與 token 預算的粗略關係。
它會誤導你的情況有兩種。第一種是你把 Notes 裡的品質描述當成獨立評測結果,那些數字來自發布方。第二種是你需要自動化選型,例如想在 CI 裡檢查資料集是否更新,這份清單沒有提供任何機器可讀的介面,你得自己寫解析器處理 Markdown 表格,而欄位格式沒有保證。
還有一個容易被忽略的邊界:清單只涵蓋它列出的類別。偏好資料、reward model 訓練資料、以及 RL 相關的資料集,在這份 README 的可見範圍內並沒有獨立分類。如果你的後訓練流程需要這些,清單的覆蓋是不完整的。
編輯結論
如果你正在為 SFT 或推理蒸餾挑選起點,這份清單的 Thinking 欄位與樣本數欄位能讓你在半小時內排出候選順序,值得先讀。如果你的流程需要自動化,它幫不上忙:沒有 manifest、沒有 checksum、沒有 API,你得自己把表格解析成結構化資料,而表格隨時可能被改動。若你只想拿一份已整理好的指令資料直接開跑,應該直接採用清單裡的 open-perfectblend 或 Dolci-Instruct-SFT,而不是把這份清單當成資料來源。動手前務必逐條核對 Hugging Face 上的原始授權欄位,README 的「除非另有註明」只是通則,不是保證。
社群筆記