模型 / 資料集
ConardLi/easy-dataset avatar
ConardLi/easy-dataset

easy-dataset:把領域文件變成 LLM 微調、RAG 與評估資料集的整合工具

A powerful tool for creating datasets for LLM fine-tuning 、RAG and Eval

14,913 個 Star1,532 個 ForkJavaScriptNOASSERTION

秒懂

它是什麼?
easy-dataset 是一套以 JavaScript 打造、提供桌面客戶端的 LLM 資料集建置工具,能將 PDF、Markdown、DOCX 等文件轉換成結構化 QA 資料,並內建評估系統與多種匯出格式。本文根據其 README 與版本資訊,檢視它的實際功能、運作方式、限制與適用場景。
適合誰用?
easy-dataset 適合需要把大量領域文件轉成微調、RAG 或評估用資料集的個人或小型團隊,尤其是非工程背景的使用者,因為它提供圖形介面與桌面客戶端,降低資料前處理的門檻。不適合需要完全掌控資料處理流程、或計畫將工具整合進自家產品並以 SaaS 形式對外提供的團隊,因為 AGPL-3.0 授權會要求衍生作品開源,且 JavaScript 實作與桌面架構在伺服器端自動化場景可能綁手綁腳。
可以商用嗎?
請先確認。這個儲存庫使用的授權不在我們自動分類的範圍內,商用前請閱讀儲存庫中的 LICENSE 檔案。
還在維護嗎?
有在維護。儲存庫最近一次提交在 137 天前。
用什麼語言寫的?
主要是 JavaScript(依據 GitHub 的語言統計)。

以上回答依據專案的 GitHub 資料(最近同步於 2026年9月15日)與我們的分析,不構成法律意見。

開源專案深度解析

文件到資料集的整條生產線

多數 LLM 專案卡在資料準備,而非模型訓練。easy-dataset 正是針對這個痛點:它把文件解析、文字分割、問題生成、答案生成、資料清洗、格式匯出整成一條 GUI 驅動的生產線。目標使用者很清楚,是那些手上有一批領域文件,想做成微調集、RAG 檢索測試集或評估集的人。README 列出的格式包含 PDF、Markdown、DOCX、TXT、EPUB,還提到圖片 QA 可從目錄、PDF、ZIP 匯入。這不是一個程式庫,而是一個應用程式,有 Windows、macOS、Linux 桌面客戶端,也提供本機執行方式。對非技術人員來說,這比操作 Python 資料管線友善許多,但對工程師而言,這也意味著你得接受它定義好的工作流程。

從章節結構到問答對的自動化流程

根據 README 的架構圖與功能描述,資料處理的順序大致是:先解析文件,再用多種分割演算法把文字切成區塊,接著從區塊中自動抽取相關問題,最後用 LLM API 生成答案與思維鏈。分割演算法有 Markdown 結構、遞迴分隔符、固定長度、程式碼感知等四種,而且支援視覺化手動調整切分點。這是個關鍵設計:純自動分割經常切錯語意邊界,能事後調整就代表輸出品質可以人為控制。問題生成不是只能靠模型自由發揮,它提供問題模板與批次生成,也允許在專案層級覆寫所有提示詞模板。換句話說,提示詞不是寫死在程式裡,這對需要特定領域口吻或格式的人很重要。資料清洗與 AI 品質評分則放在生成之後,企圖把低品質樣本過濾掉。整個流程的每個環節都依賴外部 LLM API,所以實際上你是在用模型來造資料,再用同類模型來評資料,這點在後面會談到它的風險。

評估系統是 1.7.0 之後的新賣點

1.7.0 版加入評估功能,這讓 easy-dataset 不只是資料生成器,還延伸到模型測試。它能產生是非題、單選題、多選題、簡答題與開放式問題,這幾種題型正好對應自動化評估常見的格式。評估方式有兩種:一種是讓 Judge Model 依照可自訂的評分規則自動打分,另一種是人類盲測,也就是 Arena 模式,把兩個模型的回答匿名並排,讓人選出較佳者。盲測設計在 fine-tuning 後的模型比較上特別有用,因為自動評分常常抓不到語感或事實細節的差異。README 也提到可以評估 RAG 的召回率,但沒有說明具體做法。以 1.7.3 的版本號來看,這套評估系統推出不到一年,功能面可能還在變動,文件也未必完整。如果你需要的是嚴謹的評測框架,例如多種指標、統計顯著性檢定,那這裡提供的比較像是輕量級的內部測試工具。

匯出格式綁定主流生態,但別期待自由

資料集做好之後,匯出是另一個重點。easy-dataset 支援 Alpaca、ShareGPT、Multilingual-Thinking 三種格式,檔案類型有 JSON 與 JSONL。這三種格式分別對應不同的微調框架習慣,Alpaca 是單輪指令的常見格式,ShareGPT 則保留多輪對話結構。它還提供每個標籤的匯出數量設定,這對平衡資料集類別分布很有幫助,免得某個主題的樣本過多導致模型偏斜。更實際的是,它可以直接產生 LLaMA Factory 的設定檔,並上傳到 Hugging Face Hub。換句話說,如果你的下游工具是 LLaMA Factory,這條路徑很順。但反過來說,如果你用的是其他微調框架,例如 axolotl 或自訂訓練迴圈,你就得自己寫轉換程式。格式支援的廣度是這類工具的常見限制,easy-dataset 選擇了目前社群最主流的幾種,但沒有承諾涵蓋所有可能格式。

模型支援以 OpenAI 相容 API 為前提

所有模型功能都掛在一個假設上:你的 LLM API 必須相容 OpenAI 格式。README 列出的供應商包括 OpenAI、MiniMax、Ollama、智譜 AI、阿里雲百煉、OpenRouter,視覺模型則支援 Gemini 與 Claude,用於 PDF 解析與圖片 QA。Ollama 代表本機模型,這表示你可以完全離線執行資料生成,只要本機跑得動模型。但要注意,答案生成、問題生成、資料清洗、評估打分全部都要呼叫模型,所以 token 消耗會很可觀。README 提到有資源監控儀表板,能看 token 統計與 API 呼叫追蹤,這代表作者預期用量會大到需要監控。實際成本取決於你處理的文件量與生成的問題數,但如果你用付費 API 處理數百份文件,費用可能很快就超過任何桌面軟體的售價。選擇模型時也要留意,視覺模型只用在解析與圖片 QA,一般文字生成還是走 OpenAI 相容介面,兩者可能來自不同供應商,設定上要分開處理。

授權與維護成本:AGPL-3.0 不是裝飾

README 的徽章顯示 AGPL-3.0 授權,但 GitHub 的 metadata 卻標示 NOASSERTION,這代表授權聲明在檔案層級可能不一致,採用前需要自己檢查專案內的 LICENSE 檔案。AGPL-3.0 的網路使用條款意味著,如果你把這套工具或它的衍生版本部署成網路服務,你可能需要將完整的對應原始碼開源。這對內部使用影響不大,但對想把它整合進商業 SaaS 產品的人來說,是重大考量。維護方面,專案最後一次推送是 2026 年 5 月,1.7.3 在 2026 年 4 月釋出,1.7.2 在 2 月,1.7.1 在 1 月,看起來更新頻率大約每兩個月一次。這表示專案仍持續活躍,但沒有承諾長期支援。由於它是 GUI 應用程式,升級通常會跟著新版本客戶端一起,不會像程式庫那樣有相依性衝突。但如果你修改了程式碼,每次升級都得重新套用補丁,這是 fork 開源桌面軟體的共同成本。

替代方案:從程式庫到雲端服務的光譜

easy-dataset 的定位是整合型應用,市面上與它做法不同的替代方案有好幾類。最接近的開源選擇是 LLM 資料生成框架,例如 distilabel 或 Argilla,它們提供 Python API 與資料集管理介面,讓你可以用程式碼定義生成流程,靈活性遠高於 GUI,但需要寫程式,而且沒有內建文件解析。另一個方向是雲端資料平台,例如 Scale AI 的資料標記服務,它們提供人工標記與品質控管,適合需要人類驗證的高品質資料,但成本高且資料必須離開本地。還有一類是純文件分割工具,例如 unstructured,它專注於將 PDF、DOCX 等轉成結構化文字,但不生成問答對。easy-dataset 的獨特之處在於把文件解析、問答生成、評估、匯出全部包在同一個介面,省去串接多個工具的麻煩。但這個整合的代價是,每個環節都只能使用它提供的選項,如果你在某一步需要特殊處理,例如自訂分割邏輯或非標準輸出格式,你可能會卡住。

資料品質的隱憂:用模型造資料再用模型評分

整個 easy-dataset 的資料生成流程高度依賴 LLM,問題是模型生成的,答案也是模型生成的,最後的品質評分還是模型做的。這會產生一個循環:如果基礎模型對某個領域有系統性偏誤,生成的資料會繼承這個偏誤,而評分模型如果與生成模型同源,可能看不出問題。README 沒有提到任何人工驗證的強制環節,雖然有 AI 品質評分,但那是自動的。人類盲測系統存在,但那是用來比較兩個模型的輸出,不是用來驗證訓練資料的正確性。換句話說,你得到的資料集可能流暢、格式正確,但事實錯誤或邏輯矛盾不一定會被抓出來。對於微調,這特別危險,因為模型會學到錯誤的知識。解決辦法是抽樣人工檢查,但 easy-dataset 沒有內建標記或審核工作流程,你得自己把資料匯出後再處理。這是這類自動化工具的結構性限制,不是 bug,但你在採用前必須有心理準備。

編輯結論

easy-dataset 適合需要把大量領域文件轉成微調、RAG 或評估用資料集的個人或小型團隊,尤其是非工程背景的使用者,因為它提供圖形介面與桌面客戶端,降低資料前處理的門檻。不適合需要完全掌控資料處理流程、或計畫將工具整合進自家產品並以 SaaS 形式對外提供的團隊,因為 AGPL-3.0 授權會要求衍生作品開源,且 JavaScript 實作與桌面架構在伺服器端自動化場景可能綁手綁腳。採用前應先確認:你使用的 LLM API 是否相容 OpenAI 格式,因為所有模型支援都以此為前提;文件解析品質是否滿足你的文件類型,尤其是掃描 PDF 或複雜表格;以及評估功能是否真的需要,因為 1.7.0 才加入,成熟度有待觀察。若只是要將現成 JSON 轉成 Alpaca 或 ShareGPT 格式,直接寫轉換腳本會比導入整套工具更輕量。

官方來源

  1. ConardLi/easy-dataset on GitHub
  2. Issues
  3. Project website
  4. README
  5. Releases
社群筆記

社群筆記