實用工具

微調 JSONL 驗證工具

上傳前逐行檢查 OpenAI 聊天微調檔案,並看到它的 Token 統計,以及訓練會計費多少 Token。

瀏覽器本機執行AI 開發工具7.6萬
免費

輸入

0 B

結果

結果會顯示在這裡。

OpenAI 的微調工作如果沒通過驗證,或是在悄悄損壞的範例上完成訓練,都會浪費時間和金錢。這個工具把 OpenAI 官方資料準備筆記本(openai/openai-cookbook,MIT)中的檢查套用到你的 JSONL 檔案上——每行一個聊天範例——並延伸到那份筆記本問世之後才加入格式的部分:工具呼叫、圖片內容片段,以及每則訊息的權重。你會看到每個錯誤及其行號、筆記本提供的 Token 統計、API 預設會選擇的訓練輪數(epoch),以及訓練會計費多少 Token。

它是怎麼運作的

  • 每一行都必須是含有 messages 陣列的 JSON 物件;角色必須是 system、user、assistant、tool 或 function,而且每個範例至少要有一則可供學習的 assistant 訊息。
  • 它會檢查上傳驗證會拒絕的內容:未知的鍵、空白內容、不是 0 或 1 的 weight 或設在非 assistant 訊息上的 weight、缺少 id、名稱或 JSON 參數的工具呼叫,以及 tool_call_id 對應不到任何先前呼叫的工具回覆。
  • 它也能認出格式完全不對的檔案——舊式的 prompt/completion 版面,以及偏好(DPO)資料——並直接說明,而不是列出幾百個錯誤。
  • Token 以筆記本的公式搭配 o200k_base 計算;超過 Token 上限的範例會被標出,因為訓練時會截斷它們,而計費 Token 等於截斷後的總數乘以預設訓練輪數。

你的資料去了哪裡

哪也沒去。本工具完全在你的瀏覽器裡執行:你貼上的文字由頁面處理,不會傳輸到任何伺服器,也不會寫進任何紀錄。

本工具免費且免登入,執行結果只存在於你目前的頁面裡,不會被儲存到任何地方。

它要花多少

本工具完全免費,不需要登入,也不消耗點數。

常見問題

需要多少個範例?
少於 10 個 API 會拒絕。OpenAI 建議從 50 到 100 個精挑細選的範例開始,只有在結果確實改善時才再增加。預設訓練輪數會依檔案大小調整:大多數檔案是 3,非常小的檔案會更多(最多 25),非常大的檔案則更少,本工具採用的就是這個規則。
Token 上限這個設定有什麼作用?
它是基礎模型能訓練的最長範例長度;OpenAI 文件中 gpt-4o 和 gpt-4o-mini 是 65,536 Token,這也是這裡的預設值。更長的範例在訓練時會被截到上限,所以結尾部分——通常正是 assistant 的回答——會遺失。請設定為你所選模型文件中記載的上限。
我的 Token 數會和 OpenAI 算的完全一樣嗎?
很接近,但不一定完全相同:筆記本公式中每則訊息的額外開銷是近似值,工具定義則以其 JSON 文字計算。請用它來找出過長的範例並估算費用;最終以微調工作本身回報的已訓練 Token 數為準。
會檢查 DPO 或強化微調的檔案嗎?
不會。它驗證的是監督式聊天格式。含有 preferred_output 和 non_preferred_output 的偏好檔案會被偵測出來並如實回報,讓你知道為什麼每一行都失敗,但不會檢查它本身的結構。

背後的開源專案

本工具是獨立實作,並未打包第三方函式庫。openai/openai-cookbook(MIT)在程式碼層面做的是同一件事——如果你需要在自己的程式裡實作它,從那裡開始,而不是呼叫一個網頁。

openai/openai-cookbook

也常被稱作

  • jsonl 驗證
  • openai 微調 資料格式
  • fine-tuning jsonl
  • 微調資料檢查
  • openai fine tune 格式
  • 微調 token 計算