實用工具

AI 文字轉 JSON 擷取工具

從電子郵件、發票、筆記中依你的 Schema 擷取結構化 JSON,文中沒有的欄位一律填 null。

自備 Key 或官方託管AI 助手1.4萬
到哪裡取得 Key

Key 只在你的瀏覽器裡。Key 由瀏覽器直接傳給服務商,不經過我們的伺服器,我們不記錄也不保存。建議使用專門建立、設有額度上限的 Key,用完及時到服務商後台刪除。

輸入

結果

結果會顯示在這裡。

郵件內文裡的發票、履歷、客服工單、會議紀錄——需要的資訊都在裡面,只是程式讀不懂。把文字貼進來,在旁邊的欄位填一份 JSON Schema,或乾脆列出欄位名稱,模型就只回傳 JSON:你要的鍵、你宣告的型別,文中沒提到的一律是 null。最後這條最要緊:你要模型找一個文中根本沒有的到期日,它會很樂意替你編一個,除非明確告訴它「看得見的 null 比煞有其事的猜測更好」。Schema 欄位留空時,模型會把文中找到的事實整理成一個扁平物件,拿來替一種新文件草擬 Schema 很方便。

它是怎麼運作的

  • Schema 欄位接受兩種寫法:JSON Schema——送出前先解析並格式化,語法錯誤在這裡就會被抓出來,不會把模型搞糊塗;或是每行一個欄位,例如「total: number」、「due_date: date」。
  • 數字會去掉貨幣符號和千分位,日期統一為 ISO 8601,文字值照原文保留、不翻譯;選「多筆紀錄」時回傳陣列,每張發票、每位應徵者、每張工單各佔一個物件。
  • 567-labs/instructor 是團隊在自己的程式碼裡取得同樣經過驗證輸出的常用函式庫,搭配 Pydantic 模型並自動重試;本頁只靠提示詞來貫徹同樣的紀律。
  • 這類文件常含有個人資料,它會和你的 Key 一起從頁面直接送到服務商;另外建一把額度很低的 Key、用完刪除,萬一外洩損失也有限。

你的資料去了哪裡

使用自備 Key 時,你輸入的內容和 Key 由瀏覽器直接傳送給你選擇的 AI 服務商,不經過 hysenlabs 的伺服器。使用官方託管時,內容經我們的伺服器轉送給我們的服務商(DeepSeek),以 credits 計費;我們只記錄每次執行的 Token 數和成本用於計費,從不保存你輸入的內容和回傳的結果。服務商如何處理這些內容,以它自己的隱私權政策為準。

本工具會接觸金鑰與憑證,因此任何一次執行都不會被儲存,連你自己的歷史裡也不會有。

關於你的 API Key

我們承諾不會收集、儲存或洩漏你的 Key:它只保存在目前頁面的記憶體裡(除非你勾選「在此分頁記住」),關閉頁面即消失。但任何 Key 只要在網頁裡用過,都值得多一分小心——建議專門為這裡建立一把設有額度上限的 Key,用完後及時到服務商後台刪除或輪換。

它要花多少

本工具完全免費,不需要登入,也不消耗點數。

常見問題

輸出一定能通過我的 Schema 驗證嗎?
任何提示詞都無法保證,實際做事的是模型。能力強的模型對 Schema 的遵循相當可靠,但在依賴結果之前仍要驗證一次,例如用 JSON Schema 驗證器跑一下。在你自己的程式碼中,instructor 或服務商原生的結構化輸出模式能在此之上再加上驗證與重試。
為什麼某個必填欄位是 null?
因為文中根本沒給出這個值,而工具被要求寧可填 null 也不捏造。如果你的 Schema 把它標成必填的 string,輸出就過不了嚴格驗證——這正是誠實的結果。要嘛在 Schema 裡允許 null("type": ["string", "null"]),要嘛給模型含有這個值的文字。
結果外面包了一層 ```json 程式碼區塊,怎麼回事?
有些模型即使被明確要求也會加上 Markdown 程式碼區塊標記,小模型尤其常見。刪掉第一行和最後一行,中間的 JSON 就能直接使用。如果一再發生,換成同一家服務商規模更大的模型試試。
能讀 PDF 或掃描的發票嗎?
只能讀文字。先把文字取出來——從 PDF 複製,或把掃描檔跑一次 OCR——再貼到這裡。版面不必保留,表格貼成參差不齊的幾行,模型通常也看得懂。

背後的開源專案

本工具是獨立實作,並未打包第三方函式庫。567-labs/instructor(MIT)在程式碼層面做的是同一件事——如果你需要在自己的程式裡實作它,從那裡開始,而不是呼叫一個網頁。

567-labs/instructor

也常被稱作

  • 文字轉 json
  • ai 資料擷取
  • 結構化資料擷取
  • json schema 擷取
  • llm 結構化輸出
  • 發票資料擷取