實用工具
輸入
結果
結果會顯示在這裡。把網頁原始碼直接貼給大型語言模型,大部分上下文都浪費在標籤、class 名稱、指令碼和選單上,模型還得自己猜哪一部分才是正文。Markdown 只留下有用的東西——標題、清單、連結、程式碼區塊和表格——token 數只剩原本的一小部分。貼上網頁原始碼,有 main 或 article 元素時只保留它,其餘全部移除,再用 mixmark-io/turndown 轉換。要批次處理整個網站、PDF 或 Office 檔案,可以參考 jina-ai/reader 和 microsoft/markitdown,前者是線上服務,後者是 Python 工具。
它是怎麼運作的
- HTML 由瀏覽器內建的 DOMParser 解析,殘缺的標籤會像瀏覽器顯示網頁時那樣先被修正,再進行轉換。
- 表格會轉成 GitHub 風格的直線分隔表格,這條規則是為本工具另外寫的,因為 Turndown 本身會把表格原封不動留成 HTML。
- 指令碼、樣式、表單、nav、aside 以及頁面層級的 header 和 footer 都會被移除;文章本身的 header(裡面有標題)會保留。
你的資料去了哪裡
哪也沒去。本工具完全在你的瀏覽器裡執行:你貼上的文字由頁面處理,不會傳輸到任何伺服器,也不會寫進任何紀錄。
本工具免費且免登入,執行結果只存在於你目前的頁面裡,不會被儲存到任何地方。
它要花多少
本工具完全免費,不需要登入,也不消耗點數。
常見問題
- 可以直接輸入網址嗎?
- 這裡不行:瀏覽器裡的頁面讀不到其他網站的 HTML,會被對方的 CORS 規則擋下。打開目標網頁,檢視原始碼或在開發人員工具裡複製對應元素,再貼過來。要依網址批次抓取,應該使用 jina-ai/reader 這類在伺服器端執行的工具。
- 合併儲存格怎麼處理?
- 帶有 colspan 的儲存格後面會補上空白儲存格,確保每一列的欄數一致。rowspan 在 Markdown 裡沒有對應寫法,不會還原。只有一列或一欄的表格會被當成排版用的版面表格,拆成一般段落,這類表格幾乎都是這種用途。
- 為什麼輸出裡沒有其他轉換器那麼多反斜線?
- Turndown 預設會跳脫正文裡的每個底線和星號,於是 Q4_K_M 變成 Q4\_K\_M。這是為了避免極少見的強調符號衝突,代價是每一頁都多了一堆雜訊,所以本工具只跳脫那些會讓一行變成標題、引言或清單的字元。
背後的開源專案
本工具執行在 mixmark-io/turndown 之上,以 MIT 授權發布。如果你需要在自己的程式裡實作同樣的能力,直接用這個函式庫。
mixmark-io/turndown也常被稱作
- html 轉 markdown
- 網頁轉 markdown
- html 轉 md 線上
- 網頁內容轉 markdown 給 ai
- turndown 線上