实用工具

HTML 转 Markdown(喂给大模型用)

把网页 HTML 转成干净的 Markdown:保留表格,去掉导航、脚本和页脚。

浏览器本地运行AI 开发工具1.1万
免费

输入

0 B

结果

结果会显示在这里。

把网页源码直接贴给大模型,大部分上下文都浪费在标签、class 名、脚本和菜单上,模型还得自己猜哪部分才是正文。Markdown 只保留有用的东西——标题、列表、链接、代码块和表格——token 数只有原来的一小部分。粘贴网页源码,有 main 或 article 元素时只保留它,其余全部剥掉,再用 mixmark-io/turndown 转换。要批量处理整站、PDF 或 Office 文件,可以看看 jina-ai/reader 和 microsoft/markitdown,前者是在线服务,后者是 Python 工具。

它是怎么工作的

  • HTML 由浏览器自带的 DOMParser 解析,残缺的标签会像浏览器渲染时那样先被修复,再进行转换。
  • 表格会转成 GitHub 风格的竖线表格,这条规则是为本工具单独写的,因为 Turndown 本身会把表格原样留成 HTML。
  • 脚本、样式、表单、nav、aside 以及页面级的 header 和 footer 都会被移除;文章自己的 header(里面有标题)会保留。

你的数据去了哪里

哪也没去。本工具完全在你的浏览器里运行:你粘贴的文本由页面处理,不会传输到任何服务器,也不会写进任何日志。

本工具免费且无需登录,运行结果只存在于你当前的页面里,不会被保存到任何地方。

它要花多少

本工具完全免费,不需要登录,也不消耗积分。

常见问题

能直接输入网址吗?
这里不行:浏览器里的页面读不到别的网站的 HTML,会被对方的 CORS 规则拦下。打开目标网页,查看源代码或在开发者工具里复制对应元素,再粘贴过来。要按网址批量抓取,应该用 jina-ai/reader 这类在服务器端运行的工具。
合并单元格怎么处理?
带 colspan 的单元格后面会补上空单元格,保证每一行列数一致。rowspan 在 Markdown 里没有对应写法,不会还原。只有一行或一列的表格会被当成排版用的布局表格,拆成普通段落,这类表格几乎都是这种用途。
为什么输出里没有其他转换器那么多反斜杠?
Turndown 默认会转义正文里的每个下划线和星号,于是 Q4_K_M 变成 Q4\_K\_M。这是为了防极少见的强调符号冲突,代价是每一页都多了噪音,所以本工具只转义那些会让一行变成标题、引用或列表的字符。

背后的开源项目

本工具运行在 mixmark-io/turndown 之上,以 MIT 许可发布。如果你需要在自己的程序里实现同样的能力,直接用这个库。

mixmark-io/turndown

也常被称作

  • html转markdown
  • 网页转markdown
  • html转md在线
  • 网页内容转markdown给ai
  • turndown在线