实用工具
输入
结果
结果会显示在这里。把网页源码直接贴给大模型,大部分上下文都浪费在标签、class 名、脚本和菜单上,模型还得自己猜哪部分才是正文。Markdown 只保留有用的东西——标题、列表、链接、代码块和表格——token 数只有原来的一小部分。粘贴网页源码,有 main 或 article 元素时只保留它,其余全部剥掉,再用 mixmark-io/turndown 转换。要批量处理整站、PDF 或 Office 文件,可以看看 jina-ai/reader 和 microsoft/markitdown,前者是在线服务,后者是 Python 工具。
它是怎么工作的
- HTML 由浏览器自带的 DOMParser 解析,残缺的标签会像浏览器渲染时那样先被修复,再进行转换。
- 表格会转成 GitHub 风格的竖线表格,这条规则是为本工具单独写的,因为 Turndown 本身会把表格原样留成 HTML。
- 脚本、样式、表单、nav、aside 以及页面级的 header 和 footer 都会被移除;文章自己的 header(里面有标题)会保留。
你的数据去了哪里
哪也没去。本工具完全在你的浏览器里运行:你粘贴的文本由页面处理,不会传输到任何服务器,也不会写进任何日志。
本工具免费且无需登录,运行结果只存在于你当前的页面里,不会被保存到任何地方。
它要花多少
本工具完全免费,不需要登录,也不消耗积分。
常见问题
- 能直接输入网址吗?
- 这里不行:浏览器里的页面读不到别的网站的 HTML,会被对方的 CORS 规则拦下。打开目标网页,查看源代码或在开发者工具里复制对应元素,再粘贴过来。要按网址批量抓取,应该用 jina-ai/reader 这类在服务器端运行的工具。
- 合并单元格怎么处理?
- 带 colspan 的单元格后面会补上空单元格,保证每一行列数一致。rowspan 在 Markdown 里没有对应写法,不会还原。只有一行或一列的表格会被当成排版用的布局表格,拆成普通段落,这类表格几乎都是这种用途。
- 为什么输出里没有其他转换器那么多反斜杠?
- Turndown 默认会转义正文里的每个下划线和星号,于是 Q4_K_M 变成 Q4\_K\_M。这是为了防极少见的强调符号冲突,代价是每一页都多了噪音,所以本工具只转义那些会让一行变成标题、引用或列表的字符。
背后的开源项目
本工具运行在 mixmark-io/turndown 之上,以 MIT 许可发布。如果你需要在自己的程序里实现同样的能力,直接用这个库。
mixmark-io/turndown也常被称作
- html转markdown
- 网页转markdown
- html转md在线
- 网页内容转markdown给ai
- turndown在线