实用工具

PDF 文字提取

逐页取出 PDF 里的文字层,按阅读顺序还原成一行一行的纯文本。

浏览器本地运行PDF 工具5.4万
免费
把文件拖到这里

或者点击选择文件。文件只在当前标签页里处理,不会上传到任何服务器。

在 PDF 阅读器里框选复制,常常顺序是乱的、词与词之间没有空格,或者到了分页就断掉。这个工具用 pdf.js 读取每一页的文字层,再根据每段文字在页面上的实际位置重新拼成行,得到可以直接贴进编辑器、翻译工具或大模型对话框的纯文本。它只对真正含有文字的 PDF 有效:扫描件本质上是照片,需要先做 OCR。

它是怎么工作的

  • pdf.js 按文件绘制文字的先后给出内容,大多数生成工具的绘制顺序就是阅读顺序;基线一变就换行,间距明显变大则视为分段。
  • 两段文字之间有可见空隙时自动补上空格,修正很多 PDF 复制出来英文单词粘连的问题。
  • 每页前面加一行类似 --- 3 / 12 --- 的页码标记(可关闭,得到连续文本),没有文字层的页会单独计数。

你的数据去了哪里

哪也没去。本工具完全在你的浏览器里运行:你粘贴的文本由页面处理,不会传输到任何服务器,也不会写进任何日志。

本工具免费且无需登录,运行结果只存在于你当前的页面里,不会被保存到任何地方。

它要花多少

本工具完全免费,不需要登录,也不消耗积分。

常见问题

扫描版 PDF 为什么提取不出任何文字?
扫描仪生成的是每一页的照片,文件里根本没有文字。先用本站的“PDF 转图片”把页面变成图片,再交给本站的 OCR 图片文字识别工具(ocr-image-to-text),它能在浏览器里识别中文和英文。
双栏排版的论文为什么顺序乱了?
多数 PDF 是一栏画完再画下一栏,提取出来顺序正确。少数生成工具是横跨两栏逐行绘制的,而 PDF 本身没有“栏”的概念,于是两栏的行交错在一起。遇到这种文件,可以一页一页提取后手动整理,学术论文也可以用 GROBID 这类懂版面的工具。
中文提取出来是乱码怎么办?
有些 PDF 通过 Adobe 预定义的中日韩编码把字形映射到汉字,pdf.js 会从 jsDelivr 上的 pdfjs-dist 按需下载这些映射表。如果下载被网络拦截,或者 PDF 的字体压根没有可用的字符映射,文字就无法还原,只能走 OCR。

背后的开源项目

本工具运行在 mozilla/pdf.js 之上,以 Apache-2.0 许可发布。如果你需要在自己的程序里实现同样的能力,直接用这个库。

mozilla/pdf.js

也常被称作

  • pdf转文字
  • pdf提取文字
  • pdf转txt
  • pdf复制文字
  • pdf文本提取在线
  • pdf转word文字