实用工具
把文件拖到这里
或者点击选择文件。文件只在当前标签页里处理,不会上传到任何服务器。
在 PDF 阅读器里框选复制,常常顺序是乱的、词与词之间没有空格,或者到了分页就断掉。这个工具用 pdf.js 读取每一页的文字层,再根据每段文字在页面上的实际位置重新拼成行,得到可以直接贴进编辑器、翻译工具或大模型对话框的纯文本。它只对真正含有文字的 PDF 有效:扫描件本质上是照片,需要先做 OCR。
它是怎么工作的
- pdf.js 按文件绘制文字的先后给出内容,大多数生成工具的绘制顺序就是阅读顺序;基线一变就换行,间距明显变大则视为分段。
- 两段文字之间有可见空隙时自动补上空格,修正很多 PDF 复制出来英文单词粘连的问题。
- 每页前面加一行类似 --- 3 / 12 --- 的页码标记(可关闭,得到连续文本),没有文字层的页会单独计数。
你的数据去了哪里
哪也没去。本工具完全在你的浏览器里运行:你粘贴的文本由页面处理,不会传输到任何服务器,也不会写进任何日志。
本工具免费且无需登录,运行结果只存在于你当前的页面里,不会被保存到任何地方。
它要花多少
本工具完全免费,不需要登录,也不消耗积分。
常见问题
- 扫描版 PDF 为什么提取不出任何文字?
- 扫描仪生成的是每一页的照片,文件里根本没有文字。先用本站的“PDF 转图片”把页面变成图片,再交给本站的 OCR 图片文字识别工具(ocr-image-to-text),它能在浏览器里识别中文和英文。
- 双栏排版的论文为什么顺序乱了?
- 多数 PDF 是一栏画完再画下一栏,提取出来顺序正确。少数生成工具是横跨两栏逐行绘制的,而 PDF 本身没有“栏”的概念,于是两栏的行交错在一起。遇到这种文件,可以一页一页提取后手动整理,学术论文也可以用 GROBID 这类懂版面的工具。
- 中文提取出来是乱码怎么办?
- 有些 PDF 通过 Adobe 预定义的中日韩编码把字形映射到汉字,pdf.js 会从 jsDelivr 上的 pdfjs-dist 按需下载这些映射表。如果下载被网络拦截,或者 PDF 的字体压根没有可用的字符映射,文字就无法还原,只能走 OCR。
背后的开源项目
本工具运行在 mozilla/pdf.js 之上,以 Apache-2.0 许可发布。如果你需要在自己的程序里实现同样的能力,直接用这个库。
mozilla/pdf.js也常被称作
- pdf转文字
- pdf提取文字
- pdf转txt
- pdf复制文字
- pdf文本提取在线
- pdf转word文字