实用工具
把文件拖到这里
或者点击选择文件。文件只在当前标签页里处理,不会上传到任何服务器。
从截图、扫描的合同或拍下来的幻灯片里复制文字,本不该需要把图片交给别人的服务器。这个工具通过 naptha/tesseract.js(Tesseract 引擎的 WebAssembly 移植版)在当前标签页里完成识别:选好语言,拖进一张或多张图片,就能拿到文字和引擎自己给出的置信度。默认是简体中文加英文,因为中文截图里十有八九夹着英文术语。
它是怎么工作的
- 第一次运行会从 jsDelivr CDN 下载 tesseract.js 的 worker、WASM 核心和语言模型,之后浏览器会缓存;图片本身始终不离开这个标签页。
- 多张图片用同一个 worker 依次识别,每段结果前面标着对应的文件名。
- Tesseract 会在中文、日文字符之间插入空格,工具只删掉两边都是 CJK 字符的空格,所以 GPU 显存这种中英混排会保留原有间隔。
你的数据去了哪里
哪也没去。本工具完全在你的浏览器里运行:你粘贴的文本由页面处理,不会传输到任何服务器,也不会写进任何日志。
本工具免费且无需登录,运行结果只存在于你当前的页面里,不会被保存到任何地方。
它要花多少
本工具完全免费,不需要登录,也不消耗积分。
常见问题
- 怎样提高识别准确率?
- Tesseract 最擅长清晰、印刷体、横排的文字,字高最好在 20 像素左右以上。先把图片裁到只剩文字,用截图而不是对着屏幕拍照,语言要选准——繁体中文按简体识别会出现大量错字。手写体和花哨的艺术字超出了这个引擎的能力范围。
- 置信度这个数字是什么意思?
- 它是 Tesseract 对整页各个词的平均置信度,范围 0 到 100。90 以上通常基本正确;六七十分就要预期会有错字,尤其是形近的汉字。它衡量的是引擎有多确定,而不是真实准确率,重要的内容一定要人工校对一遍。
- 为什么第一次这么慢?
- 首次使用要下载识别引擎和语言数据,中文的有好几 MB,之后都走缓存。如果你的网络访问 jsDelivr 很慢或被拦截,下载会卡住,工具就无法运行;只要成功运行过一次,之后就能直接从缓存加载。
背后的开源项目
本工具运行在 naptha/tesseract.js 之上,以 Apache-2.0 许可发布。如果你需要在自己的程序里实现同样的能力,直接用这个库。
naptha/tesseract.js也常被称作
- 在线ocr识别
- 图片转文字
- 图片文字识别
- 免费ocr
- 截图识别文字
- 中文ocr在线