图片转文字(OCR)
免费在线OCR文字识别:从图片、截图、照片和扫描版PDF中提取文字,支持24种语言。完全在浏览器中运行,任何文件都不会上传。
它做什么
本工具使用OCR(光学字符识别)将图片中的文字转换为可复制、编辑和搜索的文本。适用于截图、文档照片、扫描页面以及仅含图片的PDF。识别由开源OCR引擎Tesseract在您自己的浏览器中完成,文件始终不会离开您的设备。小字号文字会在识别前自动放大,可明显减少错误。
使用方法
- 选择一张或多张图片或一个PDF,拖到此处,或粘贴截图。
- 确认文字的语言。识别会自动开始;如果更改了语言,请再次点击“提取文字”。
- 检查结果,修正识别错误的地方,然后复制或下载为 .txt 文件。
常见问题
我的图片会被上传吗?
不会。识别引擎和语言数据会下载到您的浏览器中,图片和PDF都在本地处理。不会向服务器发送任何内容,因此可放心用于私密文件。
准确率如何?
对于清晰的印刷文字,拉丁字母语言的字符准确率通常超过99%,其他文字一般在93%到99%之间。照片模糊、对比度低、页面弯曲、装饰字体和手写体都会降低准确率。要获得最佳效果,请使用清晰、光线充足且端正的图片,并选择正确的语言。
支持哪些语言?
24种语言:英语、葡萄牙语、西班牙语、法语、德语、意大利语、瑞典语、南非荷兰语、土耳其语、印度尼西亚语、马来语、菲律宾语、越南语、俄语、阿拉伯语、乌尔都语、印地语、泰米尔语、泰语、高棉语、日语、韩语,以及简体中文和繁体中文。文字中混用两种语言时,可同时选择这两种语言。
能识别手写字吗?
效果较差。该引擎基于印刷文字训练:工整的大写印刷体字母有时可以识别,但连笔手写通常会识别错误。
支持扫描版PDF吗?
支持。每一页都会以高分辨率渲染并依次识别,还可以标记每页的起始位置。如果PDF中已有可选中的文字,使用“PDF转文本”工具会更快、更准确。
Wikipedia — Optical character recognition
Wikipedia — Tesseract (software)