图片转文字(OCR)

免费在线OCR文字识别:从图片、截图、照片和扫描版PDF中提取文字,支持24种语言。完全在浏览器中运行,任何文件都不会上传。

也可以将文件拖到此处,或按 Ctrl+V(Mac 上为 ⌘+V)粘贴截图。 文字由您的浏览器识别。文件不会发送到任何地方:不上传,不存储。
每种语言只需下载一次(1 至 3 MB),之后会保存在浏览器中。如果文字中夹杂拉丁字母的单词,请添加英语作为第二语言。

它做什么


本工具使用OCR(光学字符识别)将图片中的文字转换为可复制、编辑和搜索的文本。适用于截图、文档照片、扫描页面以及仅含图片的PDF。识别由开源OCR引擎Tesseract在您自己的浏览器中完成,文件始终不会离开您的设备。小字号文字会在识别前自动放大,可明显减少错误。

使用方法


  1. 选择一张或多张图片或一个PDF,拖到此处,或粘贴截图。
  2. 确认文字的语言。识别会自动开始;如果更改了语言,请再次点击“提取文字”。
  3. 检查结果,修正识别错误的地方,然后复制或下载为 .txt 文件。

常见问题


我的图片会被上传吗?
不会。识别引擎和语言数据会下载到您的浏览器中,图片和PDF都在本地处理。不会向服务器发送任何内容,因此可放心用于私密文件。

准确率如何?
对于清晰的印刷文字,拉丁字母语言的字符准确率通常超过99%,其他文字一般在93%到99%之间。照片模糊、对比度低、页面弯曲、装饰字体和手写体都会降低准确率。要获得最佳效果,请使用清晰、光线充足且端正的图片,并选择正确的语言。

支持哪些语言?
24种语言:英语、葡萄牙语、西班牙语、法语、德语、意大利语、瑞典语、南非荷兰语、土耳其语、印度尼西亚语、马来语、菲律宾语、越南语、俄语、阿拉伯语、乌尔都语、印地语、泰米尔语、泰语、高棉语、日语、韩语,以及简体中文和繁体中文。文字中混用两种语言时,可同时选择这两种语言。

能识别手写字吗?
效果较差。该引擎基于印刷文字训练:工整的大写印刷体字母有时可以识别,但连笔手写通常会识别错误。

支持扫描版PDF吗?
支持。每一页都会以高分辨率渲染并依次识别,还可以标记每页的起始位置。如果PDF中已有可选中的文字,使用“PDF转文本”工具会更快、更准确。

Wikipedia — Optical character recognition
Wikipedia — Tesseract (software)