Изображение в текст (OCR)

Бесплатный OCR онлайн: извлекайте текст из изображений, скриншотов, фото и сканированных PDF на 24 языках. Работает в браузере, файлы никуда не загружаются.

Можно также перетащить файлы сюда или вставить скриншот через Ctrl+V (⌘+V на Mac). Текст распознаётся вашим браузером. Файлы никуда не отправляются: ни загрузки, ни хранения.
Каждый язык загружается один раз (от 1 до 3 МБ) и затем сохраняется в браузере. Добавьте английский как второй язык, если в тексте встречаются слова латиницей.

Что он делает


Этот инструмент использует OCR (оптическое распознавание символов), чтобы превратить текст на картинке в текст, который можно копировать, редактировать и искать. Он работает со скриншотами, фотографиями документов, отсканированными страницами и PDF, состоящими только из изображений. Распознавание выполняет Tesseract — OCR-движок с открытым исходным кодом, работающий прямо в вашем браузере, поэтому файлы никогда не покидают ваше устройство. Мелкий текст автоматически увеличивается перед чтением, что заметно сокращает количество ошибок.

Как пользоваться


  1. Выберите одно или несколько изображений или PDF, перетащите их сюда или вставьте скриншот.
  2. Проверьте язык текста. Чтение начинается автоматически; если вы смените язык, снова нажмите «Извлечь текст».
  3. Проверьте результат, исправьте неверно распознанное, затем скопируйте текст или скачайте его как файл .txt.

Частые вопросы


Загружаются ли мои изображения?
Нет. Движок распознавания и языковые данные загружаются в ваш браузер, и изображения и PDF обрабатываются там же. Ничего не отправляется на сервер, поэтому инструментом безопасно пользоваться и для личных документов.

Насколько точно распознавание?
На чётком печатном тексте для языков с латинским алфавитом обычно верно распознаётся более 99% символов, для других письменностей — как правило, от 93% до 99%. Точность снижается на размытых фото, при низком контрасте, изогнутых страницах, декоративных шрифтах и рукописном тексте. Для лучшего результата используйте чёткое, хорошо освещённое и ровное изображение и выберите правильный язык.

Какие языки поддерживаются?
24 языка: английский, португальский, испанский, французский, немецкий, итальянский, шведский, африкаанс, турецкий, индонезийский, малайский, филиппинский, вьетнамский, русский, арабский, урду, хинди, тамильский, тайский, кхмерский, японский, корейский, а также упрощённый и традиционный китайский. Можно сочетать два языка, если в тексте они смешаны.

Распознаёт ли он рукописный текст?
Плохо. Движок обучен на печатном тексте: аккуратные печатные заглавные буквы иногда распознаются, но слитный рукописный текст обычно выходит с ошибками.

Работает ли он со сканированными PDF?
Да. Каждая страница отрисовывается в высоком разрешении и читается по очереди, а начало каждой страницы можно отметить. Если PDF уже содержит текст, который можно выделить, инструмент «PDF в текст» работает быстрее и точнее.

Wikipedia — Optical character recognition
Wikipedia — Tesseract (software)