Изображение в текст (OCR)
Бесплатный OCR онлайн: извлекайте текст из изображений, скриншотов, фото и сканированных PDF на 24 языках. Работает в браузере, файлы никуда не загружаются.
Что он делает
Этот инструмент использует OCR (оптическое распознавание символов), чтобы превратить текст на картинке в текст, который можно копировать, редактировать и искать. Он работает со скриншотами, фотографиями документов, отсканированными страницами и PDF, состоящими только из изображений. Распознавание выполняет Tesseract — OCR-движок с открытым исходным кодом, работающий прямо в вашем браузере, поэтому файлы никогда не покидают ваше устройство. Мелкий текст автоматически увеличивается перед чтением, что заметно сокращает количество ошибок.
Как пользоваться
- Выберите одно или несколько изображений или PDF, перетащите их сюда или вставьте скриншот.
- Проверьте язык текста. Чтение начинается автоматически; если вы смените язык, снова нажмите «Извлечь текст».
- Проверьте результат, исправьте неверно распознанное, затем скопируйте текст или скачайте его как файл .txt.
Частые вопросы
Загружаются ли мои изображения?
Нет. Движок распознавания и языковые данные загружаются в ваш браузер, и изображения и PDF обрабатываются там же. Ничего не отправляется на сервер, поэтому инструментом безопасно пользоваться и для личных документов.
Насколько точно распознавание?
На чётком печатном тексте для языков с латинским алфавитом обычно верно распознаётся более 99% символов, для других письменностей — как правило, от 93% до 99%. Точность снижается на размытых фото, при низком контрасте, изогнутых страницах, декоративных шрифтах и рукописном тексте. Для лучшего результата используйте чёткое, хорошо освещённое и ровное изображение и выберите правильный язык.
Какие языки поддерживаются?
24 языка: английский, португальский, испанский, французский, немецкий, итальянский, шведский, африкаанс, турецкий, индонезийский, малайский, филиппинский, вьетнамский, русский, арабский, урду, хинди, тамильский, тайский, кхмерский, японский, корейский, а также упрощённый и традиционный китайский. Можно сочетать два языка, если в тексте они смешаны.
Распознаёт ли он рукописный текст?
Плохо. Движок обучен на печатном тексте: аккуратные печатные заглавные буквы иногда распознаются, но слитный рукописный текст обычно выходит с ошибками.
Работает ли он со сканированными PDF?
Да. Каждая страница отрисовывается в высоком разрешении и читается по очереди, а начало каждой страницы можно отметить. Если PDF уже содержит текст, который можно выделить, инструмент «PDF в текст» работает быстрее и точнее.
Wikipedia — Optical character recognition
Wikipedia — Tesseract (software)