Imagem para Texto (OCR)
OCR online grátis: extraia texto de imagens, capturas de tela, fotos e PDFs digitalizados em 24 idiomas. Funciona no navegador e nada é enviado.
O que ela faz
Esta ferramenta usa OCR (reconhecimento óptico de caracteres) para transformar o texto de uma imagem em texto que você pode copiar, editar e pesquisar. Funciona com capturas de tela, fotos de documentos, páginas digitalizadas e PDFs que são só imagens. O reconhecimento é feito pelo Tesseract, um mecanismo de OCR de código aberto, rodando no seu próprio navegador, então os arquivos nunca saem do seu dispositivo. Textos pequenos são ampliados automaticamente antes da leitura, o que reduz bastante os erros.
Como usar
- Escolha uma ou mais imagens ou um PDF, arraste-os para cá ou cole uma captura de tela.
- Confira o idioma do texto. A leitura começa sozinha; se você mudar o idioma, clique em Extrair texto de novo.
- Revise o resultado, corrija o que foi lido errado e depois copie ou baixe como arquivo .txt.
Perguntas frequentes
Minhas imagens são enviadas?
Não. O mecanismo de reconhecimento e os dados do idioma são baixados para o seu navegador, e as imagens e PDFs são processados ali mesmo. Nada é enviado a um servidor, então é seguro usar com documentos privados.
Qual é a precisão?
Em texto impresso nítido, idiomas escritos no alfabeto latino costumam acertar mais de 99% dos caracteres, e outras escritas em geral entre 93% e 99%. A precisão cai com fotos borradas, pouco contraste, páginas curvas, fontes decorativas e letra manuscrita. Para o melhor resultado, use uma imagem nítida, bem iluminada e reta, e escolha o idioma certo.
Quais idiomas são suportados?
24 idiomas: inglês, português, espanhol, francês, alemão, italiano, sueco, africâner, turco, indonésio, malaio, filipino, vietnamita, russo, árabe, urdu, hindi, tâmil, tailandês, khmer, japonês, coreano e chinês simplificado e tradicional. Você pode combinar dois idiomas quando um texto mistura os dois.
Ele lê letra manuscrita?
Muito mal. O mecanismo é treinado com texto impresso: letras de forma bem feitas às vezes funcionam, mas a letra cursiva geralmente sai errada.
Funciona com PDFs digitalizados?
Sim. Cada página é renderizada em alta resolução e lida em sequência, e você pode marcar onde cada página começa. Se o PDF já contém texto que você consegue selecionar, a ferramenta PDF para Texto é mais rápida e exata.
Wikipedia — Optical character recognition
Wikipedia — Tesseract (software)