Imagem para Texto (OCR)
OCR online gratuito: extraia texto de imagens, capturas de ecrã, fotografias e PDFs digitalizados em 24 idiomas. Funciona no navegador e nada é enviado.
O que faz
Esta ferramenta usa OCR (reconhecimento ótico de caracteres) para transformar o texto de uma imagem em texto que pode copiar, editar e pesquisar. Funciona com capturas de ecrã, fotografias de documentos, páginas digitalizadas e PDFs que são apenas imagens. O reconhecimento é feito pelo Tesseract, um motor de OCR de código aberto, a correr no próprio navegador, pelo que os ficheiros nunca saem do dispositivo. O texto pequeno é ampliado automaticamente antes da leitura, o que reduz bastante os erros.
Como utilizar
- Escolha uma ou mais imagens ou um PDF, arraste-os para aqui ou cole uma captura de ecrã.
- Verifique o idioma do texto. A leitura começa sozinha; se mudar o idioma, carregue novamente em Extrair texto.
- Reveja o resultado, corrija o que tiver sido mal lido e depois copie-o ou transfira-o como ficheiro .txt.
Perguntas frequentes
As minhas imagens são enviadas?
Não. O motor de reconhecimento e os dados do idioma são transferidos para o navegador, e as imagens e os PDFs são processados aí. Nada é enviado para um servidor, pelo que é seguro usá-lo com documentos privados.
Qual é a precisão?
Em texto impresso nítido, os idiomas escritos no alfabeto latino acertam normalmente em mais de 99% dos caracteres, e as outras escritas tipicamente entre 93% e 99%. A precisão baixa com fotografias desfocadas, pouco contraste, páginas curvas, tipos de letra decorativos e escrita à mão. Para o melhor resultado, use uma imagem nítida, bem iluminada e direita, e escolha o idioma certo.
Que idiomas são suportados?
24 idiomas: inglês, português, espanhol, francês, alemão, italiano, sueco, africânder, turco, indonésio, malaio, filipino, vietnamita, russo, árabe, urdu, hindi, tâmil, tailandês, khmer, japonês, coreano e chinês simplificado e tradicional. Pode combinar dois idiomas quando um texto os mistura.
Consegue ler escrita à mão?
Só com dificuldade. O motor foi treinado com texto impresso: maiúsculas de imprensa bem desenhadas funcionam por vezes, mas a letra corrida costuma sair errada.
Funciona com PDFs digitalizados?
Sim. Cada página é renderizada em alta resolução e lida à vez, e pode marcar onde começa cada página. Se o PDF já contiver texto que possa ser selecionado, a ferramenta PDF para Texto é mais rápida e exata.
Wikipedia — Optical character recognition
Wikipedia — Tesseract (software)