Imagem para Texto (OCR)

OCR online gratuito: extraia texto de imagens, capturas de ecrã, fotografias e PDFs digitalizados em 24 idiomas. Funciona no navegador e nada é enviado.

Também pode arrastar ficheiros para aqui ou colar uma captura de ecrã com Ctrl+V (⌘+V num Mac). O texto é reconhecido pelo navegador. Os ficheiros não são enviados para lado nenhum: sem carregamento, sem armazenamento.
Cada idioma é transferido uma vez (1 a 3 MB) e fica depois guardado no navegador. Adicione o inglês como segundo idioma quando o texto tiver palavras no alfabeto latino pelo meio.

O que faz


Esta ferramenta usa OCR (reconhecimento ótico de caracteres) para transformar o texto de uma imagem em texto que pode copiar, editar e pesquisar. Funciona com capturas de ecrã, fotografias de documentos, páginas digitalizadas e PDFs que são apenas imagens. O reconhecimento é feito pelo Tesseract, um motor de OCR de código aberto, a correr no próprio navegador, pelo que os ficheiros nunca saem do dispositivo. O texto pequeno é ampliado automaticamente antes da leitura, o que reduz bastante os erros.

Como utilizar


  1. Escolha uma ou mais imagens ou um PDF, arraste-os para aqui ou cole uma captura de ecrã.
  2. Verifique o idioma do texto. A leitura começa sozinha; se mudar o idioma, carregue novamente em Extrair texto.
  3. Reveja o resultado, corrija o que tiver sido mal lido e depois copie-o ou transfira-o como ficheiro .txt.

Perguntas frequentes


As minhas imagens são enviadas?
Não. O motor de reconhecimento e os dados do idioma são transferidos para o navegador, e as imagens e os PDFs são processados aí. Nada é enviado para um servidor, pelo que é seguro usá-lo com documentos privados.

Qual é a precisão?
Em texto impresso nítido, os idiomas escritos no alfabeto latino acertam normalmente em mais de 99% dos caracteres, e as outras escritas tipicamente entre 93% e 99%. A precisão baixa com fotografias desfocadas, pouco contraste, páginas curvas, tipos de letra decorativos e escrita à mão. Para o melhor resultado, use uma imagem nítida, bem iluminada e direita, e escolha o idioma certo.

Que idiomas são suportados?
24 idiomas: inglês, português, espanhol, francês, alemão, italiano, sueco, africânder, turco, indonésio, malaio, filipino, vietnamita, russo, árabe, urdu, hindi, tâmil, tailandês, khmer, japonês, coreano e chinês simplificado e tradicional. Pode combinar dois idiomas quando um texto os mistura.

Consegue ler escrita à mão?
Só com dificuldade. O motor foi treinado com texto impresso: maiúsculas de imprensa bem desenhadas funcionam por vezes, mas a letra corrida costuma sair errada.

Funciona com PDFs digitalizados?
Sim. Cada página é renderizada em alta resolução e lida à vez, e pode marcar onde começa cada página. Se o PDF já contiver texto que possa ser selecionado, a ferramenta PDF para Texto é mais rápida e exata.

Wikipedia — Optical character recognition
Wikipedia — Tesseract (software)