Image en texte (OCR)
OCR en ligne gratuit : extrayez le texte d'images, captures d'écran, photos et PDF numérisés en 24 langues. Tout se fait dans le navigateur, sans envoi.
Ce qu'elle fait
Cet outil utilise l'OCR (reconnaissance optique de caractères) pour transformer le texte d'une image en texte que vous pouvez copier, modifier et rechercher. Il fonctionne avec les captures d'écran, les photos de documents, les pages numérisées et les PDF qui ne sont que des images. La reconnaissance est assurée par Tesseract, un moteur d'OCR open source qui s'exécute dans votre propre navigateur : les fichiers ne quittent donc jamais votre appareil. Les petits textes sont agrandis automatiquement avant la lecture, ce qui réduit nettement les erreurs.
Comment l'utiliser
- Choisissez une ou plusieurs images ou un PDF, glissez-les ici, ou collez une capture d'écran.
- Vérifiez la langue du texte. La lecture démarre d'elle-même ; si vous changez de langue, cliquez à nouveau sur Extraire le texte.
- Relisez le résultat, corrigez ce qui a été mal lu, puis copiez-le ou téléchargez-le en fichier .txt.
Questions fréquentes
Mes images sont-elles envoyées ?
Non. Le moteur de reconnaissance et les données de langue sont téléchargés dans votre navigateur, et les images et PDF y sont traités. Rien n'est envoyé à un serveur : vous pouvez donc l'utiliser en toute sécurité avec des documents privés.
Quelle est sa précision ?
Sur un texte imprimé net, les langues en alphabet latin dépassent généralement 99 % de caractères justes, et les autres écritures se situent en général entre 93 % et 99 %. La précision baisse avec les photos floues, un faible contraste, les pages courbées, les polices décoratives et l'écriture manuscrite. Pour un meilleur résultat, utilisez une image nette, bien éclairée et droite, et choisissez la bonne langue.
Quelles langues sont prises en charge ?
24 langues : anglais, portugais, espagnol, français, allemand, italien, suédois, afrikaans, turc, indonésien, malais, filipino, vietnamien, russe, arabe, ourdou, hindi, tamoul, thaï, khmer, japonais, coréen, et chinois simplifié et traditionnel. Vous pouvez combiner deux langues quand un texte les mélange.
Peut-il lire l'écriture manuscrite ?
Mal. Le moteur est entraîné sur du texte imprimé : des capitales d'imprimerie soignées fonctionnent parfois, mais l'écriture cursive ressort généralement fausse.
Fonctionne-t-il avec les PDF numérisés ?
Oui. Chaque page est rendue en haute résolution puis lue à son tour, et vous pouvez marquer le début de chaque page. Si le PDF contient déjà du texte sélectionnable, l'outil PDF en texte est plus rapide et exact.
Wikipedia — Optical character recognition
Wikipedia — Tesseract (software)