PDF en texte

Extrayez le texte d'un PDF en ligne : copiez-le ou téléchargez-le en .txt, page par page, lignes et paragraphes conservés. Gratuit, privé, rien n'est envoyé.

Le fichier est lu par votre navigateur et n'est envoyé nulle part. Aucun envoi, aucun stockage.

Ce qu'elle fait


Cet outil lit le texte d'un PDF et vous le rend en texte brut, que vous pouvez copier, modifier ou enregistrer en fichier .txt. Les lignes et les paragraphes sont reconstruits d'après la position des mots sur la page, et les pages peuvent être marquées pour savoir où chacune commence. Il fonctionne avec tout PDF contenant du vrai texte, comme les documents exportés d'un traitement de texte ; les pages numérisées sont des images et n'ont pas de texte à extraire.

Comment l'utiliser


  1. Choisissez le PDF.
  2. Cliquez sur Extraire le texte. Les longs documents prennent quelques secondes.
  3. Copiez le texte ou téléchargez-le en fichier .txt.

Questions fréquentes


Pourquoi aucun texte n'est trouvé dans mon PDF ?
Parce que les pages sont des images, comme dans un document numérisé ou une photo enregistrée en PDF. Dans ce cas, le PDF ne contient pas de texte, seulement des pixels, et sa lecture nécessite la reconnaissance de caractères (OCR).

La mise en page est-elle conservée ?
Le texte garde ses lignes et ses paragraphes, mais pas les polices, les colonnes ni les images. Dans les documents à deux colonnes, le texte de chaque ligne peut mélanger les deux colonnes ; les tableaux deviennent des lignes de texte avec des espaces entre les cellules.

Mon document est-il en sécurité ?
Oui. Le PDF est lu par votre navigateur et n'est jamais envoyé à un serveur : l'outil peut donc être utilisé avec des documents privés.

Cela fonctionne-t-il avec toutes les langues ?
Oui, tant que le PDF contient du vrai texte et que ses polices associent correctement les caractères. Certains PDF anciens ou mal conçus affichent un texte correct à l'écran mais donnent des caractères illisibles à l'extraction ; c'est un défaut du fichier, et seul l'OCR peut le récupérer.

Wikipedia — PDF
Wikipedia — Optical character recognition