Mode d’emploi : Extraire le texte d’un PDF
- Choisissez le fichier PDF dont vous voulez récupérer le texte. L’extraction page par page commence immédiatement.
- Si vous ne voulez pas de séparateur du type « ----- 1 ----- » entre les pages, décochez la case. Le résultat est mis à jour aussitôt.
- Dans la zone de résultat, sélectionnez vous-même le passage voulu pour le copier, ou cliquez sur Tout copier.
- Cliquez sur Enregistrer en TXT pour obtenir un fichier texte UTF-8 que vous pourrez ouvrir dans le Bloc-notes, TextEdit ou tout autre éditeur.
Pourquoi le texte d’un PDF se copie mal
Quand vous sélectionnez du texte dans un lecteur PDF pour le copier, les retours à la ligne se retrouvent souvent au mauvais endroit, les phrases des deux colonnes d’un document mis en page sur deux colonnes se mélangent, ou des espaces bizarres apparaissent entre les lettres. La raison est simple : un PDF enregistre seulement « quel caractère dessiner à quel endroit », sans conserver la structure des phrases et des paragraphes.
Cet outil lit les coordonnées des fragments de texte contenus dans le PDF, regroupe sur une même ligne les fragments situés à la même hauteur et, lorsque l’interligne est plus grand que d’habitude, considère qu’un nouveau paragraphe commence et insère une ligne vide. Vous obtenez ainsi un texte bien plus lisible qu’avec un simple copier-coller depuis le lecteur.
Pourquoi le texte d’un PDF numérisé ne peut pas être extrait
Un PDF créé avec un scanner ou l’appareil photo d’un smartphone n’est qu’une image par page. Même si vous y voyez du texte, le fichier ne contient aucune information de caractères : l’extraction donne donc un résultat vide. Dans ce cas, il faut un logiciel d’OCR (reconnaissance optique de caractères) capable de lire le texte dans l’image ; cet outil ne propose pas d’OCR.
Pour savoir si votre document est un scan, essayez de sélectionner du texte dans votre lecteur PDF. Si vous ne pouvez pas sélectionner les mots un par un et que c’est toute la page qui se sélectionne comme un bloc, il s’agit d’un PDF composé d’images.
Conseils pour exploiter le texte extrait
- Pour citer un rapport, un mémoire ou un article scientifique, collez directement les phrases au lieu de les retaper.
- Si le texte extrait contient des retours à la ligne au milieu des phrases, utilisez l’outil Supprimer les sauts de ligne pour le remettre en paragraphes.
- Besoin de vérifier la longueur d’un texte ? Collez le résultat dans le compteur de caractères pour connaître le nombre de caractères et d’octets.
- Les tableaux sont extraits sous forme de lignes de texte, sans séparation des cellules. Si la structure du tableau compte, mieux vaut récupérer le document d’origine (Excel, Word, LibreOffice…).
- Le fichier TXT est encodé en UTF-8 : les accents (é, è, à, ç, œ…) s’affichent correctement dans les éditeurs de texte actuels.
Vos fichiers restent sur votre appareil
L’ouverture du PDF et l’extraction du texte se font entièrement dans votre navigateur. Le fichier n’est envoyé sur aucun serveur, ce qui permet de traiter sans crainte des documents confidentiels : contrats, relevés, dossiers administratifs ou travaux universitaires.