Extraire le texte d’un PDF (PDF → TXT)

Choisissez un PDF : l’outil extrait le texte page par page, dans l’ordre, et l’affiche aussitôt. Vous pouvez copier le résultat directement ou l’enregistrer dans un fichier TXT.

📄 Glissez-déposez un fichier PDF ou cliquez pour le choisir L’extraction du texte démarre dès que vous l’avez choisi

Mode d’emploi : Extraire le texte d’un PDF

  1. Choisissez le fichier PDF dont vous voulez récupérer le texte. L’extraction page par page commence immédiatement.
  2. Si vous ne voulez pas de séparateur du type « ----- 1 ----- » entre les pages, décochez la case. Le résultat est mis à jour aussitôt.
  3. Dans la zone de résultat, sélectionnez vous-même le passage voulu pour le copier, ou cliquez sur Tout copier.
  4. Cliquez sur Enregistrer en TXT pour obtenir un fichier texte UTF-8 que vous pourrez ouvrir dans le Bloc-notes, TextEdit ou tout autre éditeur.

Pourquoi le texte d’un PDF se copie mal

Quand vous sélectionnez du texte dans un lecteur PDF pour le copier, les retours à la ligne se retrouvent souvent au mauvais endroit, les phrases des deux colonnes d’un document mis en page sur deux colonnes se mélangent, ou des espaces bizarres apparaissent entre les lettres. La raison est simple : un PDF enregistre seulement « quel caractère dessiner à quel endroit », sans conserver la structure des phrases et des paragraphes.

Cet outil lit les coordonnées des fragments de texte contenus dans le PDF, regroupe sur une même ligne les fragments situés à la même hauteur et, lorsque l’interligne est plus grand que d’habitude, considère qu’un nouveau paragraphe commence et insère une ligne vide. Vous obtenez ainsi un texte bien plus lisible qu’avec un simple copier-coller depuis le lecteur.

Pourquoi le texte d’un PDF numérisé ne peut pas être extrait

Un PDF créé avec un scanner ou l’appareil photo d’un smartphone n’est qu’une image par page. Même si vous y voyez du texte, le fichier ne contient aucune information de caractères : l’extraction donne donc un résultat vide. Dans ce cas, il faut un logiciel d’OCR (reconnaissance optique de caractères) capable de lire le texte dans l’image ; cet outil ne propose pas d’OCR.

Pour savoir si votre document est un scan, essayez de sélectionner du texte dans votre lecteur PDF. Si vous ne pouvez pas sélectionner les mots un par un et que c’est toute la page qui se sélectionne comme un bloc, il s’agit d’un PDF composé d’images.

Conseils pour exploiter le texte extrait

  • Pour citer un rapport, un mémoire ou un article scientifique, collez directement les phrases au lieu de les retaper.
  • Si le texte extrait contient des retours à la ligne au milieu des phrases, utilisez l’outil Supprimer les sauts de ligne pour le remettre en paragraphes.
  • Besoin de vérifier la longueur d’un texte ? Collez le résultat dans le compteur de caractères pour connaître le nombre de caractères et d’octets.
  • Les tableaux sont extraits sous forme de lignes de texte, sans séparation des cellules. Si la structure du tableau compte, mieux vaut récupérer le document d’origine (Excel, Word, LibreOffice…).
  • Le fichier TXT est encodé en UTF-8 : les accents (é, è, à, ç, œ…) s’affichent correctement dans les éditeurs de texte actuels.

Vos fichiers restent sur votre appareil

L’ouverture du PDF et l’extraction du texte se font entièrement dans votre navigateur. Le fichier n’est envoyé sur aucun serveur, ce qui permet de traiter sans crainte des documents confidentiels : contrats, relevés, dossiers administratifs ou travaux universitaires.

Questions fréquentes

Le résultat de l’extraction est vide. Pourquoi ?
Un PDF numérisé ou créé à partir de photos ne contient pas d’informations de texte : rien ne peut être extrait. Dans ce cas, il faut utiliser un logiciel doté d’une fonction OCR.
Les accents ou certains caractères s’affichent mal. Que faire ?
Certains PDF enregistrent les polices d’une manière particulière : les codes de caractères stockés dans le fichier ne correspondent pas aux lettres affichées. Avec ce type de document, aucun outil d’extraction ne peut retrouver le texte exact.
Est-ce que ça fonctionne avec un PDF protégé par mot de passe ?
Un PDF protégé par un mot de passe d’ouverture ne peut pas être lu. Créez d’abord une copie sans mot de passe, puis utilisez-la.
Le texte extrait est-il conservé sur un serveur ?
Non. L’analyse du PDF et l’extraction du texte se font entièrement dans votre navigateur ; le fichier et le résultat ne sont envoyés nulle part.
Puis-je ouvrir le fichier TXT dans Word ?
Oui. Le fichier est un texte brut encodé en UTF-8 : il s’ouvre dans Word, LibreOffice, le Bloc-notes ou TextEdit. La mise en forme d’origine (polices, couleurs, tableaux) n’est toutefois pas conservée.

Dernière mise à jour : 2026-10-06