Aller au contenu
PDFlora

Extraire le texte d'un PDF dans un fichier .txt

Récupérez chaque mot d'un PDF en texte brut, page par page. Choisissez de garder les espacements horizontaux et de marquer les changements de page. Le fichier est lu dans le navigateur, pas envoyé.

Dans votre navigateur
Chargement de l'outil…

Comment ça marche

  1. Étape 1: Choisissez ou déposez un PDF contenant du texte.

  2. Étape 2: Décidez de conserver la mise en page et d'ajouter ou non des séparateurs de page.

  3. Étape 3: Cliquez sur Extraire le texte.

  4. Étape 4: Téléchargez le fichier .txt, ou ouvrez-le et copiez ce dont vous avez besoin.

Ce que donne l'extraction de texte

La plupart des PDF issus de Word, d'un site web ou d'un rapport contiennent une couche de texte : les vrais caractères, placés sur chaque page. L'outil lit cette couche avec PDF.js et l'écrit dans l'ordre de lecture, page après page, dans un fichier .txt en UTF-8 que n'importe quel éditeur ouvre.

Deux options façonnent le résultat. Conserver la mise en page préserve les espacements horizontaux : colonnes et chiffres alignés restent en face les uns des autres dans une police à chasse fixe. Ajouter des séparateurs de page insère un repère net entre les pages. Sans elles, vous obtenez un texte continu, plus facile à coller ailleurs.

Pourquoi utiliser cet outil

Le format le plus léger et le plus universel

Le texte brut s'ouvre partout, ne pèse presque rien et se marie avec les outils de recherche, les scripts et les applications de notes.

La mise en page quand il le faut

Gardez les espacements pour des données en colonnes, ou supprimez-les pour des paragraphes propres à coller dans un e-mail.

Repères de page à la demande

Les séparateurs permettent de citer ou retrouver un passage par numéro de page une fois le texte sorti du PDF.

Confidentiel et immédiat

Le PDF est traité dans votre navigateur sans être envoyé, sans compte ni filigrane.

Usages courants

  • Chercher dans un tas de PDF

    Convertissez des notices ou des articles en texte et interrogez-les avec la recherche de votre ordinateur ou un outil en ligne de commande.

  • Alimenter un autre outil

    Collez un rapport dans un outil de traduction, de synthèse, un correcteur ou un script d'analyse, sans les sauts de ligne du PDF.

  • Compter les mots

    Vérifiez le nombre de mots d'un mémoire ou d'un article en l'extrayant et en ouvrant le texte dans votre éditeur.

  • Relire un fichier numérisé puis reconnu

    Après OCR PDF, extrayez le texte reconnu pour le corriger dans un éditeur de texte.

  • Archiver les mots d'un document

    Gardez une copie texte légère d'un document juridique ou universitaire à côté de l'original, consultable dans des années.

Conserver la mise en page ou non ?

Le bon choix dépend de ce que vous ferez du texte. Sans mise en page, les lignes d'un paragraphe sont rejointes pour que le texte coule et se colle proprement. Avec, l'espacement entre les mots est préservé, ce qui garde la forme de la page.

  • Sans mise en page : articles, lettres, contrats et tout ce que vous éditerez, traduirez ou donnerez à un autre programme.
  • Avec mise en page : tarifs, plannings, relevés et formulaires où l'alignement a du sens. Affichez le fichier en police à chasse fixe pour que les colonnes s'alignent.
  • Avec séparateurs de page : longs documents dont vous voulez pouvoir citer le numéro de page.

Formats pris en charge

Entrée
Fichiers PDF (.pdf) avec couche de texte, non protégés par mot de passe.
Sortie
Un fichier texte brut (.txt).

Les PDF numérisés n'ont pas de couche de texte : passez d'abord par OCR PDF.

Bon à savoir

  • Seule la couche de texte est lue. Images, graphiques et texte dessiné comme une image ne sont pas inclus.
  • Les PDF numérisés ou photographiés ne donnent presque rien tant que vous n'avez pas utilisé OCR PDF.
  • L'ordre de lecture suit la position sur la page : mises en page à plusieurs colonnes, encadrés et notes de bas de page peuvent s'entremêler.
  • Les tableaux deviennent des lignes de texte ; utilisez PDF en Excel pour obtenir lignes et colonnes.

Vos fichiers ne quittent jamais votre navigateur

Cet outil s'exécute entièrement sur votre appareil, dans votre navigateur. Vos fichiers ne sont pas envoyés à nos serveurs et ne sont stockés nulle part. Fermer l'onglet efface tout.

Questions fréquentes

Pourquoi le fichier texte est-il vide ou plein de trous ?

Le PDF est probablement numérisé : ses pages sont des images sans couche de texte. Lancez OCR PDF pour reconnaître le texte, puis extrayez-le à nouveau.

Le PDF est-il envoyé sur un serveur ?

Non. Le texte est lu dans votre navigateur et le fichier .txt y est créé : rien n'est envoyé.

À quoi sert l'option de conservation de la mise en page ?

Elle préserve les espacements horizontaux pour que colonnes et nombres alignés le restent. Sans elle, le texte s'écoule en paragraphes ordinaires, mieux adaptés au collage dans d'autres programmes.

Les images et les tableaux sont-ils inclus ?

Les images non, car ce n'est pas du texte. Les tableaux sortent en lignes de texte, sans bordures. Pour un tableur, utilisez PDF en Excel.

En quoi est-ce différent de PDF en Word ?

PDF en Word construit un document mis en forme, avec titres et paragraphes ; ici vous n'obtenez que les caractères bruts dans un .txt. Choisissez le texte quand vous voulez les mots sans aucune mise en forme.

Étape suivanteContinuer avec OCR PDFReconnaissez le texte de PDF numérisés et d'images pour obtenir un PDF consultable ou un .txt.