Aller au contenu
PDFlora

Comment rendre un PDF scanné consultable

Mis à jour le 23 septembre 2026

Un PDF scanné ressemble à du texte, mais c'est en réalité une pile d'images de pages : Ctrl+F ne trouve rien et vous ne pouvez pas copier une phrase. L'OCR lit ces images et ajoute par-dessus une couche de texte invisible, qui rend les mêmes pages consultables tout en gardant leur apparence. Ce guide montre comment vérifier si vous en avez besoin, comment le lancer dans votre navigateur et comment améliorer le résultat.

D'abord, vérifiez que le PDF a vraiment besoin d'OCR

Ouvrez le fichier, essayez de sélectionner un mot à la souris, puis appuyez sur Ctrl+F et cherchez un mot visible sur la page. Si le mot est surligné, le PDF possède déjà une couche de texte et n'a pas besoin d'OCR. Si rien ne peut être sélectionné ni trouvé, les pages sont des images.

Informations PDF donne un second avis : un document composé de scans n'indique en général aucune police et signale des images intégrées, alors qu'un PDF texte liste ses polices. Certains fichiers mélangent les deux, avec des pages de texte et des pages scannées, d'où l'option de l'outil OCR pour ignorer les pages qui contiennent déjà du texte.

Ce qu'est un PDF consultable

Un PDF consultable conserve l'image d'origine de la page et place derrière ou par-dessus une couche invisible de texte reconnu, alignée sur les mots. Vous voyez toujours le scan, avec ses tampons, signatures et annotations manuscrites, mais la recherche, la sélection et la copie fonctionnent grâce à cette couche.

Le texte n'est aussi bon que la reconnaissance. Un caractère mal lu est invisible à l'écran, mais il rend le mot introuvable : c'est pourquoi la qualité de la source compte autant.

Préparer le scan pour une meilleure reconnaissance

La plupart des erreurs d'OCR viennent de l'image, pas du logiciel. Quelques corrections avant de commencer font gagner beaucoup de temps ensuite.

  • Scannez à 300 DPI. En dessous d'environ 200 DPI, les petits caractères perdent le détail dont l'OCR a besoin.
  • Gardez les pages droites. Une page penchée produit des lignes de travers, plus difficiles à lire.
  • Soignez le contraste : texte sombre sur fond clair, sans ombre de reliure ni doigt dans le cadre.
  • Évitez la compression excessive et les photos de documents en très basse résolution.
  • Si vous êtes encore en train de capturer les pages, Scanner en PDF assemble le fichier à partir de vos photos dans le bon ordre.

Lancer OCR PDF dans votre navigateur

OCR PDF s'appuie sur Tesseract.js : les pages sont dessinées, reconnues et reconstruites sur votre appareil, sans envoi de vos documents. À la première utilisation, le moteur OCR et les données de langue sont téléchargés une seule fois depuis un CDN public, quelques Mo au total.

  • Ouvrez OCR PDF et ajoutez votre PDF scanné (les images JPG et PNG sont aussi acceptées).
  • Choisissez la langue du document. Vous pouvez en sélectionner plusieurs si une page mélange les langues, par exemple anglais et français.
  • Sélectionnez la résolution, 200 ou 300 DPI. Prenez 300 pour les petits caractères, 200 pour aller plus vite.
  • Gardez l'option qui ignore les pages contenant déjà du texte si le fichier est mixte.
  • Choisissez la sortie : PDF consultable, fichier texte brut, ou les deux, puis lancez.

Limites de langue et d'écriture

Les langues disponibles sont l'anglais, le français, l'espagnol, l'arabe, l'allemand, l'italien, le portugais, le néerlandais, le turc et le russe. Se tromper de langue est le moyen le plus rapide d'obtenir un mauvais résultat, car le moteur compare les formes à cet alphabet.

La couche de texte invisible du PDF consultable prend en charge les langues en écriture latine. Pour l'arabe et le russe, l'outil fournit le texte reconnu en téléchargement .txt, et la couche de PDF consultable n'est pas disponible pour ces écritures. L'écriture manuscrite n'est reconnue de façon fiable dans aucune langue.

Vitesse, poids et attentes réalistes

L'OCR est lent comparé à la plupart des opérations sur PDF. Comptez plusieurs secondes par page sur un ordinateur portable, davantage sur un téléphone : un livre de 200 pages peut donc prendre du temps. Gardez l'onglet ouvert pendant le traitement et testez d'abord quelques pages pour valider les réglages avant de traiter tout le document.

Comme l'image de la page est conservée, le résultat n'est pas plus léger. S'il est trop volumineux pour être envoyé, Compresser PDF peut le réduire ensuite ; vérifiez alors que la recherche fonctionne toujours après la compression.

Vérifier le résultat

Ouvrez le nouveau PDF, appuyez sur Ctrl+F et cherchez trois mots : un de la première page, un du milieu et un de la fin. Essayez aussi un mot accentué ou un nombre, car ce sont les caractères que l'OCR confond le plus, comme 0 et O ou 1 et l.

Si vous n'avez besoin que des mots et non de la mise en page, PDF en texte extrait la couche de texte dans un fichier .txt. Pour un document à modifier, lancez d'abord l'OCR puis PDF en Word, car la conversion Word n'a rien à lire sur une page scannée.

Questions fréquentes

Comment savoir si mon PDF est un scan ?

Essayez de sélectionner un mot à la souris ou de chercher avec Ctrl+F. Si rien ne peut être sélectionné ni trouvé, les pages sont des images et nécessitent l'OCR. Informations PDF indique aussi si le fichier liste des polices et des images intégrées.

L'OCR modifie-t-il l'apparence des pages ?

Non. Dans un PDF consultable, l'image d'origine de la page reste telle quelle et le texte reconnu est ajouté comme couche invisible. Les pages ont le même aspect, mais la recherche et la copie fonctionnent.

Pourquoi le résultat de l'OCR contient-il autant d'erreurs ?

Le plus souvent, c'est le scan : faible résolution, pages penchées, texte pâle ou mauvaise langue choisie. Rescannez à 300 DPI avec un bon contraste, choisissez la bonne langue et recommencez. L'écriture manuscrite n'est pas reconnue de façon fiable.

Mes documents sont-ils envoyés sur un serveur pour l'OCR ?

Non. OCR PDF s'exécute dans votre navigateur et les documents ne sont jamais envoyés. Seuls le moteur OCR et les fichiers de langue sont téléchargés une fois depuis un CDN public à la première utilisation de l'outil.

Outils cités dans ce guide

Autres guides