Aller au contenu
PDFlora

Qu'est-ce que l'OCR et comment fonctionne-t-il ?

Mis à jour le 23 septembre 2026

L'OCR, pour reconnaissance optique de caractères, est un logiciel qui lit les lettres d'une image et les transforme en texte que l'ordinateur peut rechercher, copier et modifier. C'est lui qui rend un contrat scanné consultable ou vous permet d'extraire un paragraphe d'une page photographiée. Ce guide explique le processus, ce qui détermine la précision et les cas où l'OCR échoue encore.

Le problème que résout l'OCR

Pour un ordinateur, une page scannée est une grille de points colorés. Il ne sait pas qu'un groupe de pixels sombres est la lettre e : il n'y a donc rien à rechercher, sélectionner ou copier. C'est pareil pour la photo d'un ticket prise au téléphone, une capture d'écran ou un PDF fabriqué à partir de scans.

L'OCR comble ce vide. Il examine les pixels, décide quels caractères ils forment et renvoie du vrai texte. Une fois le texte disponible, tout ce qu'on attend d'un document numérique devient possible : recherche, copie, traduction, indexation et conversion en Word ou en texte brut.

Le fonctionnement de l'OCR, étape par étape

Les moteurs d'OCR actuels suivent un enchaînement comparable. Les méthodes exactes varient d'un moteur à l'autre, mais les étapes sont reconnaissables.

  • Préparation : l'image est convertie en noir et blanc ou en niveaux de gris, débarrassée des taches et parfois redressée si la page est légèrement penchée.
  • Analyse de la mise en page : le moteur repère les blocs de texte, les lignes et les mots, et détermine l'ordre de lecture.
  • Reconnaissance : chaque ligne est comparée à ce que le moteur a appris des formes de la langue choisie. Tesseract, le moteur libre utilisé par notre outil d'OCR, emploie un réseau de neurones pour cette étape.
  • Vérification linguistique : les mots candidats sont confrontés à la connaissance de la langue, ce qui aide à départager des formes proches.
  • Sortie : le texte reconnu est restitué, soit sous forme de fichier texte, soit comme couche cachée alignée sur l'image d'origine.

Ce qui détermine la précision

L'image compte plus que tout. Un scan net à 300 DPI, bien droit, avec un texte sombre sur fond clair, peut être très bien reconnu. Les photos floues, les ombres, la faible résolution, l'encre pâle, les fonds colorés et les motifs chargés derrière le texte réduisent la précision.

Le deuxième facteur est le réglage de langue : le moteur doit savoir quel alphabet attendre. Choisir l'anglais pour un document français, par exemple, donne des lettres accentuées fausses ou manquantes. Le troisième facteur est la police : les caractères imprimés nets sont faciles, les polices décoratives et les très petits corps sont plus difficiles.

Erreurs typiques et leur aspect

L'OCR échoue rarement complètement ; il commet de petites erreurs prévisibles. Le chiffre 0 et la lettre O, le chiffre 1, le l minuscule et le I majuscule, ou le couple rn lu comme m sont les classiques. Les traces parasites sur le papier deviennent une ponctuation étrange.

C'est pourquoi les nombres, les codes et les noms méritent un second regard, en particulier dans les factures, les contrats et les numéros d'identification. Quand un seul chiffre faux peut avoir des conséquences, comparez le texte à l'image d'origine au lieu de lui faire une confiance aveugle.

Écriture manuscrite, tableaux et écritures

L'OCR donne ses meilleurs résultats sur du texte imprimé. L'écriture manuscrite n'est pas reconnue de façon fiable, et la cursive est bien plus difficile que des majuscules soignées. Les tableaux, colonnes et formulaires peuvent aussi perturber l'ordre de lecture, car le moteur voit des blocs de texte plutôt que la logique du tableau.

Les écritures comptent également. L'arabe, écrit de droite à gauche avec des lettres liées, est plus difficile que le texte latin. Dans notre outil OCR PDF, l'arabe et le russe sont reconnus, mais le résultat est fourni en fichier .txt et non comme couche de PDF consultable. Pour les langues en écriture latine, l'outil peut aussi produire un PDF consultable.

Ce que produit l'OCR

Il existe deux sorties courantes. Le texte brut est simplement l'ensemble des mots reconnus dans un fichier .txt, utile pour réutiliser le contenu. Le PDF consultable conserve l'image d'origine de la page et ajoute une couche de texte invisible : le document paraît inchangé mais on peut le rechercher et le copier.

OCR PDF peut produire l'une ou l'autre, ou les deux, en anglais, français, espagnol, arabe, allemand, italien, portugais, néerlandais, turc et russe. Il s'exécute dans votre navigateur avec Tesseract.js, sans envoi de vos documents. Le moteur d'OCR et les données de langue sont téléchargés une fois depuis un CDN public à la première utilisation, et la reconnaissance prend quelques secondes par page.

L'OCR comparé aux outils voisins

L'OCR n'est nécessaire que si la page ne contient pas de texte. Si votre PDF a été exporté depuis Word ou un autre logiciel, il contient déjà du texte, et PDF en texte ou PDF en Word peuvent le lire directement. Lancer l'OCR sur un tel fichier ne fait qu'ajouter du travail : c'est pourquoi OCR PDF peut ignorer les pages qui ont déjà du texte.

Voyez l'OCR comme la première étape pour les fichiers scannés. Reconnaissez les pages, puis choisissez le format dont vous avez vraiment besoin : un PDF consultable pour l'archivage, un fichier texte pour la réutilisation ou un document Word modifiable pour les changements.

Questions fréquentes

Que signifie OCR ?

OCR signifie reconnaissance optique de caractères. C'est la technologie qui convertit des images de texte imprimé ou tapé en texte lisible par une machine, que l'on peut rechercher, copier et modifier.

L'OCR est-il fiable à 100 % ?

Non. La précision dépend de la qualité du scan, du réglage de langue et de la police. Les pages imprimées nettes et droites sont très bien reconnues, alors que les images floues, les petits caractères et l'écriture manuscrite produisent des erreurs : vérifiez les nombres et les noms importants.

L'OCR peut-il lire l'écriture manuscrite ?

Pas de façon fiable. Le texte imprimé fonctionne bien, mais l'écriture manuscrite varie tellement d'une personne à l'autre que les résultats sont souvent mauvais, surtout pour la cursive. Les majuscules d'imprimerie soignées s'en sortent mieux que l'écriture liée.

L'OCR envoie-t-il mon document sur un serveur ?

Pas avec OCR PDF. La reconnaissance s'exécute dans votre navigateur grâce à WebAssembly : les documents ne sont jamais envoyés. Seuls le moteur d'OCR et les fichiers de langue sont récupérés une fois depuis un CDN public.

Outils cités dans ce guide

Autres guides