Transformer un PDF numérisé en texte consultable
Une numérisation n'est qu'une image de page : impossible d'y chercher ou d'en copier un mot. L'OCR lit l'image, et vous téléchargez un PDF consultable, un fichier texte, ou les deux.
- Les fichiers ne quittent jamais votre navigateur.
- Sans compte
- Aucun filigrane ajouté
- Fonctionne sur tout appareil
Comment ça marche
Étape 1: Choisissez ou déposez un PDF numérisé, ou une image JPG ou PNG.
Étape 2: Sélectionnez une ou plusieurs langues correspondant au texte, puis la sortie : PDF consultable, fichier texte ou les deux.
Étape 3: Indiquez si les pages qui contiennent déjà du texte doivent être ignorées, et choisissez 200 ou 300 DPI.
Étape 4: Cliquez sur OCR PDF, attendez le traitement de chaque page, puis téléchargez le résultat.
Ce que fait l'OCR sur un document numérisé
OCR signifie reconnaissance optique de caractères. Chaque page est dessinée sous forme d'image, le moteur de reconnaissance (Tesseract.js, exécuté en WebAssembly dans votre navigateur) lit les lettres, et le texte est enregistré avec la position de chaque mot sur la page. Pour un PDF consultable, ce texte est placé de façon invisible derrière l'image d'origine : la page semble inchangée, mais vous pouvez la rechercher, la sélectionner et en copier des passages.
Vous pouvez aussi télécharger le texte reconnu sous forme de fichier .txt, pratique pour le coller dans un éditeur ou le confier à un autre outil. Vous choisissez d'abord les langues, puis d'ignorer ou non les pages qui contiennent déjà du texte, et la résolution du rendu des pages (200 ou 300 DPI). Outre les PDF, l'outil accepte des images JPG et PNG en entrée.
Vos documents ne sont jamais envoyés. La seule chose récupérée sur le réseau est le moteur OCR et les données de langue, téléchargés depuis un CDN public (jsDelivr) la première fois que vous utilisez l'outil, pour quelques mégaoctets. Le CDN voit votre adresse IP et les en-têtes de requête habituels, mais pas vos documents.
Pourquoi utiliser cet outil
Documents non envoyés
La reconnaissance se fait dans votre navigateur. Seuls le moteur et les fichiers de langue sont téléchargés, une fois, depuis un CDN public ; vos pages ne quittent jamais votre appareil.
Consultable et sélectionnable
Pour les langues à alphabet latin, vous obtenez un PDF où Ctrl+F fonctionne et où l'on peut surligner et copier un paragraphe, tout en conservant l'aspect d'origine.
Dix langues, combinables
Anglais, français, espagnol, arabe, allemand, italien, portugais, néerlandais, turc et russe sont disponibles, et vous pouvez en cocher plusieurs pour des pages bilingues.
Ignore ce qui est déjà du texte
Dans un fichier mêlant scans et pages numériques, vous pouvez laisser de côté les pages qui contiennent déjà du texte, ce qui fait gagner du temps.
Usages courants
Chercher dans des archives de courriers anciens
Une association ou un petit cabinet possède des centaines de scans nommés seulement par date. Après OCR, vous cherchez un nom de famille dans tous les résultats au lieu d'ouvrir chaque fichier.
Copier un passage d'un chapitre de livre scanné
Une étudiante photographie un chapitre à la bibliothèque et a besoin d'une citation. L'OCR le transforme en texte à coller dans son devoir, à relire ensuite.
Extraire le texte d'un document en arabe ou en russe
Pour ces alphabets, l'outil fournit le texte reconnu en téléchargement .txt : un contrat ou un avis numérisé peut ainsi être repris dans un éditeur ou traduit.
Préparer un scan pour un autre outil
PDF en Word, PDF en Excel, PDF en texte et Comparer PDF lisent du texte et n'en trouvent pas dans un scan. Passez d'abord par OCR PDF pour leur donner de la matière.
Numériser tickets et factures
Un indépendant qui a photographié un ticket avec son téléphone utilise le JPG comme entrée et obtient du texte d'où copier montants et dates.
Pages numérisées ou pages déjà textuelles
Tous les PDF n'ont pas besoin d'OCR. Un fichier exporté depuis un traitement de texte contient déjà du vrai texte, et lui appliquer l'OCR ne ferait que rallonger le travail et introduire de petites erreurs. Un scan, lui, ne contient que des images. Test rapide : ouvrez le fichier et essayez de sélectionner un mot avec le curseur. Si rien ne se surligne, ou si Ctrl+F ne trouve rien, les pages sont des images.
Les fichiers mixtes sont courants, par exemple un contrat numérique avec quelques pages de signature scannées. L'option d'ignorer les pages qui contiennent déjà du texte s'en occupe : les pages numériques restent intactes et seules les pages scannées sont traitées. Ensuite, le PDF consultable fonctionne avec tous les outils de texte : vous pouvez enchaîner avec Compresser PDF, PDF en Word ou PDF en texte avec des résultats utiles.
- Testez d'abord : si vous pouvez sélectionner du texte, la page n'est pas un scan.
- Utilisez l'option d'exclusion pour les documents mixtes.
- Cherchez ensuite un mot distinctif pour vérifier le résultat.
Choisir les langues et comprendre les alphabets
Le moteur lit mieux quand il sait à quoi s'attendre : sélectionnez la langue du texte, pas seulement celle que vous parlez. Si une page mêle français et anglais, cochez les deux ; la reconnaissance est un peu plus longue mais elle cesse de prendre les accents d'une langue pour du bruit. Cocher beaucoup de langues inutiles ralentit le traitement et peut provoquer des erreurs de lecture ; choisissez uniquement celles qui figurent sur la page.
Une différence importante existe entre les écritures. Pour les langues à alphabet latin (anglais, français, espagnol, allemand, italien, portugais, néerlandais et turc), l'outil peut construire un PDF consultable dont la couche de texte invisible se trouve derrière l'image de la page. Pour l'arabe et le russe, qui utilisent d'autres alphabets, cette couche consultable n'est pas disponible dans cet outil. Il les reconnaît bien, mais livre le résultat sous forme de fichier .txt. Si vous avez besoin d'un PDF arabe consultable, cet outil ne le produira pas.
- Page bilingue : cochez les deux langues.
- Arabe ou russe : utilisez le téléchargement .txt.
- Chiffres, dates et noms latins dans une page arabe : relisez-les à l'œil.
Obtenir le résultat le plus fidèle
La qualité de l'image compte plus que n'importe quel réglage. L'entrée la plus fiable est une page numérisée à 300 DPI, bien à plat sur la vitre, sous une lumière uniforme, avec un texte sombre sur fond clair. Photos de travers, ombres, plis, encre pâle et très petits caractères font tous baisser la précision. Si vous photographiez une page avec un téléphone, tenez-le parallèle au papier, évitez votre propre ombre et remplissez le cadre avec la page.
Utilisez 300 DPI pour les petits caractères, les notes de bas de page et les pages denses, et 200 DPI quand le texte est gros et que vous voulez aller plus vite. Une résolution plus haute demande aussi plus de mémoire et de temps par page. Tableaux et mises en page à colonnes sont lus ligne par ligne, si bien que l'ordre du texte peut ne pas suivre la mise en page visuelle ; vérifiez ces zones à l'œil.
- Numérisez à 300 DPI ou plus si possible.
- Redressez et recadrez les pages penchées avant l'OCR.
- N'attendez pas une reconnaissance fiable de l'écriture manuscrite.
- Relisez noms, chiffres et dates en les comparant à la page d'origine.
Formats pris en charge
- Entrée
- Fichiers PDF (.pdf) et images (.jpg, .jpeg, .png).
- Sortie
- Un PDF consultable (image de la page plus texte invisible) et/ou un fichier texte .txt.
La couche de texte du PDF consultable couvre les langues à alphabet latin. Pour l'arabe et le russe, le texte reconnu est fourni en .txt.
Bon à savoir
- La couche de texte invisible du PDF consultable ne prend en charge que les langues à alphabet latin. Pour l'arabe et le russe, vous obtenez le texte reconnu dans un fichier .txt, pas un PDF consultable.
- La précision dépend de la numérisation : des pages à 300 DPI, droites, bien éclairées et contrastées donnent les meilleurs résultats. L'écriture manuscrite n'est pas reconnue de façon fiable.
- L'OCR est lent sur les gros documents : quelques secondes par page sur un ordinateur portable, davantage sur un téléphone.
- Le premier usage télécharge le moteur et les données de langue depuis un CDN public (jsDelivr) : une connexion internet est donc nécessaire à ce moment-là.
- La reconnaissance peut se tromper, surtout avec les petits caractères, les tableaux et les polices inhabituelles : relisez tout ce qui est important.
Vos fichiers ne quittent jamais votre navigateur
Cet outil s'exécute entièrement sur votre appareil, dans votre navigateur. Vos fichiers ne sont pas envoyés à nos serveurs et ne sont stockés nulle part. Fermer l'onglet efface tout.
Le moteur OCR et les données de langue sont téléchargés une seule fois depuis un CDN public lors de la première utilisation. Vos documents, eux, ne sont jamais envoyés.
Questions fréquentes
Mes documents sont-ils envoyés pour être reconnus ?
Non. La reconnaissance s'exécute dans votre navigateur et vos pages ne sont jamais envoyées. Le moteur OCR et les fichiers de langue sont téléchargés une fois depuis un CDN public (jsDelivr), qui voit votre adresse IP et les en-têtes de requête habituels, mais pas vos documents.
Quelles langues OCR PDF prend-il en charge ?
Anglais, français, espagnol, arabe, allemand, italien, portugais, néerlandais, turc et russe. Vous pouvez en choisir une ou plusieurs, par exemple quand une page mêle deux langues.
Puis-je obtenir un PDF consultable en arabe ?
Non. La couche de texte du PDF consultable fonctionne pour les langues à alphabet latin. Pour l'arabe et le russe, l'outil reconnaît le texte mais ne le fournit que sous forme de fichier .txt.
Combien de temps dure l'OCR ?
Comptez quelques secondes par page sur un ordinateur portable et davantage sur un téléphone : un long document peut prendre plusieurs minutes. La première utilisation inclut aussi le temps de téléchargement des données de langue.
Reconnaît-il l'écriture manuscrite ?
Pas de façon fiable. L'OCR donne de meilleurs résultats sur du texte imprimé ; l'écriture manuscrite ressort généralement avec beaucoup d'erreurs ou est ignorée.
Pourquoi le résultat est-il faux par endroits ?
Le plus souvent à cause de la qualité de l'image : faible résolution, inclinaison, ombres, encre pâle ou police inconnue du moteur. Renumérisez à 300 DPI, choisissez la bonne langue et réessayez.
Outils associés
Guides associés
- Comment rendre un PDF scanné consultableRendez un PDF scanné consultable grâce à l'OCR : comment savoir si votre fichier en a besoin, réglages de langue et de DPI, limites et vérification du résultat.
- Qu'est-ce que l'OCR et comment fonctionne-t-il ?L'OCR transforme une image de texte en texte réel et consultable. Son fonctionnement étape par étape, les facteurs de précision, ses limites et ses sorties.
- Comment scanner des documents en PDFTransformez du papier en PDF net avec un téléphone ou un scanner : éclairage, cadrage, ordre des pages, filtre document, poids du fichier et texte consultable.