Cliquez pour envoyer ou déposez un PDF scanné ici
Un PDF — lu par OCR sur votre appareil, jamais envoyéÀ propos de l'OCR pour les PDF
Certains PDF ne contiennent aucun texte. Un contrat scanné, un ticket de caisse photographié, un fax, un vieux livre passé au scanner d'une bibliothèque — chaque page n'est qu'une image de texte. Vous pouvez la lire, mais pas la sélectionner, la copier ni y faire une recherche.
L'OCR (reconnaissance optique de caractères) règle ce problème. Elle regarde l'image de chaque page, reconnaît la forme des lettres et vous rend du vrai texte, que vous pouvez copier, modifier et chercher.
Cet outil travaille page par page et affiche le texte dès qu'une page est terminée. Inutile d'attendre la fin du document pour commencer.
Tout se passe sur votre appareil
Les PDF scannés sont souvent les plus privés : une pièce d'identité, un courrier de la banque, un formulaire médical, un contrat signé. La plupart des services d'OCR en ligne vous demandent de les envoyer.
Pas celui-ci. Le moteur OCR (Tesseract, le moteur open source utilisé par de nombreux outils professionnels) tourne dans votre navigateur :
- Privé — le PDF ne quitte jamais votre appareil
- Sans inscription, sans limite de pages, sans filigrane
Au premier lancement, le moteur et les données de langue sont téléchargés — quelques mégaoctets. Votre navigateur les garde, donc la fois suivante démarre plus vite.
Pages de texte et pages scannées dans un même fichier
Beaucoup de PDF sont mixtes. Des pages tapées avec une page de signature scannée à la fin. Un scan qui a déjà été passé à l'OCR. Un rapport avec quelques pages photographiées au milieu.
Par défaut, l'outil vérifie d'abord chaque page :
- Une page qui a déjà du vrai texte est copiée telle quelle — exacte, instantanée, sans erreur d'OCR
- Une page qui n'est qu'une image est lue par OCR
À la fin, vous voyez combien de pages ont pris chaque chemin. Décochez « Pages qui ont déjà du vrai texte » pour forcer l'OCR sur toutes les pages — utile quand l'ancienne couche de texte est fausse ou illisible.
Obtenir le meilleur résultat
L'OCR est très performante, mais elle lit une image, donc l'image compte :
- Choisissez la bonne langue. Elle détermine les lettres et les accents que le moteur attend. Un texte français lu comme de l'anglais perd ses é et ses ç.
- Les pages droites et nettes se lisent le mieux. Une photo de téléphone de travers ou un fax flou donne plus d'erreurs.
- Le texte imprimé normal se lit bien. L'écriture manuscrite, les très petits caractères et les polices décoratives se lisent mal.
- Les tableaux sortent en lignes de texte, pas en tableau. Pour un tableau, vérifiez les colonnes ensuite.
- Relisez toujours le résultat avant de vous y fier. Attention à 1 / l / I, 0 / O et rn / m — les confusions classiques de l'OCR.
À quoi cela sert
- Copier un paragraphe d'un contrat scanné ou d'un courrier
- Récupérer le texte d'un vieux livre ou article qui n'existe qu'en scan
- Rendre un ticket ou une facture scanné(e) consultable dans vos notes
- Extraire des citations d'articles de recherche scannés et de polycopiés
- Saisir des formulaires et des dossiers sans tout retaper à la main
- Transformer un document faxé en texte modifiable
Bon à savoir
- Un PDF protégé par mot de passe doit d'abord être déverrouillé — utilisez Déverrouiller un PDF
- Les gros documents prennent du temps : environ 2 à 10 secondes par page sur un ordinateur, plus sur un téléphone. Utilisez Pages pour ne lire que la partie utile
- Arrêter garde toutes les pages déjà lues
- Le résultat est du texte brut. Pour l'avoir dans Word, collez-le, ou utilisez PDF en Word pour les PDF qui ont déjà du texte
- Si votre PDF a du vrai texte sur chaque page, PDF en texte est plus rapide et offre plus d'options de mise en page
Questions fréquentes
Est-ce gratuit ?
Oui. Sans inscription, sans limite de pages, sans filigrane.
Mon PDF est-il envoyé ?
Non. Les pages sont dessinées et lues dans cette page, sur votre propre appareil.
Quelles langues lit-il ?
Anglais, espagnol, français, allemand, italien, portugais, néerlandais, chinois (simplifié), japonais et coréen. Choisissez-en une avant de commencer.
Pourquoi y a-t-il des erreurs dans le texte ?
L'OCR devine chaque lettre d'après sa forme. Un scan flou, de travers ou en basse résolution la fait se tromper plus souvent. Vérifiez le résultat et corrigez les quelques erreurs dans la zone avant de le copier.
Peut-il rendre mon PDF consultable ?
Pas encore — il vous donne le texte dans un fichier .txt séparé. Votre PDF d'origine n'est pas modifié.
Comment l'utiliser
- Cliquez sur Cliquez pour envoyer, ou faites glisser votre PDF scanné sur la zone
- Choisissez la langue du texte
- Tapez une plage de pages si vous n'avez besoin que de certaines pages — ou laissez vide pour tout lire
- Cliquez sur Lire le texte et regardez les pages arriver
- Vérifiez le texte, puis cliquez sur Copier ou Télécharger le .txt
Outils liés
- PDF en texte — pour les PDF qui contiennent déjà du vrai texte
- Image en texte — la même OCR pour une photo ou une capture d'écran
- PDF en Word — transformer un PDF texte en document modifiable
- PDF en JPG — enregistrer les pages scannées en images
- Compresser un PDF — alléger un scan trop lourd
- Déverrouiller un PDF — retirer un mot de passe avant la lecture