PDF en texte

Récupérez le vrai texte d'un PDF et enregistrez-le en simple fichier .txt — choisissez les pages, gardez la mise en page.

100 % privé — fonctionne entièrement dans votre navigateur. Vos données sont traitées sur votre appareil et ne sont jamais envoyées sur Internet.

Cliquez pour envoyer ou déposez un PDF ici

Un PDF — lu dans votre navigateur, jamais envoyé

À propos de l'extraction du texte d'un PDF

Un PDF issu d'un document contient déjà son texte. Les lettres sont dans le fichier ; le lecteur ne fait que les dessiner au bon endroit sur la page.

Les en sortir devrait être simple, et ça ne l'est généralement pas. Un « tout sélectionner » dans un lecteur vous donne les en-têtes, les pieds de page et les numéros de page mêlés au milieu des phrases. Copiez un tableau : il arrive sur une seule longue ligne. Copiez deux colonnes : elles s'entremêlent. Et sur un téléphone, on ne peut souvent rien sélectionner du tout.

Cet outil demande son texte directement au PDF et vous remet le résultat dans un champ que vous pouvez modifier, copier ou télécharger en .txt.

Il lit, il ne devine pas

Ce n'est pas de l'OCR. L'OCR regarde une image de page et tente de reconnaître les formes comme des lettres — utile, mais source d'erreurs, et le 1, le l et le I sont une histoire sans fin.

Ici, il n'y a rien à reconnaître. Les caractères sont déjà stockés dans le PDF et ressortent exactement comme ils y sont entrés. Pas de lettre mal lue, pas d'indice de confiance, pas d'attente : un rapport de 200 pages est traité en quelques secondes.

La seule chose qu'il ne sait pas faire, c'est lire un scan. Une page scannée est une photographie, sans aucun texte à l'intérieur. Dans ce cas, l'outil le dit clairement plutôt que de vous rendre un champ vide — et vous indique la voie de l'OCR.

Choisir les pages

Laissez le champ Pages vide pour prendre tout le document, ou indiquez ce que vous voulez :

  • 5 — seulement la page 5
  • 1-3 — les trois premières pages
  • 1-3, 5, 8-10 — mélange d'intervalles et de pages isolées

Utile quand ce qu'il vous faut est un chapitre d'un long rapport, ou quand les deux premières pages sont une couverture et un sommaire dont vous n'avez pas besoin.

Retours à la ligne : garder ou rassembler

Un PDF enregistre où chaque ligne a été dessinée, pas où une phrase se termine. Un paragraphe arrive donc en cinq lignes séparées, coupées uniquement parce que la page manquait de largeur.

  • Garder les lignes telles quelles — exactement comme la page était composée. Le bon choix pour les tableaux, les adresses, la poésie, le code, les listes, et tout ce où la ligne *est* le sens.
  • Rassembler les lignes en paragraphes — recolle une phrase coupée en une seule ligne. Le bon choix pour de la prose que vous allez coller dans un document, un e-mail ou un traducteur.

Le regroupement est prudent : une ligne qui termine une phrase, un titre, une puce et un élément numéroté gardent tous leur retour. Seule une ligne qui s'arrête clairement au milieu d'une phrase est jointe à la suivante.

Marques de page

Marquer le début de chaque page insère une ligne --- Page 7 --- entre les pages. Laissez-la active quand vous devez retrouver votre chemin dans l'original — citer un rapport, vérifier un contrat, référencer une source. Désactivez-la quand vous voulez un texte continu et propre à coller ailleurs.

Rien ne quitte votre appareil

Le PDF est ouvert et lu dans votre navigateur. Il n'est pas envoyé, pas mis en file d'attente et pas conservé. Cela compte pour les documents dont les gens ont réellement besoin ici : contrats, relevés, courriers médicaux, pièces juridiques, tout ce qui est couvert par un accord de confidentialité.

Cela signifie aussi qu'il n'y a pas de limite de taille due à un envoi, et que cela fonctionne hors ligne une fois la page chargée.

À quoi cela sert

  • Récupérer une citation dans un rapport sans la retaper
  • Passer un document dans un traducteur, un résumé ou une recherche
  • Transformer un manuel ou une politique en texte brut pour chercher avec Ctrl+F
  • Extraire la prose d'un livre ou d'un article pour la modifier ou l'étudier
  • Amener du texte dans un traitement de texte quand le copier-coller depuis le lecteur arrive déformé
  • Extraire du contenu pour un site depuis une brochure PDF
  • Rendre un document lisible par un lecteur d'écran qui peine sur le PDF

Bon à savoir

  • Un PDF protégé par mot de passe doit d'abord être déverrouillé — utilisez Déverrouiller un PDF
  • Un PDF qui est un scan n'a pas de texte ; utilisez PDF en JPG puis Image en texte
  • Les colonnes, tableaux et notes de bas de page sortent dans l'ordre où le PDF les stocke, qui est en général — mais pas toujours — l'ordre de lecture. Vérifiez le résultat
  • Le champ de texte est modifiable, vous pouvez donc nettoyer le résultat avant de le télécharger
  • Le téléchargement est un simple fichier .txt en UTF-8 : les accents et les caractères non latins survivent
  • La mise en forme — gras, taille, couleur, images — n'est pas conservée. Le texte brut, c'est le but. Pour un document mis en forme, utilisez PDF en Word

Comment l'utiliser

  • Cliquez sur Cliquez pour envoyer, ou faites glisser votre PDF sur la zone
  • Laissez Pages vide pour tout le document, ou tapez les pages voulues
  • Choisissez Garder les lignes telles quelles pour les tableaux et les listes, ou Rassembler les lignes en paragraphes pour la prose
  • Cochez ou décochez Marquer le début de chaque page
  • Appuyez sur Extraire le texte, relisez le résultat, puis Copier ou Télécharger le .txt

Outils liés

Nous ajoutons régulièrement de nouveaux outils — abonnez-vous sur YouTube pour être averti à chaque nouveauté.

Plus d’outils

Tout voir

Applications recommandées

Tout voir