PDF en texte

Extrayez la couche de texte d'un PDF dans un fichier .txt. Les PDF scannés (image seule) ne donnent aucun texte.

Cet outil n'envoie pas vos fichiers. Fermez l'onglet et il ne reste rien.

Glissez-déposez vos fichiers ici, ou

Choisir des fichiers

Formats pris en charge: PDF · ou collez avec Ctrl+V

Le texte seul, sans la mise en page

Certaines tâches se passent très bien de la mise en forme : coller un article de règlement dans un courriel, compter les mots d'un rapport, chercher un terme dans vingt documents ou alimenter un tableur. Le PDF contient ce qu'il faut, mais le copier page après page est long et ramène des retours à la ligne parasites.

L'extraction renvoie un fichier .txt encodé en UTF-8 : accents, cédilles et caractères spéciaux sont conservés. L'ordre de lecture dépend de la façon dont le PDF a été produit ; sur un document à deux colonnes ou avec des notes en marge, les lignes peuvent s'entremêler et méritent une relecture. Tableaux, gras et sauts de page ne survivent pas, le texte brut ne les prévoyant pas.

Sur un PDF scanné, le fichier obtenu sera vide : il n'y a pas de caractères, seulement l'image de caractères. Ce cas relève de l'outil d'OCR, qui reconnaît les lettres et restitue alors du texte. Tout s'exécute dans le navigateur, sans téléversement ni copie conservée.

Mode d'emploi

  1. 1

    Sélectionnez un PDF.

  2. 2

    Définissez éventuellement une plage de pages.

  3. 3

    Cliquez sur Lancer et téléchargez le résultat.

Questions fréquentes

Le résultat est vide.
Les PDF scannés n'ont pas de couche de texte. Utilisez l'outil de conversion IA pour ceux-là.
Les sauts de ligne sont bizarres.
Les PDF ne stockent pas la structure des lignes ; elle est déduite des positions. Les mises en page multicolonnes peuvent se mélanger.

Outils associés