PDF numérisé en texte

Cet outil convertit les PDF scannés en texte modifiable afin que vous puissiez facilement copier, modifier et ajouter du contenu.

Téléversez votre fichier

ou déposez, collez ou choisissez depuis le cloud

Coller l'URL Essayer un exemple
Google Drive Dropbox OneDrive
100 % gratuit Aucune installation requise Sécurisé et privé
Publicité
Ils nous font confiance
eBay Booking.com University of Michigan Cornell University Columbia University
Noter cet outil
0/5 · 0 votes

Quand un PDF scanné a besoin d'OCR, et quand ce n'est pas le cas

Transformer un PDF scanné en texte correspond en réalité à deux tâches différentes, et le convertisseur vous laisse choisir laquelle exécuter. Un PDF qui contient déjà de vrais caractères doit seulement être lu. Un PDF qui contient des images de pages doit d'abord être reconnu, car il ne renferme encore aucun texte.

Vous pouvez les distinguer en une seconde. Ouvrez le fichier dans n'importe quel lecteur et essayez de sélectionner une ligne. Si les mots se surlignent, le PDF possède une couche de texte, choisissez donc Convertir et le texte sera restitué exactement comme il a été écrit. Si rien ne se surligne, ou si toute la page se surligne en un seul bloc, il s'agit d'un scan et une reconnaissance optique des caractères est nécessaire.

Ce simple choix explique la plupart des résultats décevants que l'on obtient ailleurs. Un convertisseur qui applique toujours le même traitement à chaque fichier renvoie du texte propre pour certains fichiers et une page vide pour d'autres, sans explication. Choisir vous-même le moteur supprime toute incertitude.

Comment copier du texte à partir de documents PDF scannés

Un scan ne vous laisse pas faire glisser votre curseur sur une phrase, car il n'y a rien à sélectionner. Extraire le texte d'un PDF scanné résout ce problème : téléversez le fichier, lancez la conversion, et vous obtenez un fichier texte brut à partir duquel vous pouvez copier, coller dans un e-mail ou effectuer une recherche avec la commande de recherche de n'importe quel éditeur.

Le résultat est un fichier .txt, qui s'ouvre sur n'importe quel ordinateur et sur n'importe quel téléphone sans logiciel spécial. Il conserve les mots et les retours à la ligne et abandonne la mise en page, ce qui est le bon compromis lorsque vous voulez le contenu plutôt qu'une copie de la page.

Plusieurs scans peuvent être traités en une fois. Chaque PDF est converti séparément et revient sous forme de son propre fichier texte, avec le même moteur et la même sélection de langue appliqués à tous.

Qu'est-ce qu'un fichier TXT ?

L'extension de fichier .txt est utilisée pour les fichiers texte simples. Ces fichiers contiennent des lignes de texte et peuvent être ouverts dans de nombreux éditeurs de texte sur différentes plates-formes et appareils. Le texte ne contient aucun formatage.

C'est pour cela que c'est l'endroit le plus sûr où placer le texte récupéré d'un scan. Le fichier ne peut pas devenir obsolète, aucune licence n'est nécessaire pour l'ouvrir et les mots restent lisibles bien après que le programme qui a produit l'original a été remplacé.

Extension de fichier : .txt, type MIME : text/plain

TXT sur Wikipedia

Quel moteur OCR choisir

Il y a 5 façons de lire un PDF scanné ici, et le panneau de réglages vous permet de passer de l'une à l'autre. Choisissez celle qui correspond au fichier sous vos yeux.

Moteur OCR À utiliser lorsque
Convertir Le PDF contient déjà du texte sélectionnable. Aucune reconnaissance ne s'exécute, donc les mots ressortent exactement comme ils ont été écrits.
OCR standard Le scan est propre, droit et net. C'est le chemin le plus rapide d'un PDF scanné vers du texte.
OCR IA avancé Le scan est pâle, en basse résolution ou légèrement de travers, et le moteur standard perd des caractères.
OCR IA avancé+ La page présente des ombres, un éclairage irrégulier ou une reliure courbe, ce qui est courant lorsqu'un livre est photographié.
OCR photo Le texte a été photographié plutôt que scanné, par exemple une enseigne, une étiquette ou un écran.

Le convertisseur reconnaît 124 langues source, y compris le chinois simplifié et traditionnel avec mises en page verticales, et les formes cyrilliques de l'azéri, du serbe et de l'ouzbek. Sélectionnez toutes les langues présentes dans votre fichier.

Raisons fréquentes de convertir un PDF scanné en texte

Les mots d'un scan sont enfermés dans une image. Voici les situations où les en extraire évite le plus de travail.

Documents à rechercher

Les factures, contrats, reçus et lettres arrivent généralement sous forme de scans. Une fois le texte extrait, vous pouvez rechercher un montant, une date ou un nom au lieu de lire chaque page.

Supports d'étude et de recherche

Les scans de bibliothèque, articles de revue et pages de livres deviennent citables. Extrayez le texte une fois et collez les passages dont vous avez besoin dans vos notes au lieu de les retaper.

Dossiers et archives

Les anciens fichiers sont souvent conservés sous forme de scans longs et multi-pages. Téléversez-en plusieurs à la fois et le convertisseur traite tout le lot en une seule exécution.

Vos données, protégées

Les papiers que vous scannez et les documents que vous convertissez peuvent être personnels. Voici exactement comment les vôtres sont traités.

Chiffrement TLS

Chaque téléversement et chaque téléchargement utilisent une connexion chiffrée, de sorte que vos fichiers ne peuvent pas être lus pendant le transfert.

Aucun accès humain

La reconnaissance de texte est entièrement automatisée. Personne ne lit vos scans ou documents, et rien n'est partagé avec des tiers.

Centres de données ISO 27001

Le traitement a lieu dans des centres de données certifiés situés dans l'Union européenne.

Comment convertir un PDF numérisé en texte

1

Téléverser

Téléchargez votre PDF numérisé.

2

Choisir

Choisissez le moteur OCR qui correspond à votre fichier. Utilisez Convertir si le texte du PDF est déjà sélectionnable.

3

Ajuster

Choisissez la langue de votre PDF pour de meilleurs résultats (facultatif).

4

Convertir

Lancez la conversion et attendez que votre téléchargement soit prêt.

FAQ sur la conversion de PDF scanné en texte

Ce convertisseur de PDF scanné en texte est-il gratuit ?

Oui. Convertir un PDF scanné en texte est gratuit et ne nécessite aucun compte. Téléversez le fichier, choisissez un moteur et téléchargez le résultat. Les fichiers jusqu'à 100 Mo sont couverts par la limite gratuite, et un abonnement n'est utile que pour des fichiers plus volumineux et des lots plus longs.

Puis-je appliquer l'OCR à un PDF gratuitement ?

Oui. L'OCR standard est le moteur gratuit et il gère les scans ordinaires sans inscription. Les 3 moteurs IA avancés sont la solution pour les pages que le moteur standard ne peut pas lire, comme les copies pâles ou les photos prises dans de mauvaises conditions de lumière.

Pourquoi mon PDF scanné nécessite-t-il un OCR pour en extraire le texte ?

Parce que le fichier contient des images de pages au lieu de caractères. Un scanner photographie le papier, donc chaque mot est un motif de pixels. La reconnaissance optique de caractères lit ces pixels et écrit de vrais caractères, ce qui rend le texte sélectionnable, consultable et modifiable.

Comment copier du texte à partir d'un PDF scanné ?

Téléversez le PDF ci-dessus, choisissez un moteur OCR et lancez la conversion. Le résultat est un fichier texte brut que vous pouvez ouvrir dans n'importe quel éditeur et à partir duquel vous pouvez copier. La copie directe depuis un lecteur PDF ne fonctionne que lorsque le fichier possède une couche de texte.

Quelles langues la reconnaissance de texte peut-elle lire ?

Il reconnaît 124 langues source, y compris le chinois en forme simplifiée et traditionnelle avec mises en page verticales, et les variantes cyrilliques de l'azéri, du serbe et de l'ouzbek. Sélectionnez chaque langue présente dans le fichier, car une page mixte est mieux lue lorsqu'elles sont toutes listées.

Puis-je convertir un PDF scanné en Word ?

Pas depuis cette page, qui produit un fichier texte brut. Elle conserve les mots et abandonne la mise en page. Pour un DOC ou DOCX avec mise en forme, utilisez l'application Convertir en Word, qui exécute la même reconnaissance de texte et produit un document Word.

Pourquoi le texte extrait est-il incorrect ?

La qualité de la reconnaissance suit la qualité du scan. Une page de travers, une basse résolution, une ombre sur le papier ou une photo prise à la main diminuent la précision. Essayez Advanced AI-OCR pour les scans imparfaits et Advanced AI-OCR+ pour les problèmes de lumière, et rescannez à 300 dpi lorsque c'est possible. Un fichier source protégé par mot de passe ou endommagé ne sera pas converti du tout.

Mes documents scannés sont-ils privés ?

Oui. Les téléversements et téléchargements sont chiffrés, le traitement a lieu dans des centres de données certifiés au sein de l'Union européenne, et toute la chaîne est automatisée, de sorte que personne ne lit vos scans. Vos fichiers ne sont jamais utilisés pour entraîner des modèles d'IA et vous en conservez les droits.

En savoir plus sur la reconnaissance de texte

Un livre ouvert sur un bureau jaune, encadré par des repères de scanner, avec le titre de l'article Save Valuable Text With OCR imprimé sur la page
Comment faire

Enregistrez vos textes précieux avec l'OCR

Numérisez des textes importants à partir de documents et d'images scannés grâce à l'OCR (reconnaissance optique de caractères). Extrayez facilement du texte à partir d'images, en ligne.

Lire l'article