Cet outil convertit les PDF scannés en texte modifiable afin que vous puissiez facilement copier, modifier et ajouter du contenu.
ou déposez, collez ou choisissez depuis le cloud
Transformer un PDF scanné en texte correspond en réalité à deux tâches différentes, et le convertisseur vous laisse choisir laquelle exécuter. Un PDF qui contient déjà de vrais caractères doit seulement être lu. Un PDF qui contient des images de pages doit d'abord être reconnu, car il ne renferme encore aucun texte.
Vous pouvez les distinguer en une seconde. Ouvrez le fichier dans n'importe quel lecteur et essayez de sélectionner une ligne. Si les mots se surlignent, le PDF possède une couche de texte, choisissez donc Convertir et le texte sera restitué exactement comme il a été écrit. Si rien ne se surligne, ou si toute la page se surligne en un seul bloc, il s'agit d'un scan et une reconnaissance optique des caractères est nécessaire.
Ce simple choix explique la plupart des résultats décevants que l'on obtient ailleurs. Un convertisseur qui applique toujours le même traitement à chaque fichier renvoie du texte propre pour certains fichiers et une page vide pour d'autres, sans explication. Choisir vous-même le moteur supprime toute incertitude.
Un scan ne vous laisse pas faire glisser votre curseur sur une phrase, car il n'y a rien à sélectionner. Extraire le texte d'un PDF scanné résout ce problème : téléversez le fichier, lancez la conversion, et vous obtenez un fichier texte brut à partir duquel vous pouvez copier, coller dans un e-mail ou effectuer une recherche avec la commande de recherche de n'importe quel éditeur.
Le résultat est un fichier .txt, qui s'ouvre sur n'importe quel ordinateur et sur n'importe quel téléphone sans logiciel spécial. Il conserve les mots et les retours à la ligne et abandonne la mise en page, ce qui est le bon compromis lorsque vous voulez le contenu plutôt qu'une copie de la page.
Plusieurs scans peuvent être traités en une fois. Chaque PDF est converti séparément et revient sous forme de son propre fichier texte, avec le même moteur et la même sélection de langue appliqués à tous.
L'extension de fichier .txt est utilisée pour les fichiers texte simples. Ces fichiers contiennent des lignes de texte et peuvent être ouverts dans de nombreux éditeurs de texte sur différentes plates-formes et appareils. Le texte ne contient aucun formatage.
C'est pour cela que c'est l'endroit le plus sûr où placer le texte récupéré d'un scan. Le fichier ne peut pas devenir obsolète, aucune licence n'est nécessaire pour l'ouvrir et les mots restent lisibles bien après que le programme qui a produit l'original a été remplacé.
Extension de fichier : .txt, type MIME : text/plain
TXT sur WikipediaIl y a 5 façons de lire un PDF scanné ici, et le panneau de réglages vous permet de passer de l'une à l'autre. Choisissez celle qui correspond au fichier sous vos yeux.
| Moteur OCR | À utiliser lorsque |
|---|---|
| Convertir | Le PDF contient déjà du texte sélectionnable. Aucune reconnaissance ne s'exécute, donc les mots ressortent exactement comme ils ont été écrits. |
| OCR standard | Le scan est propre, droit et net. C'est le chemin le plus rapide d'un PDF scanné vers du texte. |
| OCR IA avancé | Le scan est pâle, en basse résolution ou légèrement de travers, et le moteur standard perd des caractères. |
| OCR IA avancé+ | La page présente des ombres, un éclairage irrégulier ou une reliure courbe, ce qui est courant lorsqu'un livre est photographié. |
| OCR photo | Le texte a été photographié plutôt que scanné, par exemple une enseigne, une étiquette ou un écran. |
Le convertisseur reconnaît 124 langues source, y compris le chinois simplifié et traditionnel avec mises en page verticales, et les formes cyrilliques de l'azéri, du serbe et de l'ouzbek. Sélectionnez toutes les langues présentes dans votre fichier.
Les mots d'un scan sont enfermés dans une image. Voici les situations où les en extraire évite le plus de travail.
Les factures, contrats, reçus et lettres arrivent généralement sous forme de scans. Une fois le texte extrait, vous pouvez rechercher un montant, une date ou un nom au lieu de lire chaque page.
Les scans de bibliothèque, articles de revue et pages de livres deviennent citables. Extrayez le texte une fois et collez les passages dont vous avez besoin dans vos notes au lieu de les retaper.
Les anciens fichiers sont souvent conservés sous forme de scans longs et multi-pages. Téléversez-en plusieurs à la fois et le convertisseur traite tout le lot en une seule exécution.
Les papiers que vous scannez et les documents que vous convertissez peuvent être personnels. Voici exactement comment les vôtres sont traités.
Chaque téléversement et chaque téléchargement utilisent une connexion chiffrée, de sorte que vos fichiers ne peuvent pas être lus pendant le transfert.
La reconnaissance de texte est entièrement automatisée. Personne ne lit vos scans ou documents, et rien n'est partagé avec des tiers.
Le traitement a lieu dans des centres de données certifiés situés dans l'Union européenne.
Téléchargez votre PDF numérisé.
Choisissez le moteur OCR qui correspond à votre fichier. Utilisez Convertir si le texte du PDF est déjà sélectionnable.
Choisissez la langue de votre PDF pour de meilleurs résultats (facultatif).
Lancez la conversion et attendez que votre téléchargement soit prêt.
Oui. Convertir un PDF scanné en texte est gratuit et ne nécessite aucun compte. Téléversez le fichier, choisissez un moteur et téléchargez le résultat. Les fichiers jusqu'à 100 Mo sont couverts par la limite gratuite, et un abonnement n'est utile que pour des fichiers plus volumineux et des lots plus longs.
Oui. L'OCR standard est le moteur gratuit et il gère les scans ordinaires sans inscription. Les 3 moteurs IA avancés sont la solution pour les pages que le moteur standard ne peut pas lire, comme les copies pâles ou les photos prises dans de mauvaises conditions de lumière.
Parce que le fichier contient des images de pages au lieu de caractères. Un scanner photographie le papier, donc chaque mot est un motif de pixels. La reconnaissance optique de caractères lit ces pixels et écrit de vrais caractères, ce qui rend le texte sélectionnable, consultable et modifiable.
Téléversez le PDF ci-dessus, choisissez un moteur OCR et lancez la conversion. Le résultat est un fichier texte brut que vous pouvez ouvrir dans n'importe quel éditeur et à partir duquel vous pouvez copier. La copie directe depuis un lecteur PDF ne fonctionne que lorsque le fichier possède une couche de texte.
Il reconnaît 124 langues source, y compris le chinois en forme simplifiée et traditionnelle avec mises en page verticales, et les variantes cyrilliques de l'azéri, du serbe et de l'ouzbek. Sélectionnez chaque langue présente dans le fichier, car une page mixte est mieux lue lorsqu'elles sont toutes listées.
Pas depuis cette page, qui produit un fichier texte brut. Elle conserve les mots et abandonne la mise en page. Pour un DOC ou DOCX avec mise en forme, utilisez l'application Convertir en Word, qui exécute la même reconnaissance de texte et produit un document Word.
La qualité de la reconnaissance suit la qualité du scan. Une page de travers, une basse résolution, une ombre sur le papier ou une photo prise à la main diminuent la précision. Essayez Advanced AI-OCR pour les scans imparfaits et Advanced AI-OCR+ pour les problèmes de lumière, et rescannez à 300 dpi lorsque c'est possible. Un fichier source protégé par mot de passe ou endommagé ne sera pas converti du tout.
Oui. Les téléversements et téléchargements sont chiffrés, le traitement a lieu dans des centres de données certifiés au sein de l'Union européenne, et toute la chaîne est automatisée, de sorte que personne ne lit vos scans. Vos fichiers ne sont jamais utilisés pour entraîner des modèles d'IA et vous en conservez les droits.
Numérisez des textes importants à partir de documents et d'images scannés grâce à l'OCR (reconnaissance optique de caractères). Extrayez facilement du texte à partir d'images, en ligne.
Lire l'articleChacun de ces outils s'exécute dans le navigateur. Aucune installation, aucun compte, et la même reconnaissance de texte derrière.