Сканований PDF в текст

Цей інструмент перетворює скановані PDF у редагований текст, щоб ви могли легко копіювати, редагувати й додавати вміст.

Завантажте ваш файл

або перетягніть, вставте чи виберіть з хмарного сховища

Вставити URL Спробувати зразок
Google Drive Dropbox OneDrive
100% безкоштовно Без встановлення Безпечно й конфіденційно
Реклама
Нам довіряють
eBay Booking.com University of Michigan Cornell University Columbia University
Оцініть цей інструмент
0/5 · 0 голосів

Коли відсканованому PDF потрібен OCR, а коли ні

Перетворення відсканованого PDF на текст складається з двох різних задач, і конвертер дозволяє обрати, яку саме виконувати. Якщо в PDF уже є справжні символи, його потрібно лише зчитати. Якщо в PDF лише зображення сторінок, їх спочатку потрібно розпізнати, адже тексту всередині ще немає.

Розрізнити їх можна за секунду. Відкрийте файл у будь-якому рідері й спробуйте виділити рядок. Якщо слова підсвічуються, у PDF є текстовий шар, тож оберіть "Конвертувати" і текст буде вивантажено саме так, як він написаний. Якщо нічого не виділяється або виділяється вся сторінка одним блоком, це скан, і йому потрібне оптичне розпізнавання символів.

Цей один вибір пояснює більшість незадовільних результатів, які користувачі отримують в інших сервісах. Конвертер, що йде одним шляхом для кожного завантаження, повертає чистий текст для одних файлів і порожню сторінку для інших, без пояснень. Коли ви самі обираєте рушій, здогадки зникають.

Як копіювати текст зі сканованих PDF-документів

У скані ви не можете провести курсором по реченню, бо там нічого виділяти. Витягування тексту з відсканованого PDF це вирішує: завантажте файл, запустіть конвертацію і отримаєте текстовий файл, з якого можна копіювати, вставляти в електронний лист або шукати через команду пошуку в будь-якому редакторі.

Результат це файл .txt, тож він відкривається на будь-якому комп'ютері й телефоні без спеціального ПЗ. У ньому збережені слова та розриви рядків, а макет вилучено, і це правильний компроміс, коли вам потрібен вміст, а не копія сторінки.

Можна завантажити кілька сканів одночасно. Кожен PDF конвертується окремо і повертається окремим текстовим файлом, до всіх застосовується один і той самий рушій і вибір мов.

Що таке файл TXT?

Розширення .txt використовується для файлів звичайного тексту. Такі файли містять рядки тексту й можуть відкриватися в багатьох текстових редакторах на різних платформах і пристроях. Текст не містить форматування.

Тому це найнадійніше місце для тексту, відновленого зі скану. Файл не застаріває, для його відкриття не потрібна ліцензія, а текст залишиться читабельним і тоді, коли програма, що створила оригінал, уже буде замінена.

Розширення файлу: .txt, MIME-тип: text/plain

TXT на Вікіпедії

Який OCR-рушій обрати

Тут є 5 способів прочитати відсканований PDF, і в панелі налаштувань можна перемикатися між ними. Оберіть той, що відповідає вашому файлу.

OCR-рушій Обирайте, коли
Конвертувати У PDF вже є текст, який можна виділяти. Розпізнавання не запускається, тому слова виходять саме такими, як були написані.
Стандартне OCR Скан чистий, рівний і чіткий. Це найшвидший шлях від відсканованого PDF до тексту.
Розширене AI-OCR Скан блідий, із низькою роздільною здатністю або трохи перекошений, і стандартний рушій пропускає символи.
Розширене AI-OCR+ На сторінці є тіні, нерівномірне освітлення або вигнутий корінець, що типово для сфотографованих книг.
Фото OCR Текст сфотографовано, а не відскановано, наприклад, вивіска, етикетка або екран.

Конвертер розпізнає 124 мови джерела, включно зі спрощеною та традиційною китайською з вертикальними макетами та кириличними формами азербайджанської, сербської й узбецької. Виберіть усі мови, які присутні у вашому файлі.

Поширені причини конвертації відсканованого PDF у текст

Слова в скані заблоковані всередині зображення. Ось ситуації, в яких їх витягування заощаджує найбільше роботи.

Папери, які потрібно шукати

Рахунки, договори, квитанції та листи зазвичай надходять як скани. Витягнувши з них текст, ви можете знайти суму, дату або ім'я, не перечитуючи кожну сторінку.

Навчальні матеріали та дослідження

Бібліотечні скани, журнальні статті та сторінки книг стають придатними для цитування. Витягніть текст один раз і вставляйте потрібні уривки у свої нотатки замість того, щоб передруковувати.

Записи та архіви

Старі файли часто зберігаються як довгі багатосторінкові скани. Завантажте відразу кілька, і конвертер обробить весь пакет за один запуск.

Захист ваших даних

Документи, які ви скануєте й конвертуєте, можуть бути особистими. Ось як саме ми з ними працюємо.

Шифрування TLS

Кожне завантаження та завантаження назад відбувається через зашифроване з’єднання, тому ваші файли не можна прочитати під час передачі.

Без доступу людей

Розпізнавання тексту повністю автоматизоване. Ніхто не читає ваші скани чи документи, і нічого не передається третім сторонам.

Дата-центри ISO 27001

Обробка відбувається у сертифікованих дата-центрах у межах Європейського Союзу.

Як конвертувати сканований PDF у текст

1

Завантажити

Завантажте свій сканований PDF.

2

Вибрати

Оберіть OCR-рушій, який підходить вашому файлу. Використовуйте "Конвертувати", якщо текст у PDF уже можна виділяти.

3

Налаштувати

Виберіть мову вашого PDF для кращих результатів (необов'язково).

4

Конвертувати

Запустіть конвертацію та зачекайте, поки файл буде готовий до завантаження.

Поширені запитання про конвертацію відсканованого PDF у текст

Чи безкоштовний цей конвертер відсканованого PDF у текст?

Так. Конвертація відсканованого PDF у текст безкоштовна і не потребує облікового запису. Завантажте файл, оберіть рушій і завантажте результат. Файли до 100 МБ входять у безкоштовний ліміт, а план потрібен лише для більших файлів і довших пакетів.

Чи можу я безкоштовно зробити OCR PDF-файлу?

Так. Стандартний OCR це безкоштовний рушій, який обробляє звичайні скани без реєстрації. Три розширені AI-рушії це оновлення для сторінок, які стандартний рушій не може прочитати, наприклад бляклі копії або фото, зроблені при поганому освітленні.

Чому для мого відсканованого PDF потрібен OCR, щоб витягнути текст?

Тому що файл містить зображення сторінок, а не символи. Сканер фотографує папір, тому кожне слово це візерунок із пікселів. Оптичне розпізнавання символів читає ці пікселі й записує справжні символи, завдяки чому текст стає придатним для виділення, пошуку й редагування.

Як скопіювати текст з відсканованого PDF?

Завантажте PDF вище, оберіть OCR-рушій і запустіть конвертацію. Результат це текстовий файл, який можна відкрити в будь-якому редакторі й скопіювати з нього. Копіювання прямо з PDF-рідера працює лише тоді, коли у файлі вже є текстовий шар.

Якими мовами може читати розпізнавання тексту?

Він розпізнає 124 мови джерела, зокрема китайську в спрощеній і традиційній формах з вертикальним набором, а також кириличні варіанти азербайджанської, сербської й узбецької. Виберіть усі мови, що присутні у файлі, адже змішана сторінка найкраще читається, коли їх усі перелічено.

Чи можу я конвертувати відсканований PDF у Word?

Не з цієї сторінки, тут створюється текстовий файл. Вона зберігає слова й відкидає макет. Щоб отримати DOC або DOCX з форматуванням, скористайтеся додатком "Конвертувати в Word", який використовує те саме розпізнавання тексту й створює документ Word.

Чому витягнутий текст вийшов неправильним?

Якість розпізнавання залежить від якості скану. Перекошена сторінка, низька роздільна здатність, тінь на папері або фото з рук погіршують точність. Спробуйте Advanced AI-OCR для недосконалих сканів і Advanced AI-OCR+ для поганого освітлення, а де можливо перескануйте з роздільною здатністю 300 dpi. Захищений паролем або пошкоджений вихідний файл взагалі не буде конвертовано.

Чи приватні мої відскановані документи?

Так. Завантаження й вивантаження відбуваються через зашифроване з'єднання, обробка проходить у сертифікованих дата-центрах у межах Європейського Союзу, а весь процес автоматизований, тому ніхто не читає ваші скани. Ваші файли ніколи не використовуються для навчання AI-моделей, і ви зберігаєте права на них.

Докладніше про розпізнавання тексту

Відкрита книга на жовтому столі, в рамці тримача сканера, із заголовком статті "Save Valuable Text With OCR", надрукованим поперек сторінки
Як

Зберігайте цінний текст за допомогою OCR

Оцифровуйте важливі тексти зі сканованих документів та зображень за допомогою OCR (оптичного розпізнавання символів). Легко витягуйте текст із зображень онлайн.

Читати статтю