Конвертер PDF у текст з OCR

Конвертуйте PDF у текст у вашому браузері та завантажте звичайний TXT-файл. Розпізнавання тексту можна вмикати за потреби та вимикати, коли воно не потрібне.

Завантажте ваш файл

або перетягніть, вставте чи виберіть з хмарного сховища

Вставити URL Спробувати зразок
Google Drive Dropbox OneDrive
100% безкоштовно Без встановлення Безпечно й конфіденційно
Реклама
Нам довіряють
eBay Booking.com University of Michigan Cornell University Columbia University
Оцініть цей інструмент
0/5 · 0 голосів

PDF у текст з OCR або без нього

Перетворення PDF у текст може означати дві різні задачі, і цей конвертер дозволяє вибрати потрібну. Більшість PDF уже містять справжні символи, тож текст потрібно лише зчитати. Сканований PDF натомість містить зображення сторінок, і ці символи потрібно розпізнати, перш ніж щось можна буде витягти.

Розпізнавання тексту за замовчуванням вимкнене, і це зроблено свідомо. PDF із реальним текстовим шаром конвертується швидше та точніше без нього, адже слова копіюються, а не обчислюються із зображення. Увімкнення розпізнавання, коли файл у ньому не потребує, може лише знизити точність.

Визначити тип файла можна за секунду. Відкрийте PDF у будь-якій програмі для читання та проведіть по рядку. Якщо слова підсвічуються, залиште перемикач OCR вимкненим. Якщо нічого не виділяється, увімкніть його та виберіть мову документа з 124 мов, які підтримує розпізнавання.

Витягніть текст із PDF без повторного набору

Витяг тексту з PDF перетворює сторінку, на яку можна лише дивитися, на слова, з якими можна працювати. Конвертер записує все знайдене у текстовий файл формату plain text, щоб ви могли скопіювати цитату, вставити абзац у лист або шукати по всьому документу за командою пошуку в будь-якому редакторі.

Це покриває типові задачі: взяти посилання зі статті, витягнути цифри з звіту або перенести основну частину великого документа в інструмент для написання тексту. Нічого не набирається і не транскрибується вручну.

Можна завантажити кілька PDF одночасно. Кожен файл конвертується окремо та повертається як окремий текстовий файл з однаковими налаштуваннями OCR і однаковою мовою для всіх. Обліковий запис не потрібен, електронну адресу вводити не потрібно.

Що таке файл TXT?

Розширення .txt використовується для файлів звичайного тексту. Такі файли містять рядки тексту й можуть відкриватися в багатьох текстових редакторах на різних платформах і пристроях. Текст не містить форматування.

У цьому й суть переходу з PDF у TXT, а не в формат документа. Такий файл відкривається на будь-якому комп’ютері та телефоні, не потребує ліцензії для читання і залишається придатним для читання ще довго після того, як програму, що створила оригінал, буде замінено.

Розширення файлу: .txt, MIME-тип: text/plain

TXT на Вікіпедії

PDF у TXT: що зберігає текстовий файл

Файл plain text зберігає слова, а не сторінки. Ось що зберігається після конвертації, а що ні.

У PDF У файлі TXT
Слова та розриви рядків Зберігаються
Порядок читання Зберігається, згори донизу
Жирний шрифт, курсив і шрифти Відкидаються
Зображення, логотипи та діаграми Відкидаються
Таблиці Зберігаються як текст, без сітки
Багатоколонні сторінки Перетворюються в одну колонку
Колонтитули та номери сторінок Записуються разом із текстом

Файл plain text зберігає слова, а не макет. Коли форматування важливе так само, як і текст, краще скористатися інструментом PDF у Word.

Коли варто конвертувати PDF у текст

Слова в PDF «замкнені» в макеті сторінки. Ось випадки, коли вивантаження їх як звичайного тексту заощаджує найбільше роботи.

Цитування та дослідження

Статті, звіти й книги зазвичай поширюються у форматі PDF. Одного разу витягніть текст і вставляйте потрібні уривки у свої нотатки, а не набирайте їх заново.

Пошук у великому документі

Текстовий файл відкривається в будь-якому редакторі, тож ви можете одразу перейти до імені, дати чи суми, а не читати сторінку за сторінкою.

Передавання тексту в інший інструмент

Перекладачі, інструменти для написання текстів, програми читання з екрана й електронні таблиці всі працюють із plain text. TXT це формат, який майже усі вони приймають без додаткового конвертера.

Захист ваших даних

PDF, які користувачі конвертують, часто є контрактами, рахунками або приватним листуванням. Ось як саме обробляються ваші файли.

Шифрування TLS

Кожне завантаження та завантаження назад відбувається через зашифроване з’єднання, тому ваші файли не можна прочитати під час передачі.

Дата-центри ISO 27001

Обробка відбувається у сертифікованих дата-центрах у межах Європейського Союзу.

Без доступу людей

Розпізнавання тексту повністю автоматизоване. Ніхто не читає ваші скани чи документи, і нічого не передається третім сторонам.

Як конвертувати PDF у текст?

1

Завантажити

Завантажте свій PDF.

2

Вибрати

Увімкніть OCR, якщо PDF є сканом. Залиште його вимкненим, якщо текст у файлі вже можна виділяти.

3

Налаштувати

Виберіть мову документа в меню (необов'язково).

4

Конвертувати

Натисніть "Почати" і дочекайтеся завершення конвертації.

Поширені запитання про PDF у текст

Чи цей конвертер PDF у текст безкоштовний?

Так. Конвертація PDF у текст безкоштовна й не потребує облікового запису, а електронну адресу вводити не потрібно. Завантажте файл, запустіть конвертацію та скачайте текст. Тарифний план важливий лише для дуже великих файлів і довгих пакетних обробок.

Як конвертувати PDF у текст?

Завантажте PDF вище, залиште перемикач OCR вимкненим, якщо текст у файлі вже можна виділяти, і запустіть конвертацію. Результатом буде текстовий файл plain text, який можна скачати й відкрити в будь-якому редакторі. Нічого не треба встановлювати.

Як скопіювати текст із PDF?

Якщо слова підсвічуються, коли ви проводите по них, їх можна скопіювати прямо з вашого PDF‑ридера. Якщо ні, сторінка є зображенням, і вибрати там нічого. Конвертація PDF у текст вирішує це, адже на виході ви отримуєте текстовий файл, з якого можна вільно копіювати.

Чи можу я конвертувати PDF також у TXT?

Саме це й створює цей конвертер. TXT це формат plain text, тож файл, який ви завантажуєте, має розширення .txt і тип вмісту text/plain. Він відкривається в Notepad, TextEdit, будь-якому редакторі коду та на будь-якому телефоні без додаткового ПЗ.

Чому OCR за замовчуванням вимкнений?

Тому що більшість PDF у ньому не потребують. PDF із реальним текстовим шаром конвертується швидше та точніше, коли слова копіюються, а не розпізнаються із зображення. Вмикайте OCR лише тоді, коли сторінки є сканами або фотографіями; разом із ним з’явиться вибір мови.

Чи працює цей конвертер PDF у текст зі сканованим PDF?

Так, якщо ввімкнути OCR. Розпізнавання зчитує символи з зображень сторінок і записує їх у текстовий файл. Якщо більшість ваших файлів це скани, додаток для PDF‑сканів у текст буде більш прямим шляхом до того самого результату.

Якими мовами може читати розпізнавання тексту?

Він розпізнає 124 вихідні мови. Окрім європейських, список охоплює гінді, бенгальську, тамільську, урду, арабську, тайську, японську, корейську та китайську в спрощеній і традиційній формах. Виберіть мову, якою написаний ваш документ, для найкращого результату.

Чи можу я конвертувати кілька PDF у текст одночасно?

Так. Додайте стільки PDF, скільки потрібно, і вони будуть конвертовані за один запуск, кожен буде повернуто як окремий текстовий файл з однаковими налаштуваннями OCR і тією самою мовою.

Докладніше про розпізнавання тексту

Відкрита книга на жовтому столі, в рамці тримача сканера, із заголовком статті "Save Valuable Text With OCR", надрукованим поперек сторінки
Як

Зберігайте цінний текст за допомогою OCR

Оцифровуйте важливі тексти зі сканованих документів та зображень за допомогою OCR (оптичного розпізнавання символів). Легко витягуйте текст із зображень онлайн.

Читати статтю