Цей інструмент перетворює скановані PDF у редагований текст, щоб ви могли легко копіювати, редагувати й додавати вміст.
або перетягніть, вставте чи виберіть з хмарного сховища
Перетворення відсканованого PDF на текст складається з двох різних задач, і конвертер дозволяє обрати, яку саме виконувати. Якщо в PDF уже є справжні символи, його потрібно лише зчитати. Якщо в PDF лише зображення сторінок, їх спочатку потрібно розпізнати, адже тексту всередині ще немає.
Розрізнити їх можна за секунду. Відкрийте файл у будь-якому рідері й спробуйте виділити рядок. Якщо слова підсвічуються, у PDF є текстовий шар, тож оберіть "Конвертувати" і текст буде вивантажено саме так, як він написаний. Якщо нічого не виділяється або виділяється вся сторінка одним блоком, це скан, і йому потрібне оптичне розпізнавання символів.
Цей один вибір пояснює більшість незадовільних результатів, які користувачі отримують в інших сервісах. Конвертер, що йде одним шляхом для кожного завантаження, повертає чистий текст для одних файлів і порожню сторінку для інших, без пояснень. Коли ви самі обираєте рушій, здогадки зникають.
У скані ви не можете провести курсором по реченню, бо там нічого виділяти. Витягування тексту з відсканованого PDF це вирішує: завантажте файл, запустіть конвертацію і отримаєте текстовий файл, з якого можна копіювати, вставляти в електронний лист або шукати через команду пошуку в будь-якому редакторі.
Результат це файл .txt, тож він відкривається на будь-якому комп'ютері й телефоні без спеціального ПЗ. У ньому збережені слова та розриви рядків, а макет вилучено, і це правильний компроміс, коли вам потрібен вміст, а не копія сторінки.
Можна завантажити кілька сканів одночасно. Кожен PDF конвертується окремо і повертається окремим текстовим файлом, до всіх застосовується один і той самий рушій і вибір мов.
Розширення .txt використовується для файлів звичайного тексту. Такі файли містять рядки тексту й можуть відкриватися в багатьох текстових редакторах на різних платформах і пристроях. Текст не містить форматування.
Тому це найнадійніше місце для тексту, відновленого зі скану. Файл не застаріває, для його відкриття не потрібна ліцензія, а текст залишиться читабельним і тоді, коли програма, що створила оригінал, уже буде замінена.
Розширення файлу: .txt, MIME-тип: text/plain
TXT на ВікіпедіїТут є 5 способів прочитати відсканований PDF, і в панелі налаштувань можна перемикатися між ними. Оберіть той, що відповідає вашому файлу.
| OCR-рушій | Обирайте, коли |
|---|---|
| Конвертувати | У PDF вже є текст, який можна виділяти. Розпізнавання не запускається, тому слова виходять саме такими, як були написані. |
| Стандартне OCR | Скан чистий, рівний і чіткий. Це найшвидший шлях від відсканованого PDF до тексту. |
| Розширене AI-OCR | Скан блідий, із низькою роздільною здатністю або трохи перекошений, і стандартний рушій пропускає символи. |
| Розширене AI-OCR+ | На сторінці є тіні, нерівномірне освітлення або вигнутий корінець, що типово для сфотографованих книг. |
| Фото OCR | Текст сфотографовано, а не відскановано, наприклад, вивіска, етикетка або екран. |
Конвертер розпізнає 124 мови джерела, включно зі спрощеною та традиційною китайською з вертикальними макетами та кириличними формами азербайджанської, сербської й узбецької. Виберіть усі мови, які присутні у вашому файлі.
Слова в скані заблоковані всередині зображення. Ось ситуації, в яких їх витягування заощаджує найбільше роботи.
Рахунки, договори, квитанції та листи зазвичай надходять як скани. Витягнувши з них текст, ви можете знайти суму, дату або ім'я, не перечитуючи кожну сторінку.
Бібліотечні скани, журнальні статті та сторінки книг стають придатними для цитування. Витягніть текст один раз і вставляйте потрібні уривки у свої нотатки замість того, щоб передруковувати.
Старі файли часто зберігаються як довгі багатосторінкові скани. Завантажте відразу кілька, і конвертер обробить весь пакет за один запуск.
Документи, які ви скануєте й конвертуєте, можуть бути особистими. Ось як саме ми з ними працюємо.
Кожне завантаження та завантаження назад відбувається через зашифроване з’єднання, тому ваші файли не можна прочитати під час передачі.
Розпізнавання тексту повністю автоматизоване. Ніхто не читає ваші скани чи документи, і нічого не передається третім сторонам.
Обробка відбувається у сертифікованих дата-центрах у межах Європейського Союзу.
Завантажте свій сканований PDF.
Оберіть OCR-рушій, який підходить вашому файлу. Використовуйте "Конвертувати", якщо текст у PDF уже можна виділяти.
Виберіть мову вашого PDF для кращих результатів (необов'язково).
Запустіть конвертацію та зачекайте, поки файл буде готовий до завантаження.
Так. Конвертація відсканованого PDF у текст безкоштовна і не потребує облікового запису. Завантажте файл, оберіть рушій і завантажте результат. Файли до 100 МБ входять у безкоштовний ліміт, а план потрібен лише для більших файлів і довших пакетів.
Так. Стандартний OCR це безкоштовний рушій, який обробляє звичайні скани без реєстрації. Три розширені AI-рушії це оновлення для сторінок, які стандартний рушій не може прочитати, наприклад бляклі копії або фото, зроблені при поганому освітленні.
Тому що файл містить зображення сторінок, а не символи. Сканер фотографує папір, тому кожне слово це візерунок із пікселів. Оптичне розпізнавання символів читає ці пікселі й записує справжні символи, завдяки чому текст стає придатним для виділення, пошуку й редагування.
Завантажте PDF вище, оберіть OCR-рушій і запустіть конвертацію. Результат це текстовий файл, який можна відкрити в будь-якому редакторі й скопіювати з нього. Копіювання прямо з PDF-рідера працює лише тоді, коли у файлі вже є текстовий шар.
Він розпізнає 124 мови джерела, зокрема китайську в спрощеній і традиційній формах з вертикальним набором, а також кириличні варіанти азербайджанської, сербської й узбецької. Виберіть усі мови, що присутні у файлі, адже змішана сторінка найкраще читається, коли їх усі перелічено.
Не з цієї сторінки, тут створюється текстовий файл. Вона зберігає слова й відкидає макет. Щоб отримати DOC або DOCX з форматуванням, скористайтеся додатком "Конвертувати в Word", який використовує те саме розпізнавання тексту й створює документ Word.
Якість розпізнавання залежить від якості скану. Перекошена сторінка, низька роздільна здатність, тінь на папері або фото з рук погіршують точність. Спробуйте Advanced AI-OCR для недосконалих сканів і Advanced AI-OCR+ для поганого освітлення, а де можливо перескануйте з роздільною здатністю 300 dpi. Захищений паролем або пошкоджений вихідний файл взагалі не буде конвертовано.
Так. Завантаження й вивантаження відбуваються через зашифроване з'єднання, обробка проходить у сертифікованих дата-центрах у межах Європейського Союзу, а весь процес автоматизований, тому ніхто не читає ваші скани. Ваші файли ніколи не використовуються для навчання AI-моделей, і ви зберігаєте права на них.
Оцифровуйте важливі тексти зі сканованих документів та зображень за допомогою OCR (оптичного розпізнавання символів). Легко витягуйте текст із зображень онлайн.
Читати статтюУсе це працює в браузері. Без встановлення, без облікового запису й з однаковим розпізнаванням тексту за цим.