Сканированный PDF в текст

Этот инструмент преобразует сканированные PDF в редактируемый текст, чтобы вы могли легко копировать, редактировать и дополнять содержимое.

Загрузите файл

или перетащите, вставьте или выберите из облака

Вставить URL Попробовать пример
Google Drive Dropbox OneDrive
100% бесплатно Не требуется установка Безопасно и конфиденциально
Реклама
Нам доверяют
eBay Booking.com University of Michigan Cornell University Columbia University
Оцените этот инструмент
0/5 · 0 голосов

Когда отсканированному PDF нужен OCR, а когда нет

Преобразование сканированного PDF в текст на самом деле состоит из двух разных задач, и конвертер позволяет выбрать, какую выполнять. PDF, в котором уже есть настоящие символы, нужно только прочитать. PDF, который содержит изображения страниц, сначала нужно распознать, потому что текста внутри еще нет.

Их легко отличить за секунду. Откройте файл в любом просмотрщике и попробуйте выделить строку. Если слова подсвечиваются, в PDF есть текстовый слой, поэтому выберите «Конвертировать», и текст будет извлечен в точности как написан. Если ничего не выделяется или вся страница выделяется как один блок, это скан, и ему нужно оптическое распознавание текста.

Этот один выбор объясняет большинство разочаровывающих результатов, которые пользователи получают в других местах. Конвертер, который всегда запускает только один режим, дает чистый текст для одних файлов и пустую страницу для других, без каких‑либо пояснений. Когда вы сами выбираете движок, угадывать не приходится.

Как скопировать текст из сканированных PDF-документов

Скан не позволяет провести курсором по предложению, потому что там просто нечего выделять. Извлечение текста из сканированного PDF решает эту проблему: загрузите файл, запустите конвертацию и получите текстовый файл, из которого можно копировать, вставлять в письмо или искать слова через команду «Найти» в любом редакторе.

Результатом будет файл .txt, который открывается на любом компьютере и на любом телефоне без специального ПО. В нем сохраняются слова и разрывы строк, а макет страницы отбрасывается, что и нужно, когда вам важнее содержание, а не точная копия страницы.

Можно загрузить сразу несколько сканов. Каждый PDF конвертируется отдельно и возвращается как свой текстовый файл, при этом ко всем применяется один и тот же движок и один и тот же выбор языка.

Что такое файл TXT?

Расширение .txt используется для простых текстовых файлов. Эти файлы содержат строки текста и могут быть открыты во многих текстовых редакторах на разных платформах и устройствах. Текст не содержит форматирования.

Поэтому это самый надежный формат для текста, восстановленного из скана. Файл со временем не «устаревает», для его открытия не нужна лицензия, и текст остается читаемым даже тогда, когда программу, создавшую оригинал, давно заменили.

Расширение файла: .txt, MIME-тип: text/plain

TXT в Википедии

Какой движок OCR выбрать

Здесь есть 5 способов прочитать сканированный PDF, и в панели настроек можно переключаться между ними. Выберите тот, который соответствует вашему файлу.

Движок OCR Выберите, когда
Преобразовать В PDF уже есть выделяемый текст. Распознавание не запускается, поэтому слова выводятся в точности как написаны.
Стандартное OCR Скан чистый, ровный и четкий. Это самый быстрый путь от сканированного PDF к тексту.
Расширенное AI-OCR Скан бледный, с низким разрешением или немного перекошен, и стандартный движок пропускает символы.
Расширенное AI-OCR+ На странице есть тени, неравномерное освещение или изогнутый корешок, что часто бывает при фотографировании книги.
Фото OCR Текст был сфотографирован, а не отсканирован, например табличка, этикетка или экран.

Конвертер распознает 124 исходных языка, включая упрощенный и традиционный китайский с вертикальной версткой и кириллические варианты азербайджанского, сербского и узбекского. Выберите все языки, которые встречаются в вашем файле.

Частые причины конвертировать сканированный PDF в текст

Слова в скане заперты внутри изображения. В этих ситуациях их извлечение экономит больше всего работы.

Документы, которые нужно искать по тексту

Счета, контракты, чеки и письма обычно приходят в виде сканов. Извлеките текст, и вы сможете искать по сумме, дате или имени вместо того, чтобы читать каждую страницу.

Материалы для учебы и исследований

Библиотечные сканы, статьи и страницы книг становятся цитируемыми. Один раз извлеките текст и вставляйте нужные фрагменты в конспекты вместо того, чтобы перепечатывать.

Документы и архивы

Старые файлы часто хранятся как длинные многостраничные сканы. Загрузите несколько сразу, и конвертер обработает всю партию за один запуск.

Ваши данные под защитой

Бумаги, которые вы сканируете, и документы, которые конвертируете, могут быть личными. Вот как именно мы с ними обращаемся.

Шифрование TLS

Каждая загрузка и скачивание выполняются по зашифрованному соединению, поэтому ваши файлы не могут быть прочитаны по пути.

Без доступа людей

Распознавание текста полностью автоматизировано. Никто не читает ваши сканы или документы, и ничего не передается третьим лицам.

Дата-центры ISO 27001

Обработка проходит в сертифицированных дата-центрах внутри Европейского союза.

Как конвертировать отсканированный PDF в текст

1

Загрузить

Загрузите отсканированный PDF.

2

Выбрать

Выберите движок OCR, который подходит вашему файлу. Используйте «Конвертировать», если текст в PDF уже можно выделять.

3

Настроить

Выберите язык вашего PDF для более точного результата (необязательно).

4

Преобразовать

Запустите конвертацию и дождитесь подготовки файла для скачивания.

FAQ по конвертации сканированного PDF в текст

Этот конвертер сканированного PDF в текст бесплатный?

Да. Конвертация сканированного PDF в текст бесплатна и не требует аккаунта. Загрузите файл, выберите движок и скачайте результат. Файлы до 100 МБ входят в бесплатный лимит, а тариф нужен только для более крупных файлов и длинных пакетов.

Могу ли я выполнить OCR PDF бесплатно?

Да. Стандартный OCR это бесплатный движок, и он обрабатывает обычные сканы без регистрации. Три расширенных AI-движка это улучшение для страниц, которые стандартный движок не может прочитать, например бледные копии или фото, сделанные при плохом освещении.

Почему моему сканированному PDF нужен OCR, чтобы извлечь текст?

Потому что файл содержит изображения страниц вместо символов. Сканер фотографирует бумагу, поэтому каждое слово это узор из пикселей. Оптическое распознавание текста читает эти пиксели и записывает настоящие символы, благодаря которым текст становится выделяемым, доступным для поиска и редактирования.

Как скопировать текст из сканированного PDF?

Загрузите PDF выше, выберите движок OCR и запустите конвертацию. Результат это текстовый файл, который можно открыть в любом редакторе и копировать из него. Копирование прямо из PDF‑просмотрщика работает только после того, как в файле появился текстовый слой.

На каких языках распознается текст?

Он распознает 124 исходных языка, включая китайский в упрощенной и традиционной форме с вертикальной версткой и кириллические варианты азербайджанского, сербского и узбекского. Выберите все языки, которые встречаются в файле, потому что смешанная страница лучше читается, когда они все указаны.

Могу ли я конвертировать сканированный PDF в Word?

Не с этой страницы, которая создает текстовый файл. Она сохраняет слова и отбрасывает макет. Для DOC или DOCX с форматированием используйте приложение «Конвертировать в Word», которое запускает то же распознавание текста и создает документ Word.

Почему извлеченный текст получился с ошибками?

Качество распознавания следует за качеством скана. Перекошенная страница, низкое разрешение, тень на бумаге или фотография с рук снижают точность. Попробуйте Advanced AI-OCR для несовершенных сканов и Advanced AI-OCR+ при плохом освещении, а где возможно, пересканируйте с разрешением 300 dpi. Файл-источник с паролем или повреждениями вообще не будет конвертирован.

Мои сканированные документы конфиденциальны?

Да. Загрузка и скачивание идут по зашифрованному соединению, обработка выполняется в сертифицированных дата‑центрах внутри Европейского Союза, а весь процесс автоматизирован, поэтому никто не читает ваши сканы. Ваши файлы никогда не используются для обучения AI‑моделей, и вы сохраняете права на них.

Подробнее о распознавании текста

Открытая книга на желтом столе в держателе сканера с заголовком статьи Save Valuable Text With OCR на странице
Инструкции

Сохраните важный текст с помощью OCR

Оцифруйте важные тексты из отсканированных документов и изображений с помощью OCR (оптического распознавания символов). Легко извлекайте текст из изображений онлайн.

Читать статью