Этот инструмент преобразует сканированные PDF в редактируемый текст, чтобы вы могли легко копировать, редактировать и дополнять содержимое.
или перетащите, вставьте или выберите из облака
Преобразование сканированного PDF в текст на самом деле состоит из двух разных задач, и конвертер позволяет выбрать, какую выполнять. PDF, в котором уже есть настоящие символы, нужно только прочитать. PDF, который содержит изображения страниц, сначала нужно распознать, потому что текста внутри еще нет.
Их легко отличить за секунду. Откройте файл в любом просмотрщике и попробуйте выделить строку. Если слова подсвечиваются, в PDF есть текстовый слой, поэтому выберите «Конвертировать», и текст будет извлечен в точности как написан. Если ничего не выделяется или вся страница выделяется как один блок, это скан, и ему нужно оптическое распознавание текста.
Этот один выбор объясняет большинство разочаровывающих результатов, которые пользователи получают в других местах. Конвертер, который всегда запускает только один режим, дает чистый текст для одних файлов и пустую страницу для других, без каких‑либо пояснений. Когда вы сами выбираете движок, угадывать не приходится.
Скан не позволяет провести курсором по предложению, потому что там просто нечего выделять. Извлечение текста из сканированного PDF решает эту проблему: загрузите файл, запустите конвертацию и получите текстовый файл, из которого можно копировать, вставлять в письмо или искать слова через команду «Найти» в любом редакторе.
Результатом будет файл .txt, который открывается на любом компьютере и на любом телефоне без специального ПО. В нем сохраняются слова и разрывы строк, а макет страницы отбрасывается, что и нужно, когда вам важнее содержание, а не точная копия страницы.
Можно загрузить сразу несколько сканов. Каждый PDF конвертируется отдельно и возвращается как свой текстовый файл, при этом ко всем применяется один и тот же движок и один и тот же выбор языка.
Расширение .txt используется для простых текстовых файлов. Эти файлы содержат строки текста и могут быть открыты во многих текстовых редакторах на разных платформах и устройствах. Текст не содержит форматирования.
Поэтому это самый надежный формат для текста, восстановленного из скана. Файл со временем не «устаревает», для его открытия не нужна лицензия, и текст остается читаемым даже тогда, когда программу, создавшую оригинал, давно заменили.
Расширение файла: .txt, MIME-тип: text/plain
TXT в ВикипедииЗдесь есть 5 способов прочитать сканированный PDF, и в панели настроек можно переключаться между ними. Выберите тот, который соответствует вашему файлу.
| Движок OCR | Выберите, когда |
|---|---|
| Преобразовать | В PDF уже есть выделяемый текст. Распознавание не запускается, поэтому слова выводятся в точности как написаны. |
| Стандартное OCR | Скан чистый, ровный и четкий. Это самый быстрый путь от сканированного PDF к тексту. |
| Расширенное AI-OCR | Скан бледный, с низким разрешением или немного перекошен, и стандартный движок пропускает символы. |
| Расширенное AI-OCR+ | На странице есть тени, неравномерное освещение или изогнутый корешок, что часто бывает при фотографировании книги. |
| Фото OCR | Текст был сфотографирован, а не отсканирован, например табличка, этикетка или экран. |
Конвертер распознает 124 исходных языка, включая упрощенный и традиционный китайский с вертикальной версткой и кириллические варианты азербайджанского, сербского и узбекского. Выберите все языки, которые встречаются в вашем файле.
Слова в скане заперты внутри изображения. В этих ситуациях их извлечение экономит больше всего работы.
Счета, контракты, чеки и письма обычно приходят в виде сканов. Извлеките текст, и вы сможете искать по сумме, дате или имени вместо того, чтобы читать каждую страницу.
Библиотечные сканы, статьи и страницы книг становятся цитируемыми. Один раз извлеките текст и вставляйте нужные фрагменты в конспекты вместо того, чтобы перепечатывать.
Старые файлы часто хранятся как длинные многостраничные сканы. Загрузите несколько сразу, и конвертер обработает всю партию за один запуск.
Бумаги, которые вы сканируете, и документы, которые конвертируете, могут быть личными. Вот как именно мы с ними обращаемся.
Каждая загрузка и скачивание выполняются по зашифрованному соединению, поэтому ваши файлы не могут быть прочитаны по пути.
Распознавание текста полностью автоматизировано. Никто не читает ваши сканы или документы, и ничего не передается третьим лицам.
Обработка проходит в сертифицированных дата-центрах внутри Европейского союза.
Загрузите отсканированный PDF.
Выберите движок OCR, который подходит вашему файлу. Используйте «Конвертировать», если текст в PDF уже можно выделять.
Выберите язык вашего PDF для более точного результата (необязательно).
Запустите конвертацию и дождитесь подготовки файла для скачивания.
Да. Конвертация сканированного PDF в текст бесплатна и не требует аккаунта. Загрузите файл, выберите движок и скачайте результат. Файлы до 100 МБ входят в бесплатный лимит, а тариф нужен только для более крупных файлов и длинных пакетов.
Да. Стандартный OCR это бесплатный движок, и он обрабатывает обычные сканы без регистрации. Три расширенных AI-движка это улучшение для страниц, которые стандартный движок не может прочитать, например бледные копии или фото, сделанные при плохом освещении.
Потому что файл содержит изображения страниц вместо символов. Сканер фотографирует бумагу, поэтому каждое слово это узор из пикселей. Оптическое распознавание текста читает эти пиксели и записывает настоящие символы, благодаря которым текст становится выделяемым, доступным для поиска и редактирования.
Загрузите PDF выше, выберите движок OCR и запустите конвертацию. Результат это текстовый файл, который можно открыть в любом редакторе и копировать из него. Копирование прямо из PDF‑просмотрщика работает только после того, как в файле появился текстовый слой.
Он распознает 124 исходных языка, включая китайский в упрощенной и традиционной форме с вертикальной версткой и кириллические варианты азербайджанского, сербского и узбекского. Выберите все языки, которые встречаются в файле, потому что смешанная страница лучше читается, когда они все указаны.
Не с этой страницы, которая создает текстовый файл. Она сохраняет слова и отбрасывает макет. Для DOC или DOCX с форматированием используйте приложение «Конвертировать в Word», которое запускает то же распознавание текста и создает документ Word.
Качество распознавания следует за качеством скана. Перекошенная страница, низкое разрешение, тень на бумаге или фотография с рук снижают точность. Попробуйте Advanced AI-OCR для несовершенных сканов и Advanced AI-OCR+ при плохом освещении, а где возможно, пересканируйте с разрешением 300 dpi. Файл-источник с паролем или повреждениями вообще не будет конвертирован.
Да. Загрузка и скачивание идут по зашифрованному соединению, обработка выполняется в сертифицированных дата‑центрах внутри Европейского Союза, а весь процесс автоматизирован, поэтому никто не читает ваши сканы. Ваши файлы никогда не используются для обучения AI‑моделей, и вы сохраняете права на них.
Оцифруйте важные тексты из отсканированных документов и изображений с помощью OCR (оптического распознавания символов). Легко извлекайте текст из изображений онлайн.
Читать статьюВсе эти операции выполняются в браузере. Никакой установки, никакого аккаунта и одно и то же распознавание текста за ними.