Zeskanowany PDF na tekst

To narzędzie konwertuje skanowane PDF-y na edytowalny tekst, abyś mógł łatwo kopiować, edytować i dodawać treści.

Prześlij plik

lub upuść, wklej albo wybierz z chmury

Wklej URL Wypróbuj przykładowy plik
Google Drive Dropbox OneDrive
W 100% za darmo Bez instalacji Bezpieczne i prywatne
Reklama
Zaufali nam
eBay Booking.com University of Michigan Cornell University Columbia University
Oceń to narzędzie
0/5 · 0 głosów

Kiedy skanowany PDF potrzebuje OCR, a kiedy nie

Przekształcenie skanowanego PDF-a w tekst to w rzeczywistości dwa różne zadania i to ty wybierasz, które z nich ma zostać wykonane. PDF, który zawiera już prawdziwe znaki, trzeba tylko odczytać. PDF, który zawiera obrazy stron, musi zostać najpierw rozpoznany, ponieważ nie ma w nim jeszcze tekstu.

Rozpoznasz to w sekundę. Otwórz plik w dowolnym czytniku i spróbuj zaznaczyć pojedynczy wiersz. Jeśli słowa się podświetlają, PDF ma warstwę tekstową, więc wybierz Konwertuj, a tekst zostanie odczytany dokładnie tak, jak został zapisany. Jeśli nic się nie podświetla lub podświetla się cała strona jako jeden blok, to jest skan i wymaga optycznego rozpoznawania znaków.

Ten jeden wybór wyjaśnia większość rozczarowujących wyników uzyskiwanych gdzie indziej. Konwerter, który stosuje jedną ścieżkę dla każdego pliku, zwraca czysty tekst dla części plików i puste strony dla innych, bez wyjaśnienia. Samodzielne wybranie silnika usuwa element zgadywania.

Jak kopiować tekst ze skanowanych dokumentów PDF

Skan nie pozwoli przeciągnąć kursora po zdaniu, ponieważ nie ma tam nic do zaznaczenia. Wyodrębnienie tekstu ze skanowanego PDF-a rozwiązuje ten problem: prześlij plik, uruchom konwersję i otrzymasz plik tekstowy, z którego możesz kopiować, wkleić treść do e-maila lub przeszukać ją poleceniem znajdowania w dowolnym edytorze.

Wynikiem jest plik .txt, więc otworzysz go na każdym komputerze i każdym telefonie bez dodatkowego oprogramowania. Zawiera słowa i podziały wierszy, a pomija układ, co jest właściwym kompromisem, kiedy chodzi ci o treść, a nie o kopię strony.

Możesz przesłać kilka skanów naraz. Każdy PDF jest konwertowany osobno i wraca jako osobny plik tekstowy, z tym samym silnikiem i tym samym wyborem języka zastosowanym do wszystkich.

Czym jest plik TXT?

Rozszerzenie .txt jest używane dla plików z czystym tekstem. Takie pliki zawierają wiersze tekstu i można je otworzyć w wielu edytorach tekstu na różnych platformach i urządzeniach. Tekst nie zawiera żadnego formatowania.

Dlatego jest to najbezpieczniejsze miejsce na tekst odzyskany ze skanu. Plik się nie zestarzeje, do jego otwarcia nie trzeba licencji, a słowa pozostaną czytelne długo po tym, jak program, w którym powstał oryginał, zostanie zastąpiony.

Rozszerzenie pliku: .txt, typ MIME: text/plain

TXT w Wikipedii

Który silnik OCR wybrać

Masz tu 5 sposobów odczytu skanowanego PDF-a, a panel ustawień pozwala się między nimi przełączać. Wybierz ten, który pasuje do twojego pliku.

Silnik OCR Wybierz, kiedy
Konwertuj PDF ma już zaznaczalny tekst. Rozpoznawanie nie jest uruchamiane, więc słowa zostają odczytane dokładnie tak, jak zostały zapisane.
Standardowe OCR Skan jest czysty, prosty i ostry. To najszybsza droga od skanowanego PDF-a do tekstu.
Zaawansowane AI-OCR Skan jest blady, w niskiej rozdzielczości lub lekko przekrzywiony, a standardowy silnik gubi znaki.
Zaawansowane AI-OCR+ Strona ma cienie, nierówne oświetlenie lub wybrzuszony grzbiet, co jest częste przy fotografowaniu książek.
OCR zdjęć Tekst został sfotografowany, a nie zeskanowany, na przykład znak, etykieta lub ekran.

Konwerter rozpoznaje 124 języki źródłowe, w tym uproszczony i tradycyjny chiński z układami pionowymi oraz cyrylickie formy azerskiego, serbskiego i uzbeckiego. Zaznacz każdy język, który pojawia się w twoim pliku.

Typowe powody konwersji skanowanego PDF-a na tekst

Słowa w skanie są zamknięte w obrazie. W takich sytuacjach ich wyodrębnienie oszczędza najwięcej pracy.

Dokumenty, które musisz przeszukać

Faktury, umowy, paragony i listy zazwyczaj przychodzą jako skany. Po wyodrębnieniu tekstu możesz wyszukać kwotę, datę lub nazwę zamiast czytać każdą stronę.

Materiały do nauki i badań

Biblioteczne skany, artykuły naukowe i strony książek stają się cytowalne. Wyodrębnij tekst raz i wklej potrzebne fragmenty do notatek zamiast przepisywać je ręcznie.

Zapiski i archiwa

Starsze pliki są często przechowywane jako długie, wielostronicowe skany. Prześlij kilka naraz, a konwerter przetworzy całą partię za jednym razem.

Twoje dane, chronione

Skanowane dokumenty i pliki, które konwertujesz, mogą być osobiste. Oto dokładnie, jak są przetwarzane.

Szyfrowanie TLS

Każde wysłanie i pobranie pliku odbywa się po zaszyfrowanym połączeniu, więc Twoje pliki nie mogą zostać odczytane w trakcie transmisji.

Brak dostępu dla ludzi

Rozpoznawanie tekstu jest w pełni zautomatyzowane. Nikt nie czyta Twoich skanów ani dokumentów i nic nie jest udostępniane podmiotom trzecim.

Centra danych ISO 27001

Przetwarzanie odbywa się w certyfikowanych centrach danych na terenie Unii Europejskiej.

Jak przekonwertować zeskanowany PDF na tekst

1

Prześlij

Prześlij swój zeskanowany plik PDF.

2

Wybierz

Wybierz silnik OCR, który pasuje do twojego pliku. Użyj Konwertuj, jeśli tekst w PDF-ie jest już zaznaczalny.

3

Dostosuj

Wybierz język swojego pliku PDF, aby uzyskać lepsze wyniki (opcjonalne).

4

Konwertuj

Rozpocznij konwersję i poczekaj, aż plik będzie gotowy do pobrania.

Skanowany PDF na tekst - FAQ

Czy ten konwerter skanowanego PDF-a na tekst jest darmowy?

Tak. Konwersja skanowanego PDF-a na tekst jest darmowa i nie wymaga konta. Prześlij plik, wybierz silnik i pobierz wynik. Pliki do 100 MB są objęte darmowym limitem, a plan ma znaczenie tylko przy większych plikach i dłuższych partiach.

Czy mogę zrobić OCR PDF-a za darmo?

Tak. Standardowy OCR to darmowy silnik i obsługuje zwykłe skany bez rejestracji. Trzy zaawansowane silniki AI są rozszerzeniem dla stron, których standardowy silnik nie jest w stanie odczytać, na przykład bladych kopii lub zdjęć zrobionych w słabym świetle.

Dlaczego mój skanowany PDF wymaga OCR, aby wyodrębnić tekst?

Ponieważ plik zawiera obrazy stron zamiast znaków. Skaner fotografuje papier, więc każde słowo jest wzorem pikseli. Opticzne rozpoznawanie znaków odczytuje te piksele i zapisuje prawdziwe znaki, dzięki czemu tekst staje się zaznaczalny, przeszukiwalny i edytowalny.

Jak skopiować tekst ze skanowanego PDF-a?

Prześlij PDF powyżej, wybierz silnik OCR i uruchom konwersję. Wynikiem jest zwykły plik tekstowy, który możesz otworzyć w dowolnym edytorze i z którego możesz kopiować. Kopiowanie bezpośrednio z czytnika PDF działa dopiero wtedy, gdy plik ma warstwę tekstową.

Jakie języki może odczytać moduł rozpoznawania tekstu?

Rozpoznaje 124 języki źródłowe, w tym chiński w formie uproszczonej i tradycyjnej z układami pionowymi oraz cyrylickie warianty azerskiego, serbskiego i uzbeckiego. Zaznacz każdy język, który pojawia się w pliku, ponieważ mieszane strony najlepiej czytają się wtedy, gdy wszystkie są wymienione.

Czy mogę przekonwertować skanowany PDF do Worda?

Nie z tej strony, która tworzy zwykły plik tekstowy. Zachowuje on słowa, a pomija układ. Aby uzyskać DOC lub DOCX z formatowaniem, użyj aplikacji Konwertuj do Worda, która wykorzystuje to samo rozpoznawanie tekstu i zapisuje dokument Word.

Dlaczego wyodrębniony tekst jest nieprawidłowy?

Jakość rozpoznawania wynika z jakości skanu. Przekrzywiona strona, niska rozdzielczość, cień na papierze lub zdjęcie zrobione z ręki obniżają dokładność. Wypróbuj Advanced AI-OCR dla niedoskonałych skanów i Advanced AI-OCR+ przy słabym oświetleniu oraz, gdzie to możliwe, skanuj w 300 dpi. Plik źródłowy z hasłem lub uszkodzony w ogóle się nie przekonwertuje.

Czy moje skanowane dokumenty są prywatne?

Tak. Przesyłanie i pobieranie odbywa się po szyfrowanym połączeniu, przetwarzanie ma miejsce w certyfikowanych centrach danych w Unii Europejskiej, a cały proces jest zautomatyzowany, więc nikt nie czyta twoich skanów. Twoje pliki nigdy nie są używane do trenowania modeli AI i zachowujesz do nich prawa.

Więcej o rozpoznawaniu tekstu

Otwarta książka na żółtym biurku, w ramkach skanera, z tytułem artykułu Save Valuable Text With OCR wydrukowanym na stronie
Jak

Zapisz cenny tekst dzięki OCR

Cyfryzuj cenne teksty ze skanów dokumentów i obrazów za pomocą OCR (Optical Character Recognition). Łatwo wyodrębnij tekst z obrazów online.

Przeczytaj artykuł