Chuyển đổi tài liệu đã scan thành PDF có thể tìm kiếm. Tìm kiếm nội dung trong bản scan, tài liệu và PDF bằng từ khóa, số, tên và nhiều hơn nữa.
hoặc thả, dán, hoặc chọn từ đám mây
Ứng dụng làm gì với tệp của bạn trước khi bạn tải bất cứ thứ gì lên.
Số hóa tài liệu và vận hành văn phòng số không chỉ tốt cho môi trường mà còn giúp bạn tiết kiệm nhiều thời gian thường dùng để tìm kiếm trong hàng loạt thư mục. Tuy nhiên, nhiều bản scan chỉ chứa hình ảnh của tài liệu đã quét. Những hình ảnh này không thể tìm kiếm được, ngoại trừ theo tên tệp.
Bằng cách làm cho bản scan có thể tìm kiếm, một lớp văn bản bổ sung sẽ được thêm vào hình ảnh đã quét, tạo nên một PDF lai. Lớp văn bản này cho phép bạn tìm kiếm từ khóa, số tiền và các con số khác, tên hoặc chủ đề trong PDF.
Vì vậy, một PDF có thể tìm kiếm trông giống hệt bản quét gốc. Các trang, con dấu và chữ viết tay đều giữ nguyên. Khác biệt nằm bên dưới, nơi một lớp ký tự thật chờ người đọc, máy tính và trình quản lý tài liệu của bạn đọc nó.
Phần mở rộng tệp: .pdf, loại MIME: application/pdf
PDF trên WikipediaỨng dụng này nhận một PDF và trả lại một PDF. Giao diện tài liệu không thay đổi. Các trang giữ nguyên kích thước, bản quét giữ nguyên dấu vết, và một lớp văn bản đã nhận dạng được viết ẩn phía sau.
Đó là điểm khác biệt với các ứng dụng trích xuất văn bản khỏi tệp. Chúng đưa cho bạn từ ngữ trong một tệp văn bản thuần và bỏ lại bố cục. Ứng dụng này giữ nguyên bố cục, nên bạn vẫn có tài liệu để chia sẻ, in hoặc ký, đồng thời có thể tìm kiếm như một tệp văn bản.
Tệp tải lên phải là PDF. Nếu bạn đang giữ ảnh hoặc tệp hình ảnh, các ứng dụng JPG to PDF và PNG to PDF sẽ tạo PDF cho bạn và chạy cùng tính năng nhận dạng văn bản trong quá trình đó.
Nhận dạng văn bản đọc một trang dựa trên mô hình ngôn ngữ mà nó mong đợi, nên việc đặt đúng ngôn ngữ là điều hữu ích nhất bạn có thể làm cho kết quả. Thiết lập này nằm cạnh bộ tải tệp và là lựa chọn duy nhất ứng dụng yêu cầu bạn đặt.
Ứng dụng xử lý được nhiều hơn một ngôn ngữ cùng lúc. Một hợp đồng có trang bìa tiếng Anh và phụ lục tiếng Đức sẽ cho kết quả tốt nhất khi chọn cả hai, cũng như bản quét trộn chữ Latinh với tiếng Ả Rập, Kirin hoặc tiếng Trung.
Danh sách có 124 ngôn ngữ nguồn, trong đó có tiếng Ả Rập, Hindi, Thái, Việt, tiếng Trung giản thể và phồn thể, và các dạng chữ Kirin của tiếng Azerbaijan, Serbia và Uzbek. Nếu bạn không thay đổi gì, tiếng Anh sẽ được chọn sẵn.
Nhận dạng văn bản không đọc mọi trang tốt như nhau. Đây là những điều bạn có thể mong đợi từ tệp mình đang giữ.
| PDF bạn đang có | Có thể làm cho tìm kiếm được không | Nên làm gì |
|---|---|---|
| Bản quét phẳng của các trang in | Có | Tải nó lên và chọn ngôn ngữ tài liệu. Đây là loại tệp mà ứng dụng được thiết kế cho. |
| Trang được chụp bằng điện thoại | Thường là được | Bóng, góc chụp và gáy sách cong đều làm giảm độ chính xác. Hãy chụp phẳng và trong ánh sáng đều khi có thể. |
| Bản sao mờ, fax hoặc chữ viết tay | Một phần | Chữ in và chữ viết tay là hai vấn đề khác nhau. Hãy kỳ vọng sẽ có chỗ thiếu và đọc lại kết quả trước khi dựa vào nó. |
| PDF mà bạn đã có thể chọn văn bản | Không có gì để thêm | Nó đã có thể tìm kiếm được. Dùng PDF to Text nếu bạn chỉ cần từ ngữ trong một tệp riêng. |
| PDF có mật khẩu hoặc bị hỏng | Không | Ứng dụng không thể mở tệp. Hãy gỡ bảo vệ hoặc sửa tệp trước, rồi tải lên lại. |
| Tệp JPG, PNG hoặc tệp hình ảnh khác | Không xử lý tại đây | JPG to PDF và PNG to PDF tạo PDF và chạy cùng tính năng nhận dạng. |
Chất lượng nhận dạng phụ thuộc vào chất lượng bản quét. Trang lệch, độ phân giải thấp hoặc bóng trên giấy đều làm giảm độ chính xác, nên bạn nên đọc lại kết quả trước khi lưu trữ tài liệu.
Bản quét và PDF có thể tìm kiếm trông giống nhau trên màn hình. Đây là ba việc mà chỉ một trong hai làm được.
Lệnh tìm trong bất kỳ trình đọc PDF nào sẽ nhảy thẳng tới từ bạn gõ. Với một hợp đồng thuê 90 trang, đó là sự khác biệt giữa việc tìm kiếm và mất cả buổi chiều.
Tìm kiếm trên máy tính để bàn và hầu hết ổ đĩa đám mây đều đọc lớp văn bản bên trong PDF. PDF có thể tìm kiếm sẽ xuất hiện trong kết quả theo nội dung bên trong, không chỉ theo tên tệp.
Kéo con trỏ qua một bản quét sẽ không có tác dụng, vì không có gì để chọn. PDF có thể tìm kiếm cho phép bạn chọn một đoạn văn và dán vào email hoặc ghi chú.
Tài liệu bạn scan và file bạn chuyển đổi có thể là thông tin cá nhân. Đây là cách chính xác mà chúng được xử lý.
Mọi lần tải lên và tải xuống đều qua kết nối được mã hóa, nên tệp của bạn không thể bị đọc trong quá trình truyền.
Nhận dạng văn bản được tự động hóa hoàn toàn. Không ai đọc bản quét hoặc tài liệu của bạn, và không chia sẻ gì với bên thứ ba.
Chỉ những gì chuyển đổi cần mới được xử lý. Tệp của bạn không bao giờ được dùng để huấn luyện mô hình AI.
Tải lên PDF bạn muốn làm cho có thể tìm kiếm. Cả trang được quét và trang được chụp đều hoạt động.
Chọn ngôn ngữ tài liệu từ danh sách (tùy chọn).
Nhấp "Start". Sau một lúc, tài liệu của bạn sẽ sẵn sàng.
PDF có thể tìm kiếm là bản quét có một lớp văn bản thật ở phía sau. Các trang vẫn trông giống hệt như trên giấy gốc, nhưng văn bản bên dưới có thể được tìm kiếm, chọn và sao chép. Nó còn được gọi là PDF lai, vì trong một tệp có cả hình ảnh và văn bản.
Tải PDF lên ở trên, chọn ngôn ngữ của tài liệu và nhấn Bắt đầu. Công cụ nhận dạng văn bản sẽ đọc các trang, ghi những gì nó tìm thấy vào một lớp ẩn và trả lại tệp PDF cho bạn. Bạn có thể xử lý nhiều PDF cùng lúc và mỗi tệp sẽ được trả lại riêng.
Có. Làm cho PDF có thể tìm kiếm là miễn phí, không cần đăng ký và không tốn credit. Gói dịch vụ chỉ cần thiết cho tài liệu rất lớn và các lô xử lý dài.
Không. Nếu bạn có thể kéo con trỏ qua một dòng và chữ được tô sáng, PDF đó đã có sẵn lớp văn bản và đã có thể tìm kiếm. Chạy lại qua đây sẽ không thêm gì cả. Nếu bạn cần trích văn bản ra một tệp riêng, hãy dùng ứng dụng PDF sang Text.
Công cụ nhận dạng được 124 ngôn ngữ nguồn, bao gồm tiếng Ả Rập, Hindi, Thái, Việt, tiếng Trung giản thể và phồn thể, và các dạng chữ Kirin của tiếng Azerbaijan, Serbia và Uzbek. Hãy chọn mọi ngôn ngữ xuất hiện trong tài liệu, vì trang có nhiều ngôn ngữ sẽ được nhận dạng tốt nhất khi liệt kê đủ tất cả.
Chất lượng nhận dạng phụ thuộc vào chất lượng bản quét. Trang bị lệch, độ phân giải thấp, có bóng trên giấy hoặc chụp ảnh bằng tay đều làm giảm độ chính xác, và chữ viết tay lại còn khó hơn chữ in. Khi có thể, hãy quét phẳng ở 300 dpi và chọn đúng ngôn ngữ tài liệu trước khi bắt đầu.
Không thể với ứng dụng này. Ứng dụng chỉ thêm lớp văn bản, không xóa lớp có sẵn. Làm cho PDF không thể tìm kiếm nghĩa là làm phẳng từng trang thành ảnh, đây là tác vụ ngược lại và hiện không có công cụ nào ở đây thực hiện.
Tải lên và tải xuống đều qua kết nối mã hóa, xử lý diễn ra tại các trung tâm dữ liệu đạt chứng nhận trong Liên minh Châu Âu, và toàn bộ quy trình được tự động hóa nên không ai đọc tài liệu của bạn. Tệp của bạn không bao giờ được dùng để huấn luyện mô hình AI và bạn luôn giữ quyền sở hữu chúng.
Số hóa văn bản quan trọng từ tài liệu scan và hình ảnh với OCR (Nhận dạng ký tự quang học). Trích xuất văn bản từ hình ảnh dễ dàng, trực tuyến.
Đọc bài viếtTất cả các công cụ này đều chạy trong trình duyệt. Không cài đặt, không tài khoản và cùng một bộ nhận dạng văn bản phía sau.