スキャンしたドキュメントを検索可能なPDFに変換します。キーワード、数値、名前などでスキャン、ドキュメント、PDFの内容を検索できます。
または、ファイルをドロップ、貼り付けるか、クラウドから選択
ファイルをアップロードする前に、このアプリが行う処理について。
書類をデジタル化してペーパーレスオフィスにすると、環境にやさしいだけでなく、フォルダを探し回る時間も大幅に節約できます。ただし、多くのスキャンは書類の画像データしか含んでいません。この場合、ファイル名以外の内容を検索することはできません。
スキャンを検索可能にすると、スキャン画像に追加のテキストレイヤーが加えられ、いわゆるハイブリッドPDFが作成されます。このテキストレイヤーにより、PDF内のキーワード、金額やその他の数値、名前、件名などを検索できるようになります。
検索可能なPDFは、その元になったスキャンと見た目がまったく同じです。ページもスタンプも手書きもすべてそのまま残ります。違いは表には出ず、その下に、本物の文字のレイヤーが隠れていることです。読者も、コンピュータも、文書管理システムも、その文字を読むことができます。
ファイル拡張子: .pdf、MIMEタイプ: application/pdf
Wikipedia の PDFこのアプリはPDFを受け取り、PDFを返します。文書の見た目は何も変わりません。ページのサイズも、スキャンについた印もそのままで、その背後に認識したテキストの隠しレイヤーを書き込みます。
これは、ファイルからテキストだけを抜き出すアプリとの違いです。そうしたアプリはテキストをプレーンテキストファイルとして渡し、レイアウトは置き去りにします。このアプリはレイアウトには触れないので、そのまま回覧したり印刷したり署名したりできる文書を保てるうえ、テキストファイルのように検索もできます。
アップロードするのはPDFである必要があります。写真や画像ファイルをお持ちの場合は、JPG to PDF と PNG to PDF アプリがPDFを作成し、その処理中に同じテキスト認識を実行します。
テキスト認識は、想定する言語モデルにページを照らし合わせて読み取ります。そのため、その言語を指定することが、結果の精度に最も役立ちます。設定はアップローダーの横にあり、このアプリがユーザーに求める唯一の選択です。
一度に複数の言語を扱えます。英語の表紙とドイツ語の付録がある契約書は両方を選択するのが最適で、ラテン文字とアラビア文字、キリル文字、中国語が混在するスキャンも同様です。
リストには124の元の言語が含まれており、アラビア語、ヒンディー語、タイ語、ベトナム語、簡体字と繁体字の中国語、アゼルバイジャン語、セルビア語、ウズベク語のキリル文字版などがあります。何も変更しない場合は英語が選択されています。
テキスト認識は、すべてのページを同じように読み取れるわけではありません。お持ちのファイルから期待できることを説明します。
| お持ちのPDF | 検索可能にできるか | 対処方法 |
|---|---|---|
| 印刷物をフラットにスキャンしたPDF | はい | アップロードして文書の言語を選びます。このタイプのファイル向けにアプリは作られています。 |
| スマートフォンで撮影したページ | たいていは可能 | 影、斜めの角度、湾曲した背表紙はどれも精度を下げます。可能であれば、平らに置き、均一な明るさで撮影してください。 |
| 薄いコピー、FAX、手書き文字 | 一部のみ | 印刷文字と手書き文字は別の問題です。抜けや誤りを見込んで、結果に頼る前に内容を確認してください。 |
| すでにテキストを選択できるPDF | 追加の処理は不要です | すでに検索可能です。別ファイルとして文字だけが必要な場合は PDF to Text をご利用ください。 |
| パスワード保護されたPDF、または破損したPDF | いいえ | このアプリでは開けません。保護を解除するかファイルを修復してから、もう一度アップロードしてください。 |
| JPG、PNGなどの画像ファイル | ここでは不可 | JPG to PDF と PNG to PDF がPDFを作成し、同じ認識処理を行います。 |
認識精度はスキャン品質に左右されます。ページの歪み、低解像度、紙にかかる影などはすべて精度を下げるため、文書を保管する前に結果に一度目を通す価値があります。
スキャンと検索可能なPDFは、画面上では同じように見えます。違いが出るのは次の3つの操作です。
どのPDFリーダーでも検索コマンドを使えば、入力した単語へ一気にジャンプできます。90ページの賃貸契約書なら、「探す」作業と「丸一日かける」作業ほどの違いになります。
デスクトップ検索や多くのクラウドドライブは、PDF内部のテキストレイヤーを読み取ります。検索可能なPDFなら、ファイル名だけでなく中身のテキストでも検索結果に現れます。
スキャン画像の上でカーソルをドラッグしても、選択できるものがないので何も起こりません。検索可能なPDFなら、段落を選択してメールやメモに貼り付けることができます。
スキャンした書類や変換する文書には、個人情報が含まれることがあります。ここでは、その扱いを明確に説明します。
すべてのアップロードとダウンロードは暗号化された接続で行われ、転送中にファイルの内容を読まれることはありません。
テキスト認識は完全に自動化されています。スキャンや文書が人に読まれることはなく、第三者と共有されることもありません。
変換に必要な処理だけを行います。ファイルがAIモデルの学習に使われることはありません。
検索可能にしたいPDFをアップロードしてください。スキャンしたページも、撮影したページも利用できます。
リストから文書の言語を選択します(任意)。
「開始」をクリックします。少し待つと、文書の準備が完了します。
検索可能なPDFとは、スキャン画像の背後に実際のテキストレイヤーが付いたPDFです。ページの見た目は元の紙とまったく同じですが、その下の文字は検索・選択・コピーができます。画像とテキストを1つのファイルに収めていることから、ハイブリッドPDFと呼ばれることもあります。
上でPDFをアップロードし、文書の言語を選んで「開始」を押してください。テキスト認識がページを読み取り、見つかった内容を非表示のレイヤーに書き込み、PDFを返します。複数のPDFを同時に処理でき、それぞれ個別のファイルとして戻ってきます。
はい。PDFを検索可能にする機能は無料で、登録もクレジットも不要です。プランが関係するのは、非常に大きな文書や長い一括処理の場合だけです。
いいえ。カーソルを行の上でドラッグして文字がハイライトされるなら、そのPDFにはすでにテキストレイヤーがあり、検索可能です。もう一度処理しても意味はありません。別ファイルとしてテキストが欲しい場合は、代わりにPDF to Textアプリをお使いください。
読み取り可能な言語は124種類あり、アラビア語、ヒンディー語、タイ語、ベトナム語、簡体字と繁体字の中国語、アゼルバイジャン語・セルビア語・ウズベク語のキリル文字版などが含まれます。文書内に現れる言語はすべて選択してください。複数の言語が混在するページでも、全て指定されていると最も正確に読み取れます。
認識精度はスキャン品質に左右されます。傾いたページ、低解像度、紙にかかった影、手持ち撮影の写真などはすべて精度を下げ、手書き文字は印字よりさらに難しくなります。可能であれば300dpiでフラットにスキャンし、開始前に文書の言語を設定してください。
このアプリではできません。このアプリはテキストレイヤーを追加するもので、削除はしません。PDFを検索不可にするには、各ページを再び画像としてフラット化する必要があり、これは正反対の処理であり、ここでは提供していません。
アップロードとダウンロードは暗号化された接続で行われ、処理はEU域内の認証済みデータセンターで行われます。処理はすべて自動化されているため、誰もお客様の文書を閲覧しません。ファイルがAIモデルの学習に使われることはなく、権利は常にお客様にあります。
これらはすべてブラウザー上で動作します。インストールもアカウントも不要で、同じ文字認識エンジンが使われています。