PDFからテキストへのOCRコンバーター

ブラウザ上でPDFをテキストに変換し、プレーンTXTファイルとしてダウンロードできます。テキスト認識は必要なときだけオンにして、不要なときはオフにできます。

ファイルをアップロード

または、ファイルをドロップ、貼り付けるか、クラウドから選択

URLを貼り付け サンプルを試す
Google Drive Dropbox OneDrive
100%無料 インストール不要 安全でプライベート
広告
導入実績
eBay Booking.com University of Michigan Cornell University Columbia University
このツールを評価
0/5 · 0 件の投票

OCRあり/なしでPDFをテキストに変換

PDFをテキストに変換するといっても、実際には2つの作業があります。このコンバーターなら、必要な方を選べます。ほとんどのPDFにはすでに文字情報が含まれているため、そのテキストを読み出すだけで済みます。一方、スキャンされたPDFにはページの画像しかないため、テキストを取り出す前に文字を認識する必要があります。

テキスト認識は初期設定でオフになっていますが、これは意図的なものです。実際のテキストレイヤーを持つPDFは、画像から文字を推測するのではなくコピーするだけなので、OCRなしの方が速く、正確に変換できます。必要のないファイルで認識をオンにすると、かえって精度が落ちる可能性があります。

どちらの種類のファイルかは、すぐに見分けられます。PDFを任意のリーダーで開き、行をドラッグしてみてください。文字がハイライトされる場合は、OCRの切り替えはオフのままにします。何もハイライトされない場合は、ページが画像なのでスイッチをオンにし、124の対応ソース言語から文書の言語を選びます。

PDFから文字起こしせずにテキストを抽出

PDFからテキストを抽出すると、閲覧するだけのページが、再利用できる文字情報に変わります。コンバーターは検出した内容をすべてプレーンテキストファイルに書き出すので、引用文をコピーしたり、段落をメールに貼り付けたり、任意のエディターの検索機能で文書全体からキーワードを探したりできます。

これは、多くの人が想定している作業をカバーします。論文から参考文献を取り出したり、レポートから数値を抜き出したり、長い文書の本文を他のライティングツールへ移したりする場合です。手入力や手作業での転記は一切ありません。

複数のPDFを一度に投入できます。各ファイルは個別に変換され、それぞれが独立したテキストファイルとして戻ってきます。すべて同じOCR設定と同じ言語が適用されます。アカウント登録もメールアドレスの入力も不要です。

TXT ファイルとは?

.txt ファイル拡張子はプレーンテキストファイルに使われます。これらのファイルにはテキストの行が含まれており、さまざまなプラットフォームやデバイスの多くのテキストエディタで開くことができます。テキストに書式情報は含まれていません。

PDFではなくTXTに変換する理由はここにあります。TXTであれば、どのパソコンやスマートフォンでも開け、閲覧にライセンスも不要で、元のPDFを作成したプログラムが変わっても長く読み続けることができます。

ファイル拡張子: .txt、MIMEタイプ: text/plain

Wikipedia の TXT

PDFからTXTへ: テキストファイルに残るもの

プレーンテキストファイルが保持するのは「文字」であって「ページ」ではありません。変換後に残るものと、残らないものは次の通りです。

PDF側の情報 TXTファイル側
文字と改行 保持
読み順 上から下の順で保持
太字・斜体・フォント 破棄
画像・ロゴ・グラフ 破棄
罫線なしのテキストとして保持
複数カラムのページ 1カラムに流し込み
ヘッダー・フッター・ページ番号 本文テキストと一緒に書き出し

プレーンテキストファイルが扱うのは文字であり、レイアウトではありません。レイアウトが文字と同じくらい重要な場合は、PDF to Wordアプリの方が適しています。

PDFからテキストへの変換が向いている場面

PDF内の文字はページレイアウトに固定されています。次のような場合は、テキストを素の形で取り出すことで、作業を大きく省くことができます。

引用・調査用

論文、報告書、書籍はPDFで共有されることが多くなっています。一度テキストを抽出しておけば、必要な箇所をノートに貼り付けるだけで済み、打ち直す必要はありません。

長い文書を検索したいとき

テキストファイルはどのエディターでも開けるので、ページを延々と読む代わりに、名前・日付・金額などを一気に検索できます。

他のツールにテキストを渡したいとき

翻訳ツール、ライティングツール、スクリーンリーダー、スプレッドシートなど、多くのツールはプレーンテキストを受け付けます。TXTは、ほとんどすべてのツールが変換なしで扱える形式です。

お客様のデータを保護

変換されるPDFには、契約書や請求書、個人的なやりとりなどが含まれることがよくあります。ここでは、それらをどのように扱うかを明確にお知らせします。

TLS暗号化

すべてのアップロードとダウンロードは暗号化された接続で行われ、転送中にファイルの内容を読まれることはありません。

ISO 27001準拠データセンター

処理は、欧州連合内にある認証済みデータセンターで行われます。

人による閲覧なし

テキスト認識は完全に自動化されています。スキャンや文書が人に読まれることはなく、第三者と共有されることもありません。

PDF をテキストに変換する方法

1

アップロード

PDF をアップロードします。

2

選択

PDFがスキャンの場合はOCRをオンにします。ファイル内のテキストがすでに選択可能な場合は、オフのままにします。

3

調整

メニューから文書の言語を選択します(任意)。

4

変換

「Start」をクリックし、変換が完了するまでお待ちください。

PDFからテキストへのよくある質問

このPDF to textコンバーターは無料ですか?

はい。PDFをテキストに変換する機能は無料で、アカウント作成もメールアドレスの入力も不要です。ファイルをアップロードし、変換を開始してテキストをダウンロードするだけです。大容量ファイルや長い一括処理を行う場合のみ、プランが関係してきます。

PDFをテキストに変換する方法は?

上のエリアにPDFをアップロードし、ファイル内のテキストがすでに選択できる場合はOCRの切り替えをオフにしたまま変換を開始します。結果としてプレーンテキストファイルが生成され、ダウンロードして任意のエディターで開けます。インストールは一切不要です。

PDFからテキストをコピーするには?

文字の上をドラッグしたときにハイライトされるなら、そのままPDFリーダーからコピーできます。ハイライトされない場合、そのページは画像なので選択可能なテキストがありません。PDFをテキストに変換すれば、この問題は解決します。出力がテキストファイルになるため、自由にコピーできます。

PDFをTXTに変換することもできますか?

まさにこのコンバーターが出力するのがTXTです。TXTはプレーンテキスト形式なので、ダウンロードしたファイルの拡張子は .txt で、メディアタイプは text/plain になります。Notepad、TextEdit、任意のコードエディターやスマートフォンで、追加ソフトなしに開けます。

なぜOCRは初期設定でオフなのですか?

ほとんどのPDFにはOCRが不要だからです。実際のテキストレイヤーを持つPDFであれば、画像から文字を認識するのではなくコピーするだけなので、OCRなしの方が速く、精度も高くなります。ページがスキャンや写真の場合にだけOCRをオンにしてください。その際に言語選択も表示されます。

このPDF to textコンバーターはスキャンPDFにも使えますか?

はい。OCRをオンにすれば使用できます。認識機能がページ画像から文字を読み取り、テキストファイルに書き出します。変換するファイルのほとんどがスキャンの場合は、スキャンPDFからテキストへのアプリを使う方が、同じ結果へ直接たどり着けます。

テキスト認識はどの言語に対応していますか?

対応しているソース言語は124種類です。欧州言語に加えて、ヒンディー語、ベンガル語、タミル語、ウルドゥー語、アラビア語、タイ語、日本語、韓国語、中国語(簡体字・繁体字)も含まれます。最もよい結果のために、文書が書かれている言語を選択してください。

複数のPDFを一度にテキストに変換できますか?

はい。必要なだけPDFを追加すると、1回の実行で変換され、それぞれが同じOCR設定と同じ言語が適用された個別のテキストファイルとして出力されます。

文字認識についてさらに詳しく

黄色い机の上に開かれた本がスキャナーの枠に収まっており、ページ全体に「Save Valuable Text With OCR」という記事タイトルが印刷されている画像
使い方ガイド

OCRで大切なテキストを保存

スキャンした文書や画像から、OCR(光学文字認識)で大切なテキストをデジタル化。画像からテキストをオンラインで簡単に抽出できます。

記事を読む