PDFからMicrosoft Wordに変換すると、PDFファイルを編集できるようになります。テキストをコピーしたり、PDFを編集したりできます。
または、ファイルをドロップ、貼り付けるか、クラウドから選択
PDF のページを編集可能な Word ファイルに変換します。
PDFでは、各行がページ上に固定されています。PDFをWordに変換すると、Microsoft Word、Googleドキュメント、LibreOfficeで入力し直したり、構成を変えたり、再利用できる文書になります。
変換方法をOCRに切り替えると、変換ツールが各スキャンページの文字を読み取ります。Wordで出力されるのは、検索や修正ができるテキストであり、ページ画像ではありません。
見出し、段落、リスト、表、画像がWordファイル内に再構築されます。レイアウトモードでは、すべてを1列に流し込むのではなく、ページの配置を維持します。
スキャンページは画像なので、通常の変換ではその画像がWordファイルに入るだけです。変換方法で「OCRで変換」を選ぶと、まず各ページの文字認識を行い、その結果を編集可能なテキストとしてWord文書に書き込みます。
どの種類のPDFかを素早く見分ける方法があります。PDFを開いてテキストの1行を選択してみてください。行がハイライトされる場合、そのファイルにはテキストがすでに含まれており、OCRは不要です。何もハイライトされない場合はページが画像であり、OCRを使う必要があります。
OCRは既定でオフになっていますが、それには理由があります。Word、LaTeX、あるいは組版ツールから書き出されたPDFには、すでに正確なテキストが含まれており、OCRなしで変換すれば、文字をそのまま保てます。そこにOCRをかけると処理は遅くなり、すでに含まれているテキストを推測し直すことにしかなりません。
入力はPDFファイルです。複数ファイルを一度に追加でき、各PDFはそれぞれ別々のWord文書として戻ってきます。
OCR方式には2つの設定があり、重視するものが異なります。レイアウトはページの配置を維持し、フォーム、表、段組のある文書に向いています。テキスト認識は文字の正確さを最優先し、文字が密な文書や薄い・読み取りにくいスキャンに適しています。
OCR言語は、どの設定よりも結果に影響します。124の言語から文書の言語を選ぶと、見た目が似ている文字の判別にその情報が使われます。複数の言語が混在する文書には、該当する言語を複数選択してください。
「OCRを向上」を有効にすると、認識前にページをモノクロ化し、弱い・ムラのあるスキャンをくっきりさせます。結果からは色が失われるため、色に意味があるページよりも、通常の文書での利用に適しています。
DOCはMicrosoft Wordで導入された文書ファイル形式で、.DOCという拡張子を使用します。テキストに加えて、ハイパーリンク、画像、グラフィック、表、高度な書式設定などの要素も含めることができます。
Microsoft Office 2007から、.DOCXという拡張子が導入されました。Microsoft Office Open XMLという国際標準を採用しており、よりアクセスしやすく、扱いやすい形式です。
新しいバージョンのMicrosoft Wordでは古いDOC形式を開くことができますが、DOCXファイルは古いバージョンでは開けません。開けたとしても、書式が崩れたり、文書の一部が欠けてしまう場合があります。
Word 2003以前で開く必要がある場合を除き、DOCXを選択してください。
変換方法が、結果を大きく左右する唯一の選択です。PDFの種類ごとに適した設定は次のとおりです。
| お使いのPDF | 変換方法 | 変換結果の目安 |
|---|---|---|
| テキストベースのPDF | 変換 | 元のテキストをそのまま維持 |
| スキャンページ | OCRで変換 | Wordで編集できるテキスト |
| 段組・表・フォーム | OCR(レイアウト方式) | ページの配置を維持 |
| 薄い・傾いたスキャン | OCR(テキスト認識方式) | 文字認識の精度を優先 |
| パスワード保護付き | 非対応 | 保護されたPDFは変換できません |
DOCXかDOCかは別の選択肢で、ここに挙げたすべてに適用されます。
PDFをWordに変換する方法を確認
上部にPDF文書をアップロードしてください。
必要なMicrosoft Wordのバージョンを選択してください。
任意: OCR方法の選択や元のテキストの言語指定などで、変換結果をさらに改善できます。
「開始」をクリックします。
はい。PDFからWordへの変換は無料で、アカウントも不要です。PDFをアップロードし、DOCXかDOCを選び、変換方法で「OCRで変換」を選択してから、Wordファイルをダウンロードしてください。サブスクリプションでは、アップロード可能なサイズや一括処理の長さが増え、優先処理が追加されます。
スキャンPDFをアップロードし、変換方法で「OCRで変換」を選び、文書の言語を指定します。文字認識が各ページの文字を読み取り、編集可能なテキストとしてWordファイルに書き込みます。
OCR とは?光学式文字認識 (Optical Character Recognition) は、スキャンした文書や画像内の文字、数字、記号を識別するための技術です。OCR コンバーターを使うと、これらのファイルからテキストを抽出し、変更、編集、印刷、保存できるようになります。
チャットアシスタントはPDFを読み取り、テキストをチャット画面に返すことができます。文書に関する質問には役立ちますが、ファイル全体が必要な場合には向きません。長い文書は書き起こしではなく要約され、見出し・表・画像も再構築されません。この変換ツールは全ページに文字認識を行い、開いて編集できるWordファイルとして返します。
見出し、段落、リスト、表、画像はWordファイル内で再構築されます。ただし、凝ったレイアウトは再現されにくく、段組ページ、特殊なフォント、ヘッダーやフッターなどのページ装飾は位置が変わることがあります。レイアウトモードを使うと、元のレイアウトに最も近い結果になります。
DOCX を選択してください。これは 2007 年以降の Microsoft Word で使われている形式で、Google ドキュメント、LibreOffice、Pages でも開くことができます。Word 2003 以前で開く必要がある場合のみ DOC を選択してください。
対応している元の言語は 124 で、アラビア語、中国語、ヒンディー語からポーランド語、トルコ語、ベトナム語まで含まれます。よく似た文字を区別するため、認識ではこの情報を使用するので、開始前に文書に含まれるすべての言語を選択してください。
はい。必要なだけ PDF を追加すると、一度にまとめて変換され、それぞれが同じ設定が適用された個別の Word 文書として返されます。
主な原因は 2 つあります。パスワードで保護されている、またはその他の制限がかけられている PDF は変換できず、破損したファイルはまったく読み込めません。PDF が自分のコンピュータで通常どおり開けること、そして無料アップロードの上限である 100 MB 以内であることを確認してください。
アップロードとダウンロードはすべて暗号化された接続で行われ、処理は欧州連合内の ISO 27001 認証データセンターで実行されます。変換は完全に自動化されているため、誰もあなたの文書を閲覧せず、第三者と共有されることもなく、ファイルが AI モデルの学習に使われることもありません。PDF と Word ファイルの著作権と所有権は、どちらもあなたに残ります。
ファイルに対して高度なテキスト認識をオンラインで利用できます。以下のOCRツールから選択してください。