为什么要把PDF转换成Microsoft Word?这样可以让你的PDF文件可编辑。复制文本、编辑PDF等。
或拖放、粘贴,或从云端选择
将 PDF 页面转换为可编辑的 Word 文件。
PDF 会将每一行固定在页面上。将 PDF 转换为 Word 后,你会得到一个可以在 Microsoft Word、Google Docs 或 LibreOffice 中重新输入、重排和重复使用的文档。
将转换方式切换为 OCR,转换器会从每个扫描页面中识别字母。导入 Word 的将是可搜索和可更正的文本,而不是页面图片。
标题、段落、列表、表格和图片都会在 Word 文件中重建。版式模式会尽量保持页面排版,而不是把所有内容挤进一列。
扫描页面本质上是图片,因此普通转换只会把这些图片放进 Word 文件。将“转换方式”设为“使用 OCR 转换”,文本识别会先从每一页读出字符,再将它们以可编辑文本写入 Word 文档。
有一个快速方法可以判断你手上的是哪种 PDF。打开文件并尝试选中一行文字。如果这行被高亮,说明文件中已经包含文本,不需要 OCR。如果无法高亮,页面就是图片,此时应当启用 OCR。
OCR 默认是关闭的,这是刻意为之。从 Word、LaTeX 或排版工具导出的 PDF 已包含精确文本,不用 OCR 转换可以保留每个字符的原貌。对这类文件运行 OCR 既更慢,也只能“猜测”本就存在的文字。
输入文件为 PDF。你可以一次添加多个,每个都会转换为各自独立的 Word 文档。
OCR 方式有两种设置,且侧重点不同。版式模式优先保留页面排版,适合表单、表格以及分栏内容。文本识别模式则将字符准确率放在首位,更适合内容密集、字迹模糊或扫描质量不佳的文件。
OCR 语言是影响结果最大的设置。从 124 种语言中选择文档所用语言,识别时会用它们来区分形似字符。文档混合多种语言时,可同时选择多种语言。
“改进 OCR”会在识别前将页面转为单色,以增强较弱或光线不均的扫描效果。结果中的颜色会被去除,因此更适合内容为主的文档,而不适用于依赖颜色表达含义的页面。
DOC 是由 Microsoft Word 推出的文档文件格式,使用 .DOC 文件扩展名。除了文本外,这些文件还可以包含超链接、图像、图形、表格、高级格式和其他元素。
随着 Microsoft Office 2007 的发布,引入了 .DOCX 文件扩展名。它采用 Microsoft Office Open XML 国际标准,使这种格式更易访问和使用。
较新版本的 Microsoft Word 可以打开旧的 DOC 格式,但旧版本无法打开 DOCX 文件。即使可以打开,格式也可能错乱,或文档的部分内容丢失。
除非必须在 Word 2003 或更早版本中打开,否则请选择 DOCX。
转换方式是最会影响结果的选择。不同类型的 PDF 适合不同方式。
| 你的 PDF | 转换方式 | 转换结果 |
|---|---|---|
| 文本型 PDF | 转换 | 原始文本,不作改动 |
| 扫描页面 | 使用 OCR 转换 | 可以在 Word 中编辑的文本 |
| 分栏、表格或表单 | OCR,版式模式 | 页面排版被保留 |
| 模糊或倾斜的扫描件 | OCR,文本识别模式 | 字符识别更准确 |
| 受密码保护 | 不支持 | 受保护的 PDF 无法转换 |
DOCX 或 DOC 是单独的选择,适用于上述所有情况。
了解如何将PDF转换为Word
在上方上传你的 PDF 文档。
选择你需要的 Microsoft Word 版本。
可选:通过选择 OCR 方法、指定源文本语言等方式来提升转换效果。
点击 "Start"。
可以。PDF 转 Word 转换器免费使用且无需账户。上传 PDF,选择 DOCX 或 DOC,将转换方式设为“使用 OCR 转换”,然后下载 Word 文件。订阅只会增加可上传文件大小、更长的批处理以及优先处理权。
上传扫描版 PDF,将“转换方式”设置为“使用 OCR 转换”,并选择文档所用语言。文本识别会从每一页读出字符,并以可编辑文本写入 Word 文件。
什么是 OCR?光学字符识别用于识别扫描文档或图像中的字母、数字或特殊字符。使用 OCR 转换器,你可以从这些文件中提取文本,以便进行修改、编辑、打印或保存。
聊天助手可以读取 PDF,并在聊天窗口中将文本复述给你。这在回答关于文档的问题时有用,但在你需要整个文件时就不够了:长文档往往会被总结而不是逐字转录,标题、表格和图片也不会被重建。本转换器会对每一页运行识别,并返回一个可以直接打开和编辑的 Word 文件。
标题、段落、列表、表格和图片都会在 Word 文件中重建。复杂页面设计的迁移效果会差一些:多栏页面、非常规字体以及页眉页脚等页面元素可能位置发生变化。版式模式可以让结果尽量接近原稿。
请选择 DOCX。这是 Microsoft Word 自 2007 年以来使用的格式,Google Docs、LibreOffice 和 Pages 都可以打开。只有在文件必须在 Word 2003 或更早版本中打开时,才选择 DOC。
支持 124 种源语言,从阿拉伯语、中文、印地语到波兰语、土耳其语和越南语。在开始前,请选择文档中包含的所有语言,因为识别会利用这些信息来区分相似字符。
可以。添加任意数量的 PDF,它们将一次性转换完成,每个都会以独立的 Word 文档返回,并应用相同的设置。
大多数失败有两个原因:PDF 受密码保护或有其他限制时无法转换,文件损坏时则完全无法读取。请检查 PDF 能否在你的电脑上正常打开,并确认文件大小在 100 MB 的免费上传限制内。
Every upload and download runs over an encrypted connection, and files are stored on servers with full-disk encryption. The conversion is fully automated, so nobody reads your document, nothing is shared with third parties, and your files are never used to train AI models. You keep the copyright and ownership of both the PDF and the Word file.
在线为你的文件使用高级文字识别。请在下方选择一个 OCR 工具: