扫描 PDF 转文本

此工具可将扫描版 PDF 转换为可编辑文本,方便你复制、编辑并添加内容。

上传文件

或拖放、粘贴,或从云端选择

粘贴 URL 试用示例
Google Drive Dropbox OneDrive
100% 免费 无须安装 安全且私密
广告
信任我们的用户
eBay Booking.com University of Michigan Cornell University Columbia University
为此工具评分
0/5 · 0

扫描版 PDF 什么时候需要 OCR,什么时候不需要

将扫描版 PDF 转成文本,其实是两项不同的工作,转换器会让你选择执行哪一种。已经包含真实字符的 PDF 只需要读取即可。只包含页面图片的 PDF 必须先识别,因为里面还没有任何文字。

你可以在几秒内分辨它们。用任意阅读器打开文件并尝试选择一行文字。如果单词能被高亮,说明 PDF 有文本层,只需选择“转换”,文字就会按原样导出。如果没有任何高亮,或整页被当作一个块高亮,那就是扫描件,需要进行光学字符识别。

这一项选择解释了为什么许多工具会给出令人失望的结果。只按单一路径处理所有上传文件的转换器,对一部分文件会输出干净文本,对另外一部分则是空白页面,而且不会说明原因。自己选择引擎,就不用再猜测。

如何从扫描版 PDF 文档中复制文本

你无法在扫描件中拖动光标穿过一句话,因为那里没有任何可选中的内容。从扫描版 PDF 中提取文本可以解决这个问题:上传文件,运行转换,你会得到一个纯文本文件,之后就可以复制、粘贴到邮件中,或在任意编辑器中用查找命令搜索。

输出文件为 .txt,因此在任何电脑和手机上都能打开,无需专用软件。它保留文字和换行,舍弃排版布局,当你需要的是内容而不是页面的外观时,这是合适的取舍。

可以一次上传多个扫描件。每个 PDF 会单独转换,并各自返回为一个文本文件,同一引擎和语言设置会应用到所有文件。

什么是 TXT 文件?

.txt 文件扩展名用于纯文本文件。这些文件由多行文本组成,可在不同平台和设备上的各种文本编辑器中打开,文本本身不包含任何格式。

这也是为什么它是存放从扫描件中恢复文字的最安全格式。此类文件不会过时,也不需要授权才能打开,而且在生成原文件的程序被替换很久之后,文字仍然可以正常阅读。

文件扩展名:.txt,MIME 类型:text/plain

维基百科上的 TXT

如何选择 OCR 引擎

这里有 5 种读取扫描版 PDF 的方式,你可以在设置面板中切换。选择最符合当前文件的一种。

OCR 引擎 适用于
转换 PDF 已经包含可选择的文本。不执行识别,文字将按原样导出。
标准 OCR 扫描件干净、端正且清晰。这是从扫描版 PDF 到文本最快的路径。
高级 AI-OCR 扫描件较淡、分辨率低或略微歪斜,并且标准引擎会漏字。
高级 AI-OCR+ 页面带有阴影、光线不均或中缝弯曲,这在拍摄书本时很常见。
照片 OCR 文字是拍照而非扫描得到的,例如牌子、标签或屏幕。

转换器支持识别 124 种源语言,包括支持竖排的简体和繁体中文,以及阿塞拜疆语、塞尔维亚语和乌兹别克语的西里尔字母形式。请选择文件中出现的所有语言。

把扫描版 PDF 转成文本的常见原因

扫描件中的文字被锁在图像里。以下这些情况中,将文字提取出来可以省下最多的工作量。

需要搜索的文书

发票、合同、收据和信件通常以扫描件形式收到。提取出文字后,你就可以按金额、日期或姓名来查找,而不用逐页通读。

学习和研究资料

图书馆扫描件、期刊文章和书页都可以被引用。将文字提取一次后,只需把所需段落粘贴到笔记中,而不必重新输入。

记录与档案

较早的文件通常以篇幅较长的多页扫描件保存。一次上传多个文件,转换器会在一次运行中批量处理。

你的数据受到保护

你扫描的纸张和你转换的文件可能包含个人信息。以下说明会准确告诉你我们的处理方式。

TLS 加密

所有上传和下载都通过加密连接进行,传输中的文件无法被读取。

无人工访问

文字识别完全自动化。不会有人阅读你的扫描件或文档,也不会与第三方共享任何内容。

ISO 27001 数据中心

处理过程在欧盟境内的认证数据中心中进行。

如何将扫描版 PDF 转换为文本?

1

上传

上传扫描版 PDF。

2

选择

选择适合你文件的 OCR 引擎。如果 PDF 中文本已经可选,请使用“转换”。

3

调整

选择 PDF 文档的语言,以获得更好的识别效果(可选)。

4

转换

开始转换,并等待文件生成后下载。

扫描版 PDF 转文本常见问题

这个扫描 PDF 转文本工具是免费的吗?

是的。将扫描版 PDF 转成文本是免费的,也不需要账户。上传文件、选择引擎并下载结果即可。大小不超过 100 MB 的文件都在免费范围内,只在处理更大的文件和更长的批量时才需要套餐。

我可以免费给 PDF 做 OCR 吗?

可以。标准 OCR 是免费的引擎,处理普通扫描件无需注册。3 个高级 AI 引擎则用于标准引擎无法识别的页面,例如模糊复印件或在弱光下拍摄的照片。

为什么我的扫描版 PDF 必须用 OCR 才能提取文本?

因为文件中保存的是页面图片而不是字符。扫描仪拍摄的是纸张,所以每个单词都是像素图案。光学字符识别会读取这些像素并写出真实字符,使文本可以被选择、搜索和编辑。

如何从扫描版 PDF 中复制文字?

在上方上传 PDF,选择一个 OCR 引擎并开始转换。结果是一个可以在任意编辑器中打开并复制的纯文本文件。只有当 PDF 已经包含文本层时,才能直接从 PDF 阅读器中复制。

文字识别可以读取哪些语言?

它支持识别 124 种源语言,包括支持竖排的简体和繁体中文,以及阿塞拜疆语、塞尔维亚语和乌兹别克语的西里尔字母变体。请选择文件中出现的所有语言,因为在一页混合多种语言时,把它们全部列出才能获得更好的识别效果。

我可以把扫描版 PDF 转成 Word 吗?

不能在此页面实现,这里只生成纯文本文件。它保留文字并舍弃排版布局。如果你需要带格式的 DOC 或 DOCX,请使用 Convert to Word app,该应用使用相同的文本识别并输出 Word 文档。

为什么提取出来的文字不对?

识别质量取决于扫描质量。页面歪斜、分辨率低、纸面有阴影或手持拍摄的照片都会降低准确度。对于不完美的扫描件,请尝试 Advanced AI-OCR,对于光线很差的照片,请使用 Advanced AI-OCR+,并在条件允许时以 300 dpi 重新扫描。被密码保护或已损坏的源文件将无法转换。

我的扫描文件是私密的吗?

是的。上传和下载都通过加密连接完成,处理过程在欧盟境内的认证数据中心进行,整个流程自动化,没有人会查看你的扫描件。你的文件绝不会被用于训练 AI 模型,你也始终保留对文件的权利。

了解更多文本识别信息

一本打开的书放在黄色桌面上,被扫描框架围住,页面上印有标题 Save Valuable Text With OCR
操作指南

使用 OCR 保存重要文本

使用 OCR(光学字符识别)将扫描文档和图像中的重要文本数字化。在线轻松从图像中提取文本。

阅读文章