此工具可将扫描版 PDF 转换为可编辑文本,方便你复制、编辑并添加内容。
或拖放、粘贴,或从云端选择
将扫描版 PDF 转成文本,其实是两项不同的工作,转换器会让你选择执行哪一种。已经包含真实字符的 PDF 只需要读取即可。只包含页面图片的 PDF 必须先识别,因为里面还没有任何文字。
你可以在几秒内分辨它们。用任意阅读器打开文件并尝试选择一行文字。如果单词能被高亮,说明 PDF 有文本层,只需选择“转换”,文字就会按原样导出。如果没有任何高亮,或整页被当作一个块高亮,那就是扫描件,需要进行光学字符识别。
这一项选择解释了为什么许多工具会给出令人失望的结果。只按单一路径处理所有上传文件的转换器,对一部分文件会输出干净文本,对另外一部分则是空白页面,而且不会说明原因。自己选择引擎,就不用再猜测。
你无法在扫描件中拖动光标穿过一句话,因为那里没有任何可选中的内容。从扫描版 PDF 中提取文本可以解决这个问题:上传文件,运行转换,你会得到一个纯文本文件,之后就可以复制、粘贴到邮件中,或在任意编辑器中用查找命令搜索。
输出文件为 .txt,因此在任何电脑和手机上都能打开,无需专用软件。它保留文字和换行,舍弃排版布局,当你需要的是内容而不是页面的外观时,这是合适的取舍。
可以一次上传多个扫描件。每个 PDF 会单独转换,并各自返回为一个文本文件,同一引擎和语言设置会应用到所有文件。
.txt 文件扩展名用于纯文本文件。这些文件由多行文本组成,可在不同平台和设备上的各种文本编辑器中打开,文本本身不包含任何格式。
这也是为什么它是存放从扫描件中恢复文字的最安全格式。此类文件不会过时,也不需要授权才能打开,而且在生成原文件的程序被替换很久之后,文字仍然可以正常阅读。
文件扩展名:.txt,MIME 类型:text/plain
维基百科上的 TXT这里有 5 种读取扫描版 PDF 的方式,你可以在设置面板中切换。选择最符合当前文件的一种。
| OCR 引擎 | 适用于 |
|---|---|
| 转换 | PDF 已经包含可选择的文本。不执行识别,文字将按原样导出。 |
| 标准 OCR | 扫描件干净、端正且清晰。这是从扫描版 PDF 到文本最快的路径。 |
| 高级 AI-OCR | 扫描件较淡、分辨率低或略微歪斜,并且标准引擎会漏字。 |
| 高级 AI-OCR+ | 页面带有阴影、光线不均或中缝弯曲,这在拍摄书本时很常见。 |
| 照片 OCR | 文字是拍照而非扫描得到的,例如牌子、标签或屏幕。 |
转换器支持识别 124 种源语言,包括支持竖排的简体和繁体中文,以及阿塞拜疆语、塞尔维亚语和乌兹别克语的西里尔字母形式。请选择文件中出现的所有语言。
扫描件中的文字被锁在图像里。以下这些情况中,将文字提取出来可以省下最多的工作量。
发票、合同、收据和信件通常以扫描件形式收到。提取出文字后,你就可以按金额、日期或姓名来查找,而不用逐页通读。
图书馆扫描件、期刊文章和书页都可以被引用。将文字提取一次后,只需把所需段落粘贴到笔记中,而不必重新输入。
较早的文件通常以篇幅较长的多页扫描件保存。一次上传多个文件,转换器会在一次运行中批量处理。
你扫描的纸张和你转换的文件可能包含个人信息。以下说明会准确告诉你我们的处理方式。
所有上传和下载都通过加密连接进行,传输中的文件无法被读取。
文字识别完全自动化。不会有人阅读你的扫描件或文档,也不会与第三方共享任何内容。
Stored on servers with full-disk encryption, and backups are encrypted too.
上传扫描版 PDF。
选择适合你文件的 OCR 引擎。如果 PDF 中文本已经可选,请使用“转换”。
选择 PDF 文档的语言,以获得更好的识别效果(可选)。
开始转换,并等待文件生成后下载。
是的。将扫描版 PDF 转成文本是免费的,也不需要账户。上传文件、选择引擎并下载结果即可。大小不超过 100 MB 的文件都在免费范围内,只在处理更大的文件和更长的批量时才需要套餐。
可以。标准 OCR 是免费的引擎,处理普通扫描件无需注册。3 个高级 AI 引擎则用于标准引擎无法识别的页面,例如模糊复印件或在弱光下拍摄的照片。
因为文件中保存的是页面图片而不是字符。扫描仪拍摄的是纸张,所以每个单词都是像素图案。光学字符识别会读取这些像素并写出真实字符,使文本可以被选择、搜索和编辑。
在上方上传 PDF,选择一个 OCR 引擎并开始转换。结果是一个可以在任意编辑器中打开并复制的纯文本文件。只有当 PDF 已经包含文本层时,才能直接从 PDF 阅读器中复制。
它支持识别 124 种源语言,包括支持竖排的简体和繁体中文,以及阿塞拜疆语、塞尔维亚语和乌兹别克语的西里尔字母变体。请选择文件中出现的所有语言,因为在一页混合多种语言时,把它们全部列出才能获得更好的识别效果。
不能在此页面实现,这里只生成纯文本文件。它保留文字并舍弃排版布局。如果你需要带格式的 DOC 或 DOCX,请使用 Convert to Word app,该应用使用相同的文本识别并输出 Word 文档。
识别质量取决于扫描质量。页面歪斜、分辨率低、纸面有阴影或手持拍摄的照片都会降低准确度。对于不完美的扫描件,请尝试 Advanced AI-OCR,对于光线很差的照片,请使用 Advanced AI-OCR+,并在条件允许时以 300 dpi 重新扫描。被密码保护或已损坏的源文件将无法转换。
是的。上传和下载都通过加密连接完成,处理过程在欧盟境内的认证数据中心进行,整个流程自动化,没有人会查看你的扫描件。你的文件绝不会被用于训练 AI 模型,你也始终保留对文件的权利。
这些功能全部在浏览器中运行。无需安装,无需账户,并使用相同的文本识别技术。