此工具可将扫描版 PDF 转换为可编辑文本,方便你复制、编辑并添加内容。
或拖放、粘贴,或从云端选择
将扫描版 PDF 转成文本,其实是两项不同的工作,转换器会让你选择执行哪一种。已经包含真实字符的 PDF 只需要读取即可。只包含页面图片的 PDF 必须先识别,因为里面还没有任何文字。
你可以在几秒内分辨它们。用任意阅读器打开文件并尝试选择一行文字。如果单词能被高亮,说明 PDF 有文本层,只需选择“转换”,文字就会按原样导出。如果没有任何高亮,或整页被当作一个块高亮,那就是扫描件,需要进行光学字符识别。
这一项选择解释了为什么许多工具会给出令人失望的结果。只按单一路径处理所有上传文件的转换器,对一部分文件会输出干净文本,对另外一部分则是空白页面,而且不会说明原因。自己选择引擎,就不用再猜测。
你无法在扫描件中拖动光标穿过一句话,因为那里没有任何可选中的内容。从扫描版 PDF 中提取文本可以解决这个问题:上传文件,运行转换,你会得到一个纯文本文件,之后就可以复制、粘贴到邮件中,或在任意编辑器中用查找命令搜索。
输出文件为 .txt,因此在任何电脑和手机上都能打开,无需专用软件。它保留文字和换行,舍弃排版布局,当你需要的是内容而不是页面的外观时,这是合适的取舍。
可以一次上传多个扫描件。每个 PDF 会单独转换,并各自返回为一个文本文件,同一引擎和语言设置会应用到所有文件。
.txt 文件扩展名用于纯文本文件。这些文件由多行文本组成,可在不同平台和设备上的各种文本编辑器中打开,文本本身不包含任何格式。
这也是为什么它是存放从扫描件中恢复文字的最安全格式。此类文件不会过时,也不需要授权才能打开,而且在生成原文件的程序被替换很久之后,文字仍然可以正常阅读。
文件扩展名:.txt,MIME 类型:text/plain
维基百科上的 TXT这里有 5 种读取扫描版 PDF 的方式,你可以在设置面板中切换。选择最符合当前文件的一种。
| OCR 引擎 | 适用于 |
|---|---|
| 转换 | PDF 已经包含可选择的文本。不执行识别,文字将按原样导出。 |
| 标准 OCR | 扫描件干净、端正且清晰。这是从扫描版 PDF 到文本最快的路径。 |
| 高级 AI-OCR | 扫描件较淡、分辨率低或略微歪斜,并且标准引擎会漏字。 |
| 高级 AI-OCR+ | 页面带有阴影、光线不均或中缝弯曲,这在拍摄书本时很常见。 |
| 照片 OCR | 文字是拍照而非扫描得到的,例如牌子、标签或屏幕。 |
转换器支持识别 124 种源语言,包括支持竖排的简体和繁体中文,以及阿塞拜疆语、塞尔维亚语和乌兹别克语的西里尔字母形式。请选择文件中出现的所有语言。
扫描件中的文字被锁在图像里。以下这些情况中,将文字提取出来可以省下最多的工作量。
发票、合同、收据和信件通常以扫描件形式收到。提取出文字后,你就可以按金额、日期或姓名来查找,而不用逐页通读。
图书馆扫描件、期刊文章和书页都可以被引用。将文字提取一次后,只需把所需段落粘贴到笔记中,而不必重新输入。
较早的文件通常以篇幅较长的多页扫描件保存。一次上传多个文件,转换器会在一次运行中批量处理。
你扫描的纸张和你转换的文件可能包含个人信息。以下说明会准确告诉你我们的处理方式。
所有上传和下载都通过加密连接进行,传输中的文件无法被读取。
文字识别完全自动化。不会有人阅读你的扫描件或文档,也不会与第三方共享任何内容。
处理过程在欧盟境内的认证数据中心中进行。
上传扫描版 PDF。
选择适合你文件的 OCR 引擎。如果 PDF 中文本已经可选,请使用“转换”。
选择 PDF 文档的语言,以获得更好的识别效果(可选)。
开始转换,并等待文件生成后下载。
是的。将扫描版 PDF 转成文本是免费的,也不需要账户。上传文件、选择引擎并下载结果即可。大小不超过 100 MB 的文件都在免费范围内,只在处理更大的文件和更长的批量时才需要套餐。
可以。标准 OCR 是免费的引擎,处理普通扫描件无需注册。3 个高级 AI 引擎则用于标准引擎无法识别的页面,例如模糊复印件或在弱光下拍摄的照片。
因为文件中保存的是页面图片而不是字符。扫描仪拍摄的是纸张,所以每个单词都是像素图案。光学字符识别会读取这些像素并写出真实字符,使文本可以被选择、搜索和编辑。
在上方上传 PDF,选择一个 OCR 引擎并开始转换。结果是一个可以在任意编辑器中打开并复制的纯文本文件。只有当 PDF 已经包含文本层时,才能直接从 PDF 阅读器中复制。
它支持识别 124 种源语言,包括支持竖排的简体和繁体中文,以及阿塞拜疆语、塞尔维亚语和乌兹别克语的西里尔字母变体。请选择文件中出现的所有语言,因为在一页混合多种语言时,把它们全部列出才能获得更好的识别效果。
不能在此页面实现,这里只生成纯文本文件。它保留文字并舍弃排版布局。如果你需要带格式的 DOC 或 DOCX,请使用 Convert to Word app,该应用使用相同的文本识别并输出 Word 文档。
识别质量取决于扫描质量。页面歪斜、分辨率低、纸面有阴影或手持拍摄的照片都会降低准确度。对于不完美的扫描件,请尝试 Advanced AI-OCR,对于光线很差的照片,请使用 Advanced AI-OCR+,并在条件允许时以 300 dpi 重新扫描。被密码保护或已损坏的源文件将无法转换。
是的。上传和下载都通过加密连接完成,处理过程在欧盟境内的认证数据中心进行,整个流程自动化,没有人会查看你的扫描件。你的文件绝不会被用于训练 AI 模型,你也始终保留对文件的权利。
这些功能全部在浏览器中运行。无需安装,无需账户,并使用相同的文本识别技术。