mousePDF · PDF文本识别(OCR)
pdf ocr · 文本识别 · 无需上传

PDF文本识别(OCR)——无需上传

在扫描或以图片形式呈现的PDF页面上叠加一层不可见、可搜索的文本层。识别过程完全在你的浏览器中进行,你的文件永远不会被上传。

✓ 不会上传任何内容 ✓ 完全免费 ✓ 无需账户
广告
mousePDF 编辑器的屏幕截图
使用方法

三个步骤

01

打开PDF

把扫描件或基于图片的PDF拖入窗口,或直接选择文件。

02

选择语言与范围

设置识别语言,并决定只识别当前页面还是整个文档。

03

导出

保存带有可搜索、不可见文本层的PDF——页面图像的外观保持不变。

典型场景:让扫描文档变得可搜索

扫描的合同、发票或书籍往往只包含页面图像,没有真正的文字——既无法在其中搜索,也无法复制文字。mousePDF会在浏览器本地识别文字,并将其不可见地叠加在图片上,让搜索和复制成为可能,而页面的外观不会有任何变化。

广告

在浏览器中进行文本识别——它的特别之处

OCR是那种通常几乎必须上传文件才能完成的任务之一:识别需要一个语言模型,而这类模型通常存放在服务器上。这里的情况是模型在你的浏览器中运行;被加载的只是模型本身,从来都不是你的文件。

这对那些你会去扫描的文档来说尤为重要:合同、工资单、诊断证明、身份证件复印件。扫描件本质上是一张图片——在它变得可搜索之前,必须有什么东西来“阅读”它。这个“阅读”过程发生在你自己设备上、你的浏览器里,这才是真正的区别所在。

OCR目前提供28种语言可选。所选语言的模型只有在真正开始识别时才会加载——这样页面本身保持轻量,你也只会加载你真正需要的内容。

识别功能的局限所在

非拉丁文字是有意排除在外的。不支持西里尔字母,不支持中文、日文或韩文,也不支持阿拉伯语、希伯来语、天城文或泰文。这些文字所需的模型体积明显更大,识别准确率也明显更低——一个需要逐字逐句校对的结果,对任何人都没有帮助。希腊语则被包含在内,因为在这方面它并不属于同一类问题。

识别永远不会完全无误。它是从像素中反推出曾经存在的文字。一份干净、方向端正的扫描件能得到非常好的结果;而一张光线不佳、角度倾斜的手机照片、潦草的手写字或不常见的装饰字体,结果会明显更差。打算继续使用这些文字的人应当校对一遍——这适用于任何经过OCR处理的版本,不仅仅是这里的这一份。

页面的外观不会改变。识别出的文字会作为不可见的图层叠加在图片上:你看到的仍然是原来的扫描件,但可以在其中搜索和选中文字。因此识别错误在图片上是看不出来的——只有当你把文字复制出来时才会显现。

压缩PDF之后,OCR同样很有用:压缩过程会把页面变成图片,从而丢失原有的文本层——文本识别可以重新为它建立文本层。

常见问题

常见问题

我的文档在进行文本识别时会被上传吗? +

不会。识别过程完全通过本地加载的OCR引擎在浏览器中完成——文件永远不会离开你的设备。

支持哪些语言? +

支持相当多使用拉丁字母或希腊字母的欧洲语言。目前OCR尚不支持中文、阿拉伯语、西里尔字母或天城文等文字。

识别需要多长时间? +

根据页数和设备性能不同,从几秒钟到几分钟不等。

文本识别会改变页面的外观吗? +

不会。页面图像保持完全一致,识别出的文本层不可见地叠加在其上——由此带来的仅仅是搜索和复制功能。

对于扫描质量差或手写的文档,识别效果如何? +

识别功能在清晰印刷、易于阅读的文本上效果最好。对于手写笔记或噪点较多的扫描件,准确率会下降——这时可能会出现个别字符被误识别或缺失的情况。

支持识别哪些语言? +

共28种,全部使用拉丁字母,外加希腊语。西里尔字母、中文、阿拉伯语、希伯来语或泰文等非拉丁文字是有意不包含在内的——因为在这些文字上的识别准确率会明显更差。

识别的准确度如何? +

对于清晰、端正的扫描件,效果非常好;而对于角度倾斜的手机照片、光线不佳或手写文字,效果会明显下降。打算继续使用这些文字的人应当校对一遍。

文本识别之后我的文档看起来会不一样吗? +

不会。识别出的文字会作为不可见的图层叠加在图片之上——页面看起来和之前一样,但已经可以被搜索。

其他工具

这些工具也可能有帮助

压缩PDF

大幅缩小图片较多的PDF——页面会因此变为图片。

转换PDF为PDF/A

转换为适合归档的PDF/A格式——适用于政府机构和长期存储。

转换PDF为Word

将PDF文本导出为可编辑的Word文件——无需上传。

编辑PDF文本

点击PDF中已有的文本并替换为新内容。

广告

打开编辑器 →