PDF文本识别(OCR)——无需上传
在扫描或以图片形式呈现的PDF页面上叠加一层不可见、可搜索的文本层。识别过程完全在你的浏览器中进行,你的文件永远不会被上传。
三个步骤
打开PDF
把扫描件或基于图片的PDF拖入窗口,或直接选择文件。
选择语言与范围
设置识别语言,并决定只识别当前页面还是整个文档。
导出
保存带有可搜索、不可见文本层的PDF——页面图像的外观保持不变。
典型场景:让扫描文档变得可搜索
扫描的合同、发票或书籍往往只包含页面图像,没有真正的文字——既无法在其中搜索,也无法复制文字。mousePDF会在浏览器本地识别文字,并将其不可见地叠加在图片上,让搜索和复制成为可能,而页面的外观不会有任何变化。
在浏览器中进行文本识别——它的特别之处
OCR是那种通常几乎必须上传文件才能完成的任务之一:识别需要一个语言模型,而这类模型通常存放在服务器上。这里的情况是模型在你的浏览器中运行;被加载的只是模型本身,从来都不是你的文件。
这对那些你会去扫描的文档来说尤为重要:合同、工资单、诊断证明、身份证件复印件。扫描件本质上是一张图片——在它变得可搜索之前,必须有什么东西来“阅读”它。这个“阅读”过程发生在你自己设备上、你的浏览器里,这才是真正的区别所在。
OCR目前提供28种语言可选。所选语言的模型只有在真正开始识别时才会加载——这样页面本身保持轻量,你也只会加载你真正需要的内容。
识别功能的局限所在
非拉丁文字是有意排除在外的。不支持西里尔字母,不支持中文、日文或韩文,也不支持阿拉伯语、希伯来语、天城文或泰文。这些文字所需的模型体积明显更大,识别准确率也明显更低——一个需要逐字逐句校对的结果,对任何人都没有帮助。希腊语则被包含在内,因为在这方面它并不属于同一类问题。
识别永远不会完全无误。它是从像素中反推出曾经存在的文字。一份干净、方向端正的扫描件能得到非常好的结果;而一张光线不佳、角度倾斜的手机照片、潦草的手写字或不常见的装饰字体,结果会明显更差。打算继续使用这些文字的人应当校对一遍——这适用于任何经过OCR处理的版本,不仅仅是这里的这一份。
页面的外观不会改变。识别出的文字会作为不可见的图层叠加在图片上:你看到的仍然是原来的扫描件,但可以在其中搜索和选中文字。因此识别错误在图片上是看不出来的——只有当你把文字复制出来时才会显现。
压缩PDF之后,OCR同样很有用:压缩过程会把页面变成图片,从而丢失原有的文本层——文本识别可以重新为它建立文本层。
常见问题
我的文档在进行文本识别时会被上传吗? +
不会。识别过程完全通过本地加载的OCR引擎在浏览器中完成——文件永远不会离开你的设备。
支持哪些语言? +
支持相当多使用拉丁字母或希腊字母的欧洲语言。目前OCR尚不支持中文、阿拉伯语、西里尔字母或天城文等文字。
识别需要多长时间? +
根据页数和设备性能不同,从几秒钟到几分钟不等。
文本识别会改变页面的外观吗? +
不会。页面图像保持完全一致,识别出的文本层不可见地叠加在其上——由此带来的仅仅是搜索和复制功能。
对于扫描质量差或手写的文档,识别效果如何? +
识别功能在清晰印刷、易于阅读的文本上效果最好。对于手写笔记或噪点较多的扫描件,准确率会下降——这时可能会出现个别字符被误识别或缺失的情况。
支持识别哪些语言? +
共28种,全部使用拉丁字母,外加希腊语。西里尔字母、中文、阿拉伯语、希伯来语或泰文等非拉丁文字是有意不包含在内的——因为在这些文字上的识别准确率会明显更差。
识别的准确度如何? +
对于清晰、端正的扫描件,效果非常好;而对于角度倾斜的手机照片、光线不佳或手写文字,效果会明显下降。打算继续使用这些文字的人应当校对一遍。
文本识别之后我的文档看起来会不一样吗? +
不会。识别出的文字会作为不可见的图层叠加在图片之上——页面看起来和之前一样,但已经可以被搜索。
这些工具也可能有帮助
压缩PDF
大幅缩小图片较多的PDF——页面会因此变为图片。
转换PDF为PDF/A
转换为适合归档的PDF/A格式——适用于政府机构和长期存储。
转换PDF为Word
将PDF文本导出为可编辑的Word文件——无需上传。
编辑PDF文本
点击PDF中已有的文本并替换为新内容。