本地 OCR:让每一页扫描都可搜索
Paper Scanner 使用 Apple 与 Google 设备端机器学习套件在本地完成 OCR,支持拉丁字母与中日韩文字。本文说明 OCR 能力、适用场景、准确率最佳实践与语言支持。
OCR(光学字符识别)将扫描页面转换为可选中、可复制、可搜索的文本。Paper Scanner 的 OCR 完全在设备本地运行,使用 Apple 与 Google 的设备端机器学习套件,扫描内容不会上传到任何外部服务器进行识别。已识别的页面会在本地文档库中建立索引,保存后即可检索。
OCR 后的能力
页面被识别后,可以进行以下操作:
- 从扫描中复制文字。 长按任意一个词,弹出覆盖整页的选择浮层。选中的文本可粘贴到任何其他应用。
- 在扫描内搜索。 文档列表顶部的搜索框会检索每一页的识别文本,不限于标题和标签。电话号码、姓名、发票号、地址都可以在整个文档库中定位。
- 引用与回溯。 扫描的收据、合同、手写笔记、白板照片都可以成为后续可引用的文本。
为何选择设备端处理
- 隐私。 扫描内容从不上传至外部服务器进行识别。对发票、合同、医疗表格、任何含个人数据的文档均适用。
- 延迟。 无网络往返。在近几年 iPhone 与旗舰 Android 设备上,普通页面的 OCR 通常在一秒内完成。
- 离线可用。 在飞机上、地下室、无网络覆盖的地区都能识别,无需联网。
准确率与云端 OCR 服务相当;区别在于计算发生的位置。
适用场景
- 报销录入。 从扫描的收据复制商户名、日期、金额到报销应用。
- 名片归档。 提取名片中的联系信息,免去手动录入。
- 文档引用。 在邮件或消息中引用合同或协议的特定条款。
- 文档库搜索。 按任意关键词定位任何含该关键词的扫描文档。
- 多语言内容。 一页内混排多种语言(例如中英双语菜单、带英文注释的中文合同)可一次识别完成。
提高识别准确率的最佳实践
OCR 准确率主要取决于输入质量。按重要性排序,三个关键因素:
- 光线。 来自窗户的间接均匀光优于头顶一个聚光灯。横跨页面的阴影是字符误读最常见的原因。
- 对焦。 若自动对焦选错了对象,拍摄前点击文字中央重新对焦。模糊的扫描基本不可用。
- 滤镜选择。 印刷表格用黑白最干净。墨水褪色或纸张发黄时推荐魔法色彩滤镜。日常大多数场景可直接使用 Auto。
- 页面平整。 向书脊弯曲的页面在内边距处会丢字符。能压平就用另一只手压一下。
- 语言提示。 单语言页面(例如纯中文)显式指定 OCR 语言以提升准确率。混排语言页面无需提示也能一次识别完成。
准确率限制
OCR 在印刷体上表现良好(95%+ 准确率),但以下场景准确率较低:
- 手写花体字,尤其是非拉丁字母手写体。手写识别准确率通常在 60–80%,因书写人而异。
- 极小字号——脚注、小字印刷、电子产品背面的零件号。
- 艺术或装饰字体,字形不标准。
- 光面杂志,反光纹理干扰字符识别。
- 长期放置已褪色的收据,墨水物理消失。
所有情况下原始图像均保留。如 OCR 在关键页面失败,扫描图像本身仍可阅读。
免费版与 Pro
免费版每日提供一定额度的 OCR,足以应对日常收据、名片与偶尔一章书的识别需求。Pro 解除每日上限,并支持一键识别整个文件夹。对于有积压未识别扫描的文档库,Pro 是最高效的批量处理方式。
支持的语言
设备端引擎支持拉丁字母(英、法、德、西、葡、意及其他)、中文(简繁)、日文、韩文以及大部分欧洲文字。混排语言页面在一次识别中完成。
相关文章
云同步:将文档库镜像至自己的 Drive 或 iCloud
Paper Scanner 可将文档库镜像至用户自己的 Google Drive 或 iCloud 文件夹。本文说明功能范围、适用场景、配置步骤与恢复流程,并提供迁移指引。
文件夹与标签:构建可检索的文档库
Paper Scanner 在同一文档库内同时支持嵌套文件夹与多对多标签。两种模型回答不同问题,本文说明何时使用、如何配合,并在常见检索、归档等使用场景下给出具体组合建议。
多页 PDF 合并导出与可选密码保护
Paper Scanner 的导出流程可将多页扫描合并为单一 PDF,并支持可选密码保护。本文介绍标准流程、合并与拆分取舍、密码设置与大批量处理,并给出配置建议。
免费版与 Pro:功能范围、定价与订阅机制
Paper Scanner Pro 解锁无限 OCR、去除横幅广告、加入后台自动云同步。本文说明各档位包含的内容、谁适合订阅、以及订阅到期后的处理方式,并给出选档建议。