跳转到正文
Paper Scanner
返回博客

本地 OCR:让每一页扫描都可搜索

Paper Scanner 使用 Apple 与 Google 设备端机器学习套件在本地完成 OCR,支持拉丁字母与中日韩文字。本文说明 OCR 能力、适用场景、准确率最佳实践与语言支持。

P Paper Scanner Team · · 1 分钟阅读

OCR(光学字符识别)将扫描页面转换为可选中、可复制、可搜索的文本。Paper Scanner 的 OCR 完全在设备本地运行,使用 Apple 与 Google 的设备端机器学习套件,扫描内容不会上传到任何外部服务器进行识别。已识别的页面会在本地文档库中建立索引,保存后即可检索。

OCR 后的能力

页面被识别后,可以进行以下操作:

  • 从扫描中复制文字。 长按任意一个词,弹出覆盖整页的选择浮层。选中的文本可粘贴到任何其他应用。
  • 在扫描内搜索。 文档列表顶部的搜索框会检索每一页的识别文本,不限于标题和标签。电话号码、姓名、发票号、地址都可以在整个文档库中定位。
  • 引用与回溯。 扫描的收据、合同、手写笔记、白板照片都可以成为后续可引用的文本。

为何选择设备端处理

  • 隐私。 扫描内容从不上传至外部服务器进行识别。对发票、合同、医疗表格、任何含个人数据的文档均适用。
  • 延迟。 无网络往返。在近几年 iPhone 与旗舰 Android 设备上,普通页面的 OCR 通常在一秒内完成。
  • 离线可用。 在飞机上、地下室、无网络覆盖的地区都能识别,无需联网。

准确率与云端 OCR 服务相当;区别在于计算发生的位置。

适用场景

  • 报销录入。 从扫描的收据复制商户名、日期、金额到报销应用。
  • 名片归档。 提取名片中的联系信息,免去手动录入。
  • 文档引用。 在邮件或消息中引用合同或协议的特定条款。
  • 文档库搜索。 按任意关键词定位任何含该关键词的扫描文档。
  • 多语言内容。 一页内混排多种语言(例如中英双语菜单、带英文注释的中文合同)可一次识别完成。

提高识别准确率的最佳实践

OCR 准确率主要取决于输入质量。按重要性排序,三个关键因素:

  1. 光线。 来自窗户的间接均匀光优于头顶一个聚光灯。横跨页面的阴影是字符误读最常见的原因。
  2. 对焦。 若自动对焦选错了对象,拍摄前点击文字中央重新对焦。模糊的扫描基本不可用。
  3. 滤镜选择。 印刷表格用黑白最干净。墨水褪色或纸张发黄时推荐魔法色彩滤镜。日常大多数场景可直接使用 Auto。
  4. 页面平整。 向书脊弯曲的页面在内边距处会丢字符。能压平就用另一只手压一下。
  5. 语言提示。 单语言页面(例如纯中文)显式指定 OCR 语言以提升准确率。混排语言页面无需提示也能一次识别完成。

准确率限制

OCR 在印刷体上表现良好(95%+ 准确率),但以下场景准确率较低:

  • 手写花体字,尤其是非拉丁字母手写体。手写识别准确率通常在 60–80%,因书写人而异。
  • 极小字号——脚注、小字印刷、电子产品背面的零件号。
  • 艺术或装饰字体,字形不标准。
  • 光面杂志,反光纹理干扰字符识别。
  • 长期放置已褪色的收据,墨水物理消失。

所有情况下原始图像均保留。如 OCR 在关键页面失败,扫描图像本身仍可阅读。

免费版与 Pro

免费版每日提供一定额度的 OCR,足以应对日常收据、名片与偶尔一章书的识别需求。Pro 解除每日上限,并支持一键识别整个文件夹。对于有积压未识别扫描的文档库,Pro 是最高效的批量处理方式。

支持的语言

设备端引擎支持拉丁字母(英、法、德、西、葡、意及其他)、中文(简繁)、日文、韩文以及大部分欧洲文字。混排语言页面在一次识别中完成。

相关文章