实用场景流程

用 OCR 让扫描件可以搜索

在本地识别扫描文字,下载纯文本和可搜索 PDF,方便后续检索。

起始参数

识别语言可选英语、西班牙语或简体中文。输入最多 20 MiB,PDF 最多十页,源图片最多 1,200 万像素。默认跳过已有文字的页面。

处理步骤

  1. 加载扫描件或合成文字样例。选择纸面上文字的语言,不一定与界面语言相同。
  2. 启动 OCR,按需下载所选模型。若页面只有文字页眉、正文仍是扫描图,请关闭跳过已有文字选项后重试。
  3. 检查识别文本后下载文本文件和可搜索 PDF。在其他 PDF 阅读器中搜索一句已知文字。

检查结果

对照原图核对姓名、数字和重要段落。置信度不是准确无误的证明。

限制与损失

OCR 页面会变为带隐形文字的栅格图。原来的可编辑布局、表单和链接不会保留;这不是经过认证的 PDF/A 归档转换。

本地处理

文件和结果只保留在当前浏览器,原文件不会被覆盖。样例使用虚构数据。清空或离开前请下载结果。OCR 会下载识别模型,不会上传文档。

审核日期