扫描文档

识别扫描 PDF 并理解 OCR 限制

扫描 PDF 可能没有可用文字层。基础提取只读取已有文字;需要识别扫描件或图片时,可另选本地 OCR,明确启动英文、西班牙文或简体中文印刷文字识别。

操作流程

  1. 测试 PDF 实际包含什么

    尝试选择一句已知文字并搜索一个可见词语。两者均失败时,页面可能只有图片,或文字层已损坏。

  2. 需要时选择本地 OCR 模式

    校正方向,保留可读分辨率,并明确选择文档语言。默认跳过已有文字的页面;如果扫描页只有文字页眉,应关闭跳过选项。完成后下载文字及可搜索 PDF。

  3. 对照扫描页校对

    检查姓名、日期、总额、小数点、表格、手写字、页序和低对比区域,并把扫描图作为视觉记录保留。

需要了解的限制

OCR 可能混淆相似字符、打乱分栏、漏掉手写字、错误插入空格或省略浅色文字。可搜索文字层不代表准确、真实、无障碍或具备法律等效性。 仅针对印刷文字,可能识别错误,不还原可编辑版式、表格或手写文字。OCR 页面成为图片加隐藏文字层,不保留其链接、表单、批注和签名,也不构成 PDF/A 认证。

隐私模式

文档只保留在浏览器内存中。OCR 程序和所选语言模型从本站下载,这不是上传文件。离开页面或清空后会丢弃文档及结果。

验证结果

抽查每种版式,搜索常见词和容易识别错误的词,把关键数字复制到纯文本,并对决策或合规信息安排人工复核。

常见问题

为什么 PDF 转文字没有结果?

基础提取只读取已有文字层。如果页面只有图片,请另选 OCR 模式;模糊、浅色或不支持的文字仍可能无法正确识别。

先转成 JPG 会帮助 OCR 吗?

可能提供兼容输入,但过度缩小或压缩会降低识别率。应保留高质量来源。

编辑审核日期