扫描文档
识别扫描 PDF 并理解 OCR 限制
扫描 PDF 可能没有可用文字层。基础提取只读取已有文字;需要识别扫描件或图片时,可另选本地 OCR,明确启动英文、西班牙文或简体中文印刷文字识别。
操作流程
测试 PDF 实际包含什么
尝试选择一句已知文字并搜索一个可见词语。两者均失败时,页面可能只有图片,或文字层已损坏。
需要时选择本地 OCR 模式
校正方向,保留可读分辨率,并明确选择文档语言。默认跳过已有文字的页面;如果扫描页只有文字页眉,应关闭跳过选项。完成后下载文字及可搜索 PDF。
对照扫描页校对
检查姓名、日期、总额、小数点、表格、手写字、页序和低对比区域,并把扫描图作为视觉记录保留。
需要了解的限制
OCR 可能混淆相似字符、打乱分栏、漏掉手写字、错误插入空格或省略浅色文字。可搜索文字层不代表准确、真实、无障碍或具备法律等效性。 仅针对印刷文字,可能识别错误,不还原可编辑版式、表格或手写文字。OCR 页面成为图片加隐藏文字层,不保留其链接、表单、批注和签名,也不构成 PDF/A 认证。
隐私模式
文档只保留在浏览器内存中。OCR 程序和所选语言模型从本站下载,这不是上传文件。离开页面或清空后会丢弃文档及结果。
验证结果
抽查每种版式,搜索常见词和容易识别错误的词,把关键数字复制到纯文本,并对决策或合规信息安排人工复核。
常见问题
为什么 PDF 转文字没有结果?
基础提取只读取已有文字层。如果页面只有图片,请另选 OCR 模式;模糊、浅色或不支持的文字仍可能无法正确识别。
先转成 JPG 会帮助 OCR 吗?
可能提供兼容输入,但过度缩小或压缩会降低识别率。应保留高质量来源。