适用场景
从数字生成的报告、文章、发票和笔记中复制可读文字,用于搜索或编辑。
本地处理原理
基础提取模式: 浏览器读取每页的文字项,按近似阅读顺序拼接,分隔各页,并生成 UTF-8 纯文本下载。 文档只保留在浏览器内存中。OCR 程序和所选语言模型从本站下载,这不是上传文件。离开页面或清空后会丢弃文档及结果。 这些页面不做 OCR,直接复制。如果扫描页仅有文字页眉、其他部分仍需识别,请关闭此项。
使用方法
- 选择源文件。
- 检查可用设置和页面顺序。
- 在本地处理、检查结果并下载。
重要限制
仅针对印刷文字,可能识别错误,不还原可编辑版式、表格或手写文字。OCR 页面成为图片加隐藏文字层,不保留其链接、表单、批注和签名,也不构成 PDF/A 认证。
验证下载结果
在目标应用中重新打开下载文件,核对尺寸或页数及可见内容;结果被目标系统接受前请保留源文件。
隐私优先
文件只在当前浏览器中处理,源文件和结果不会上传到我们的服务器。
常见问题
工具会上传我的文件吗?
不会。处理在浏览器中完成,关闭页面会结束当前工作会话。
结果会与源文件完全一致吗?
仅针对印刷文字,可能识别错误,不还原可编辑版式、表格或手写文字。OCR 页面成为图片加隐藏文字层,不保留其链接、表单、批注和签名,也不构成 PDF/A 认证。
使用结果前需要检查什么?
在目标应用中重新打开下载文件,核对尺寸或页数及可见内容;结果被目标系统接受前请保留源文件。
支持哪些浏览器和设备?
请使用支持 JavaScript、Worker、Canvas、格式所需 WebAssembly、Blob 下载且内存充足的当前浏览器,并在目标应用中重新打开重要下载。
具体输入与输出示例
对六页数字报告使用基础模式提取可选文字。纯图片的英文、西班牙文或简体中文扫描件则需明确选择 OCR、下载语言模型,再将文字和可搜索 PDF 与原件核对。文件不会上传。
浏览器兼容性说明
本说明于 2026-09-02 按实现和所需 Web API 审核。请使用具备这些 API 的当前浏览器,并在自己的设备上核对重要结果。
- Chrome / Edge(当前桌面版)
- 需要本地 PDF 解析、适用时的 Worker/画布、文档创建与 Blob 下载。
- Firefox(当前桌面版)
- 使用本地 PDF 流程;请始终在目标阅读器中核对下载。
- Safari(当前桌面版)
- 使用同类本地流程;大量页面的实际内存上限可能较低。
本工具专项问答
能读取扫描版 PDF 的文字吗?
可以另选按需启动的 OCR 模式,识别英文、西班牙文或简体中文印刷文字。基础提取仍只读已有文字。OCR 可能出错,识别后的页面是图片加不可见文字层,不会恢复可编辑的原始排版。