實用情境流程
用 OCR 讓掃描文件可以搜尋
在本機辨識掃描文字,下載純文字與可搜尋 PDF,方便日後檢索。
起始參數
辨識語言可選英語、西班牙語或簡體中文。輸入最多 20 MiB,PDF 最多十頁,來源圖片最多 1,200 萬像素。預設跳過已有文字的頁面。
處理步驟
- 載入掃描文件或合成文字範例。選擇紙面上文字的語言,不一定與介面語言相同。
- 啟動 OCR,依需要下載所選模型。若頁面僅有文字頁首、內文仍是掃描圖,請關閉跳過已有文字選項後重試。
- 檢查辨識文字後下載文字檔與可搜尋 PDF。在其他 PDF 閱讀器中搜尋一句已知文字。
檢查結果
對照原圖核對姓名、數字與重要段落。信心分數不是完全準確的證明。
限制與損失
OCR 頁面會變成附隱形文字的點陣圖。原有可編輯版面、表單與連結不會保留;這不是經認證的 PDF/A 歸檔轉換。
本機處理
檔案和結果僅保留於目前瀏覽器,原檔不會被覆寫。範例使用虛構資料。清除或離開前請下載結果。OCR 會下載辨識模型,不會上傳文件。