實用情境流程

用 OCR 讓掃描文件可以搜尋

在本機辨識掃描文字,下載純文字與可搜尋 PDF,方便日後檢索。

起始參數

辨識語言可選英語、西班牙語或簡體中文。輸入最多 20 MiB,PDF 最多十頁,來源圖片最多 1,200 萬像素。預設跳過已有文字的頁面。

處理步驟

  1. 載入掃描文件或合成文字範例。選擇紙面上文字的語言,不一定與介面語言相同。
  2. 啟動 OCR,依需要下載所選模型。若頁面僅有文字頁首、內文仍是掃描圖,請關閉跳過已有文字選項後重試。
  3. 檢查辨識文字後下載文字檔與可搜尋 PDF。在其他 PDF 閱讀器中搜尋一句已知文字。

檢查結果

對照原圖核對姓名、數字與重要段落。信心分數不是完全準確的證明。

限制與損失

OCR 頁面會變成附隱形文字的點陣圖。原有可編輯版面、表單與連結不會保留;這不是經認證的 PDF/A 歸檔轉換。

本機處理

檔案和結果僅保留於目前瀏覽器,原檔不會被覆寫。範例使用虛構資料。清除或離開前請下載結果。OCR 會下載辨識模型,不會上傳文件。

審核日期