從 PDF 擷取文字

擷取 PDF 現有文字,或選擇本機 OCR 辨識英文、西班牙文和簡體中文印刷掃描件及圖片。

何時此工具有用

從數位生成的報告、文章、發票及筆記中複製可讀文字,供搜尋或編輯。

本地處理如何運作

基本擷取模式: 瀏覽器會讀取每個頁面的文字項目,將它們以大致的閱讀順序連接,分隔頁面,並產生 UTF-8 純文字下載。 文件只保留在瀏覽器記憶體中。OCR 程式與所選語言模型從本站下載,這並非上傳檔案。離開頁面或清空後會捨棄文件與結果。 這些頁面不做 OCR,直接複製。如果掃描頁只有文字頁首,其餘部分仍需辨識,請關閉此項。

使用方法

  1. 準備來源: 從數位生成的報告、文章、發票及筆記中複製可讀文字,供搜尋或編輯。
  2. 本地處理: 基本擷取模式: 瀏覽器會讀取每個頁面的文字項目,將它們以大致的閱讀順序連接,分隔頁面,並產生 UTF-8 純文字下載。 文件只保留在瀏覽器記憶體中。OCR 程式與所選語言模型從本站下載,這並非上傳檔案。離開頁面或清空後會捨棄文件與結果。 這些頁面不做 OCR,直接複製。如果掃描頁只有文字頁首,其餘部分仍需辨識,請關閉此項。
  3. 下載並驗證: 使用前請對照原件檢查辨識文字與下載的 PDF。信心分數只是估計,並不保證準確。

重要限制

僅針對印刷文字,可能辨識錯誤,不還原可編輯版面、表格或手寫文字。OCR 頁面成為圖片加隱藏文字層,不保留其連結、表單、註解與簽章,也不構成 PDF/A 認證。

驗證下載的結果

使用前請對照原件檢查辨識文字與下載的 PDF。信心分數只是估計,並不保證準確。

設計上保密

您的檔案將保存在此瀏覽器中。工具不會將來源或輸出上傳到我們的伺服器。

問答

這個工具什麼時候有用?

從數位生成的報告、文章、發票及筆記中複製可讀文字,供搜尋或編輯。

瀏覽器實際上做了什麼?

基本擷取模式: 瀏覽器會讀取每個頁面的文字項目,將它們以大致的閱讀順序連接,分隔頁面,並產生 UTF-8 純文字下載。 文件只保留在瀏覽器記憶體中。OCR 程式與所選語言模型從本站下載,這並非上傳檔案。離開頁面或清空後會捨棄文件與結果。 這些頁面不做 OCR,直接複製。如果掃描頁只有文字頁首,其餘部分仍需辨識,請關閉此項。

我必須理解哪些限制?

僅針對印刷文字,可能辨識錯誤,不還原可編輯版面、表格或手寫文字。OCR 頁面成為圖片加隱藏文字層,不保留其連結、表單、註解與簽章,也不構成 PDF/A 認證。

我應該如何驗證結果?

使用前請對照原件檢查辨識文字與下載的 PDF。信心分數只是估計,並不保證準確。

相關工具