PDFからテキストを抽出

PDF の既存テキストを抽出するか、英語・スペイン語・簡体字中国語の印刷スキャンや画像をローカル OCR で認識します。

このツールが役立つ場合

デジタル生成されたレポート、記事、請求書、ノートから読みやすいテキストをコピーし、検索や編集に利用すること。

局所処理の仕組み

基本抽出モード: ブラウザは各ページのテキスト項目を読み取り、おおよその読み順で連結し、ページを分離してUTF-8のプレーンテキストダウンロードを作成します。 文書はブラウザーのメモリー内だけで処理します。OCR コードと言語モデルは本サイトからダウンロードされますが、文書のアップロードではありません。ページを離れるかクリアすると文書と結果を破棄します。 これらのページは OCR せずコピーします。見出しだけがテキストで残りを認識する必要がある場合はオフにしてください。

使い方

  1. ソースを準備する: デジタル生成されたレポート、記事、請求書、ノートから読みやすいテキストをコピーし、検索や編集に利用すること。
  2. ローカルで処理する: 基本抽出モード: ブラウザは各ページのテキスト項目を読み取り、おおよその読み順で連結し、ページを分離してUTF-8のプレーンテキストダウンロードを作成します。 文書はブラウザーのメモリー内だけで処理します。OCR コードと言語モデルは本サイトからダウンロードされますが、文書のアップロードではありません。ページを離れるかクリアすると文書と結果を破棄します。 これらのページは OCR せずコピーします。見出しだけがテキストで残りを認識する必要がある場合はオフにしてください。
  3. ダウンロードして確認する: 使用前に認識結果と PDF を原本と照合してください。信頼度は推定値であり、正確さを保証しません。

重要な制限事項

印刷文字向けで、誤認識があります。編集可能なレイアウト、表、手書きは再現しません。OCR ページは画像と非表示テキストになり、そのページのリンク、フォーム、注釈、署名は保持しません。PDF/A 認証ではありません。

ダウンロードした結果を確認する

使用前に認識結果と PDF を原本と照合してください。信頼度は推定値であり、正確さを保証しません。

私設設計

あなたのファイルはこのブラウザに残ります。ツールはソースや出力をサーバーにアップロードしません。

質問と回答

このツールはいつ役立ちますか?

デジタル生成されたレポート、記事、請求書、ノートから読みやすいテキストをコピーし、検索や編集に利用すること。

ブラウザは実際に何をしますか?

基本抽出モード: ブラウザは各ページのテキスト項目を読み取り、おおよその読み順で連結し、ページを分離してUTF-8のプレーンテキストダウンロードを作成します。 文書はブラウザーのメモリー内だけで処理します。OCR コードと言語モデルは本サイトからダウンロードされますが、文書のアップロードではありません。ページを離れるかクリアすると文書と結果を破棄します。 これらのページは OCR せずコピーします。見出しだけがテキストで残りを認識する必要がある場合はオフにしてください。

理解しておくべき制限は何ですか?

印刷文字向けで、誤認識があります。編集可能なレイアウト、表、手書きは再現しません。OCR ページは画像と非表示テキストになり、そのページのリンク、フォーム、注釈、署名は保持しません。PDF/A 認証ではありません。

結果をどのように確認すべきですか?

使用前に認識結果と PDF を原本と照合してください。信頼度は推定値であり、正確さを保証しません。

関連ツール