実用ワークフロー

OCRでスキャンを検索可能にする

スキャンの文字をブラウザー内で認識し、後から検索できるテキストと検索可能なPDFをダウンロードします。

初期設定

認識言語は英語、スペイン語、簡体字中国語から選択します。入力は20 MiB、PDFは10ページ、元画像は1,200万画素までです。既存のテキストを持つページは初期設定でスキップします。

処理手順

  1. スキャンまたは架空の文字サンプルを読み込みます。画面の表示言語ではなく、文書に印刷されている言語を選択してください。
  2. OCRを開始すると、選択したモデルが必要に応じてダウンロードされます。スキャンの上にテキストの見出しだけがあるページでは、既存テキストのあるページをスキップする設定をオフにして再試行します。
  3. 認識した文字を確認し、テキストファイルと検索可能なPDFをダウンロードします。別のPDFリーダーで既知の語句を検索してください。

結果の確認

氏名、数値、重要な文章を元画像と照合します。信頼度の推定値は、認識の正確さを保証するものではありません。

制限と失われる情報

OCRしたページは、不可視テキストを持つラスター画像になります。編集可能な元のレイアウト、フォーム、リンクは保持されません。認証付きPDF/A保存形式への変換ではありません。

ローカル処理

ファイルと出力はこのブラウザー内に保持され、元のファイルは上書きされません。サンプルには架空のデータを使用しています。消去またはページを離れる前に結果をダウンロードしてください。OCRでダウンロードするのは認識モデルであり、文書をアップロードすることはありません。

確認日