実用ワークフロー
OCRでスキャンを検索可能にする
スキャンの文字をブラウザー内で認識し、後から検索できるテキストと検索可能なPDFをダウンロードします。
初期設定
認識言語は英語、スペイン語、簡体字中国語から選択します。入力は20 MiB、PDFは10ページ、元画像は1,200万画素までです。既存のテキストを持つページは初期設定でスキップします。
処理手順
- スキャンまたは架空の文字サンプルを読み込みます。画面の表示言語ではなく、文書に印刷されている言語を選択してください。
- OCRを開始すると、選択したモデルが必要に応じてダウンロードされます。スキャンの上にテキストの見出しだけがあるページでは、既存テキストのあるページをスキップする設定をオフにして再試行します。
- 認識した文字を確認し、テキストファイルと検索可能なPDFをダウンロードします。別のPDFリーダーで既知の語句を検索してください。
結果の確認
氏名、数値、重要な文章を元画像と照合します。信頼度の推定値は、認識の正確さを保証するものではありません。
制限と失われる情報
OCRしたページは、不可視テキストを持つラスター画像になります。編集可能な元のレイアウト、フォーム、リンクは保持されません。認証付きPDF/A保存形式への変換ではありません。
ローカル処理
ファイルと出力はこのブラウザー内に保持され、元のファイルは上書きされません。サンプルには架空のデータを使用しています。消去またはページを離れる前に結果をダウンロードしてください。OCRでダウンロードするのは認識モデルであり、文書をアップロードすることはありません。