Ekstrak teks dari PDF

Ekstrak teks PDF yang ada atau pilih OCR lokal untuk pindaian dan gambar cetak dalam Inggris, Spanyol, dan Tionghoa Sederhana.

Kapan alat ini berguna

Menyalin teks yang dapat dibaca dari laporan yang dihasilkan secara digital, artikel, faktur, dan catatan untuk pencarian atau pengeditan.

Bagaimana pemrosesan lokal bekerja

Ekstraksi dasar: Browser membaca item teks setiap halaman, menggabungkannya dalam urutan bacaan perkiraan, memisahkan halaman, dan membuat unduhan teks biasa UTF-8. Dokumen tetap dalam memori peramban. Kode OCR dan model pilihan diunduh dari situs ini; berkas Anda tidak diunggah. Keluar atau menghapus membuang dokumen dan hasil. Halaman ini disalin tanpa OCR. Matikan jika pindaian memiliki judul berupa teks tetapi bagian lainnya perlu dikenali.

Cara menggunakannya

  1. Siapkan sumber: Menyalin teks yang dapat dibaca dari laporan yang dihasilkan secara digital, artikel, faktur, dan catatan untuk pencarian atau pengeditan.
  2. Proses secara lokal: Ekstraksi dasar: Browser membaca item teks setiap halaman, menggabungkannya dalam urutan bacaan perkiraan, memisahkan halaman, dan membuat unduhan teks biasa UTF-8. Dokumen tetap dalam memori peramban. Kode OCR dan model pilihan diunduh dari situs ini; berkas Anda tidak diunggah. Keluar atau menghapus membuang dokumen dan hasil. Halaman ini disalin tanpa OCR. Matikan jika pindaian memiliki judul berupa teks tetapi bagian lainnya perlu dikenali.
  3. Unduh dan verifikasi: Bandingkan teks dan PDF dengan dokumen asli sebelum digunakan. Keyakinan adalah perkiraan, bukan jaminan akurasi.

Batasan penting

Hanya teks cetak. OCR dapat salah membaca karakter dan tidak membuat tata letak, tabel, atau tulisan tangan yang dapat diedit. Halaman OCR menjadi gambar dengan teks tak terlihat; tautan, formulir, anotasi, dan tanda tangan tidak dipertahankan di halaman itu. Bukan sertifikasi PDF/A.

Verifikasi hasil yang diunduh

Bandingkan teks dan PDF dengan dokumen asli sebelum digunakan. Keyakinan adalah perkiraan, bukan jaminan akurasi.

Privat secara desain

File Anda tetap di browser ini. Alat ini tidak mengunggah sumber atau output ke server kami.

Pertanyaan dan jawaban

Kapan alat ini berguna?

Menyalin teks yang dapat dibaca dari laporan yang dihasilkan secara digital, artikel, faktur, dan catatan untuk pencarian atau pengeditan.

Apa yang sebenarnya dilakukan peramban?

Ekstraksi dasar: Browser membaca item teks setiap halaman, menggabungkannya dalam urutan bacaan perkiraan, memisahkan halaman, dan membuat unduhan teks biasa UTF-8. Dokumen tetap dalam memori peramban. Kode OCR dan model pilihan diunduh dari situs ini; berkas Anda tidak diunggah. Keluar atau menghapus membuang dokumen dan hasil. Halaman ini disalin tanpa OCR. Matikan jika pindaian memiliki judul berupa teks tetapi bagian lainnya perlu dikenali.

Batasan apa yang harus saya pahami?

Hanya teks cetak. OCR dapat salah membaca karakter dan tidak membuat tata letak, tabel, atau tulisan tangan yang dapat diedit. Halaman OCR menjadi gambar dengan teks tak terlihat; tautan, formulir, anotasi, dan tanda tangan tidak dipertahankan di halaman itu. Bukan sertifikasi PDF/A.

Bagaimana seharusnya saya memverifikasi hasil?

Bandingkan teks dan PDF dengan dokumen asli sebelum digunakan. Keyakinan adalah perkiraan, bukan jaminan akurasi.

Alat terkait