Trích xuất văn bản từ PDF

Trích xuất văn bản PDF có sẵn hoặc chọn OCR cục bộ cho bản quét và ảnh in tiếng Anh, Tây Ban Nha và Trung giản thể.

Khi công cụ này hữu ích

Sao chép văn bản có thể đọc từ các báo cáo, bài viết, hóa đơn và ghi chú được tạo kỹ thuật số để tìm kiếm hoặc chỉnh sửa.

Cách xử lý cục bộ hoạt động

Trích xuất cơ bản: Trình duyệt đọc từng mục văn bản của trang, ghép chúng theo thứ tự đọc xấp xỉ, tách trang và tạo bản tải xuống văn bản thuần UTF-8. Tài liệu ở trong bộ nhớ trình duyệt. Mã OCR và mô hình được tải xuống từ trang này; tệp của bạn không được tải lên. Rời trang hoặc xóa sẽ bỏ tài liệu và kết quả. Các trang này được sao chép không qua OCR. Tắt nếu bản quét có tiêu đề văn bản nhưng phần còn lại cần nhận dạng.

Cách sử dụng

  1. Chuẩn bị nguồn: Sao chép văn bản có thể đọc từ các báo cáo, bài viết, hóa đơn và ghi chú được tạo kỹ thuật số để tìm kiếm hoặc chỉnh sửa.
  2. Xử lý tại chỗ: Trích xuất cơ bản: Trình duyệt đọc từng mục văn bản của trang, ghép chúng theo thứ tự đọc xấp xỉ, tách trang và tạo bản tải xuống văn bản thuần UTF-8. Tài liệu ở trong bộ nhớ trình duyệt. Mã OCR và mô hình được tải xuống từ trang này; tệp của bạn không được tải lên. Rời trang hoặc xóa sẽ bỏ tài liệu và kết quả. Các trang này được sao chép không qua OCR. Tắt nếu bản quét có tiêu đề văn bản nhưng phần còn lại cần nhận dạng.
  3. Tải xuống và xác minh: So sánh văn bản và PDF với bản gốc trước khi dùng. Độ tin cậy chỉ là ước lượng, không bảo đảm chính xác.

Các giới hạn quan trọng

Chỉ chữ in. OCR có thể nhầm ký tự, không tái tạo bố cục chỉnh sửa được, bảng hay chữ viết tay. Trang OCR thành ảnh kèm chữ ẩn; không giữ liên kết, biểu mẫu, chú thích và chữ ký trên các trang đó. Không chứng nhận PDF/A.

Xác minh kết quả đã tải xuống

So sánh văn bản và PDF với bản gốc trước khi dùng. Độ tin cậy chỉ là ước lượng, không bảo đảm chính xác.

Bảo mật theo thiết kế

Tệp của bạn vẫn ở trong trình duyệt này. Công cụ không tải nguồn hoặc kết quả lên máy chủ của chúng tôi.

Câu hỏi và trả lời

Khi nào công cụ này hữu ích?

Sao chép văn bản có thể đọc từ các báo cáo, bài viết, hóa đơn và ghi chú được tạo kỹ thuật số để tìm kiếm hoặc chỉnh sửa.

Trình duyệt thực sự làm gì?

Trích xuất cơ bản: Trình duyệt đọc từng mục văn bản của trang, ghép chúng theo thứ tự đọc xấp xỉ, tách trang và tạo bản tải xuống văn bản thuần UTF-8. Tài liệu ở trong bộ nhớ trình duyệt. Mã OCR và mô hình được tải xuống từ trang này; tệp của bạn không được tải lên. Rời trang hoặc xóa sẽ bỏ tài liệu và kết quả. Các trang này được sao chép không qua OCR. Tắt nếu bản quét có tiêu đề văn bản nhưng phần còn lại cần nhận dạng.

Các giới hạn nào tôi cần hiểu?

Chỉ chữ in. OCR có thể nhầm ký tự, không tái tạo bố cục chỉnh sửa được, bảng hay chữ viết tay. Trang OCR thành ảnh kèm chữ ẩn; không giữ liên kết, biểu mẫu, chú thích và chữ ký trên các trang đó. Không chứng nhận PDF/A.

Tôi nên xác minh kết quả như thế nào?

So sánh văn bản và PDF với bản gốc trước khi dùng. Độ tin cậy chỉ là ước lượng, không bảo đảm chính xác.

Các công cụ liên quan