Quy trình thực tế
Cho phép tìm kiếm trong bản quét bằng OCR
Nhận dạng văn bản cục bộ rồi tải văn bản thuần và PDF có thể tìm kiếm.
Thông số ban đầu
Nhận dạng tiếng Anh, Tây Ban Nha hoặc Trung giản thể. Tối đa 20 MiB, mười trang PDF và 12 megapixel mỗi ảnh nguồn. Trang đã có chữ mặc định được bỏ qua.
Các bước xử lý
- Nạp bản quét hoặc mẫu văn bản tổng hợp. Chọn ngôn ngữ được in, không nhất thiết là ngôn ngữ giao diện.
- Bắt đầu OCR; mô hình được tải khi cần. Nếu chỉ có tiêu đề chữ phía trên ảnh quét, tắt việc bỏ qua trang đã có chữ.
- Kiểm tra nhận dạng rồi tải kết quả. Tìm một cụm từ đã biết trong trình đọc PDF khác.
Kiểm tra kết quả
Đối chiếu tên, số và đoạn quan trọng với ảnh. Ước lượng độ tin cậy không chứng minh tính chính xác.
Giới hạn và mất mát
Trang OCR trở thành ảnh raster với chữ vô hình. Bố cục chỉnh sửa được, biểu mẫu và liên kết không được giữ. Đây không phải chuyển đổi PDF/A có chứng nhận.
Xử lý cục bộ
Tệp và kết quả ở trong trình duyệt này; bản gốc không bị ghi đè. Mẫu dùng dữ liệu hư cấu. Hãy tải xuống trước khi xóa hoặc rời trang. OCR tải mô hình về, không gửi tài liệu đi.