Hiểu hai lớp
Lớp hiển thị là hình ảnh trang được quét. Nó bảo tồn bố cục, tem, chữ ký và mọi thứ mà máy ảnh đã chụp. Lớp OCR chứa các ký tự được nhận dạng phù hợp với hình ảnh đó.
Một tệp PDF có thể trông hoàn hảo nhưng không có văn bản có thể tìm kiếm được. Nó cũng có thể tìm kiếm thành công trong khi OCR có lỗi. Kiểm tra sự xuất hiện và văn bản một cách riêng biệt.
Bắt đầu với các trang thân thiện với OCR
Sử dụng hình ảnh sắc nét, ánh sáng đều, đường viền trang thẳng và độ phân giải đủ cho bản in nhỏ. Độ tương phản cao có thể giúp làm sạch văn bản màu đen nhưng bộ lọc mạnh có thể xóa chữ viết tay hoặc tem mờ.
- Tránh chuyển động mờ và phản chiếu bóng
- Giữ cột và hướng trang chính xác
- Sử dụng ngôn ngữ nguồn phù hợp khi hệ thống OCR cung cấp quyền kiểm soát đó
- Quét lại một trang yếu thay vì mong đợi OCR sửa chữa nó
Nhận dạng và xuất
- 1
Chạy OCR
Hãy để máy quét nhận dạng từng trang được chọn.
- 2
Xem lại các giá trị quan trọng
So sánh tên, ngày tháng, tổng số và số nhận dạng với hình ảnh.
- 3
Chọn bản PDF có thể tìm kiếm
Xuất kèm theo lớp văn bản được nhận dạng.
- 4
Kiểm tra trên đầu đọc
Tìm kiếm một cụm từ đặc biệt và chọn một câu.
Biết những gì có thể tìm kiếm không có nghĩa là
Có thể tìm kiếm không có nghĩa là có thể chỉnh sửa hoàn toàn. Một bảng phức tạp, bố cục nhiều cột hoặc hình thức trang trí có thể sao chép theo thứ tự không mong muốn. OCR cũng không đảm bảo khả năng truy cập nếu không có thứ tự đọc và gắn thẻ chính xác.
Đối với công việc lưu trữ hoặc tuân thủ, hãy xác nhận tiêu chuẩn PDF được yêu cầu của người nhận thay vì cho rằng bản xuất có thể tìm kiếm thông thường đáp ứng được tiêu chuẩn đó.