Từ pixel đến ký tự

Máy ảnh ghi lại các pixel chứ không phải từ ngữ. OCR phát hiện các vùng trông giống như văn bản, nhóm các dấu thành dòng và ký tự, đồng thời dự đoán các chữ cái hoặc số mà chúng đại diện.

Kết quả có thể hỗ trợ tìm kiếm, sao chép, xuất TXT, phân loại tài liệu hoặc lớp PDF có thể tìm kiếm. Hình ảnh gốc vẫn có giá trị vì nó là bằng chứng dùng để kiểm tra khả năng nhận dạng.

Tại sao OCR mắc lỗi

Sự công nhận là xác suất. Số 8 mờ có thể trông giống số 3; một nếp gấp có thể vượt qua một chữ cái; phông chữ trang trí có thể không giống với hình thức mà trình nhận dạng mong đợi. Chữ viết tay có nhiều biến thể hơn so với chữ in.

  • Mờ, độ phân giải thấp và rung máy
  • Ánh sáng chói, bóng tối, vết bẩn và giấy có họa tiết
  • Trang sách cong và góc nhìn méo mó
  • Phông chữ, chữ viết tay, bảng và cột hỗn hợp bất thường
  • Ngôn ngữ hoặc tập lệnh không được định cấu hình như mong đợi

OCR so với quét tài liệu

Quá trình quét sẽ chụp và làm sạch hình ảnh trang. OCR diễn giải văn bản bên trong hình ảnh đó. Máy quét có thể hoạt động mà không cần OCR và OCR có thể chạy trên hình ảnh hiện có nhưng việc kết hợp chúng sẽ tạo ra quy trình làm việc tài liệu hữu ích hơn.

Tìm kiếm trong ứng dụng có thể sử dụng dữ liệu OCR được lưu trữ, trong khi tệp PDF có thể tìm kiếm sẽ nhúng một lớp văn bản để sử dụng trong các trình đọc khác. Đây là những kết quả có liên quan nhưng khác biệt.

OCR trên thiết bị so với đám mây

OCR trên thiết bị xử lý trang trên điện thoại, điều này có thể làm giảm việc tiếp xúc với dữ liệu thông thường và hoạt động mà không có độ trễ mạng. Cloud OCR có thể cung cấp các mô hình hoặc xử lý bố cục khác nhau nhưng yêu cầu truyền dữ liệu trang đến một dịch vụ.

Hỏi ứng dụng xem quá trình nhận dạng diễn ra như thế nào, trang gốc có được tải lên hay không, dữ liệu được lưu giữ trong bao lâu và những thay đổi nào khi sử dụng tính năng AI tùy chọn.