Понимание двух слоев

Видимый слой — это отсканированное изображение страницы. Он сохраняет макет, печати, подписи и все, что заснято камерой. Слой OCR содержит распознанные символы, совмещенные с этим изображением.

PDF-файл может выглядеть идеально, но в нем нет текста, доступного для поиска. Он также может успешно выполнять поиск, пока OCR содержит ошибки. Проверьте внешний вид и текст отдельно.

Начните со страниц, удобных для распознавания текста

Используйте четкие изображения, равномерное освещение, прямые границы страниц и достаточное разрешение для мелкого шрифта. Высокая контрастность может помочь очистить черный текст, но агрессивный фильтр может стереть слабый почерк или штампы.

  • Избегайте размытия в движении и глянцевых отражений
  • Сохраняйте правильную ориентацию столбцов и страниц.
  • Используйте правильный исходный язык, если система OCR предлагает такую ​​возможность.
  • Повторно отсканируйте слабую страницу вместо того, чтобы ожидать, что OCR ее исправит.

Распознать текст и экспортировать

  1. 1

    Запустить распознавание текста

    Позвольте сканеру распознать каждую выбранную страницу.

  2. 2

    Просмотрите критические значения

    Сравните имена, даты, итоговые суммы и идентификаторы с изображением.

  3. 3

    Выберите PDF с возможностью поиска

    Экспортируйте с включенным слоем распознанного текста.

  4. 4

    Проверка в PDF-программе

    Найдите отличительную фразу и выберите предложение.

Знайте, что не означает возможность поиска

Доступный для поиска не означает идеально редактируемый. Сложная таблица, многоколоночный макет или декоративная форма могут копироваться в неожиданном порядке. OCR также не гарантирует доступность без правильного порядка чтения и разметки.

Для архивирования или работы по обеспечению соответствия подтвердите требуемый стандарт PDF получателя вместо того, чтобы предполагать, что обычный экспорт с возможностью поиска его удовлетворяет.