Понимание двух слоев
Видимый слой — это отсканированное изображение страницы. Он сохраняет макет, печати, подписи и все, что заснято камерой. Слой OCR содержит распознанные символы, совмещенные с этим изображением.
PDF-файл может выглядеть идеально, но в нем нет текста, доступного для поиска. Он также может успешно выполнять поиск, пока OCR содержит ошибки. Проверьте внешний вид и текст отдельно.
Начните со страниц, удобных для распознавания текста
Используйте четкие изображения, равномерное освещение, прямые границы страниц и достаточное разрешение для мелкого шрифта. Высокая контрастность может помочь очистить черный текст, но агрессивный фильтр может стереть слабый почерк или штампы.
- Избегайте размытия в движении и глянцевых отражений
- Сохраняйте правильную ориентацию столбцов и страниц.
- Используйте правильный исходный язык, если система OCR предлагает такую возможность.
- Повторно отсканируйте слабую страницу вместо того, чтобы ожидать, что OCR ее исправит.
Распознать текст и экспортировать
- 1
Запустить распознавание текста
Позвольте сканеру распознать каждую выбранную страницу.
- 2
Просмотрите критические значения
Сравните имена, даты, итоговые суммы и идентификаторы с изображением.
- 3
Выберите PDF с возможностью поиска
Экспортируйте с включенным слоем распознанного текста.
- 4
Проверка в PDF-программе
Найдите отличительную фразу и выберите предложение.
Знайте, что не означает возможность поиска
Доступный для поиска не означает идеально редактируемый. Сложная таблица, многоколоночный макет или декоративная форма могут копироваться в неожиданном порядке. OCR также не гарантирует доступность без правильного порядка чтения и разметки.
Для архивирования или работы по обеспечению соответствия подтвердите требуемый стандарт PDF получателя вместо того, чтобы предполагать, что обычный экспорт с возможностью поиска его удовлетворяет.