Обычный OCR распознает символы, но не обязан понимать, какие слова относятся к одной строке и где проходят границы столбцов.

Для таблиц нужен отдельный layout-анализ и контроль структуры, особенно если в документе есть сканы, объединенные ячейки или слабые линии.

Как именно теряется структура таблицы

Важно отделить ошибку распознавания текста от ошибки восстановления расположения.

  • Значения всех столбцов объединяются в один текстовый поток.
  • Часть строк пропускается или меняется местами.
  • Заголовок связывается не с тем столбцом.
  • Объединенные ячейки создают сдвиг остальных данных.

Почему возникает проблема

PDF может содержать готовый текстовый слой, изображение страницы или смесь обоих вариантов.

  • Скан имеет низкое разрешение, перекос, шум или неравномерный фон.
  • Используется текстовый OCR без модели таблиц и координат.
  • Тонкие или отсутствующие линии не позволяют определить границы ячеек.
  • Порядок чтения PDF отличается от визуального расположения.
  • Предобработка обрезает крайние столбцы или уменьшает мелкий шрифт.

Пошаговая диагностика

Начните с классификации страниц и измеримого примера ожидаемого результата.

  1. Проверьте, есть ли в PDF извлекаемый текст и координаты символов.
  2. Отрендерите проблемную страницу в достаточном разрешении без лишнего сжатия.
  3. Сравните OCR-текст, bounding boxes и визуальные границы таблицы.
  4. Отметьте merged cells, повторяющиеся заголовки и продолжения на следующей странице.
  5. Соберите контрольный набор таблиц с ручной разметкой строк и столбцов.

Комбинируйте текстовый слой и анализ макета

Если PDF уже содержит качественный текст, повторный OCR может только ухудшить результат.

  • Текст извлекается напрямую, когда он доступен и корректен.
  • OCR применяется только к сканированным или поврежденным областям.
  • Координаты слов группируются по строкам, столбцам и ячейкам.
  • Структура проверяется бизнес-правилами, а не только уверенностью модели.

Как исправить проблему

Постройте конвейер, который сохраняет координаты и отдельно восстанавливает таблицу.

  1. Исправьте поворот, перспективу, контраст и разрешение изображения страницы.
  2. Используйте модель layout или table recognition вместе с OCR.
  3. Сопоставляйте слова с ячейками по координатам и допустимым пересечениям.
  4. Обрабатывайте объединенные ячейки и многострочные значения отдельными правилами.
  5. Сохраняйте исходную страницу и координаты для последующей проверки спорных полей.

Как проверить результат

  • Количество строк и ключевых столбцов совпадает с исходником.
  • Суммы по таблице сходятся с итогами документа.
  • Заголовки и единицы измерения привязаны к правильным данным.
  • Поля с низкой уверенностью отправляются на ручную проверку.

Типичные ошибки

  • Передавать весь PDF в простой OCR и ждать готовый Excel.
  • Оценивать качество только по наличию распознанных слов.
  • Удалять координаты после распознавания.
  • Не учитывать продолжение таблицы на следующей странице.

Как предотвратить повторение

  • Храните эталонный набор разных типов PDF и таблиц.
  • Измеряйте точность по ячейкам и критичным полям.
  • Версионируйте настройки рендера, OCR и layout-моделей.
  • Добавьте автоматическую проверку итогов, дат и числовых форматов.

Когда нужна помощь

Если OCR теряет таблицы в ваших PDF, я разберу типы документов, настрою извлечение текста и layout-анализ, добавлю проверку структуры и подготовлю надежный экспорт данных.