Выписка по счету может содержать простую таблицу: Дата Описание Дебет Кредит Баланс 15.01.2024 Канцелярские товары 89,99 4120,50 Но внутри PDF-файл может содержать: Текст размещается независимо на странице Отдельные фрагменты текста...
Финансовые документы кажутся людям структурированными, но их часто на удивление сложно обрабатывать программному обеспечению.
Выписка по счету может содержать простую таблицу:
Дата
Описание
Дебет
Кредит
Баланс
15.01.2024
Канцелярские товары
89,99
4120,50
Но внутри PDF-файл может содержать:
Текст размещается независимо на странице
Отдельные фрагменты текста для каждого символа
Перенос описаний на несколько строк
Разные схемы для каждого банка
Заголовки повторяются на каждой странице
Сводные блоки, смешанные со строками транзакций
Отсканированные страницы вообще без текстового слоя
Если целью является экспорт данных в Excel или бухгалтерскую программу, простого извлечения видимого текста недостаточно.
В этой статье объясняются основные инженерные проблемы и практическая архитектура для создания более надежного конвейера извлечения финансовых документов.
Настоящая проблема — структура, а не текст.
Базовый экстрактор текста PDF часто может возвращать что-то вроде этого:
15.01.2024 Канцелярские товары 89,99 4 120,50
16.01.2024 Безналичный перевод 5 000,00 9 120,50
Этот вывод читаем, но он не говорит нам с уверенностью:
Какое значение принадлежит какому столбцу
Является ли 89,99 дебетом или кредитом
Будь баланс
