Российские ученые создали программу, способную восстанавливать содержание и структуру поврежденных исторических документов. Разработка СПбГУПТД использует искусственный интеллект и предназначена для автоматической обработки старых материалов с дефектами.
В основе решения лежат два модуля — визуальный и лингвистический. Первый определяет поврежденные участки и подготавливает изображение, а второй распознает текст и восстанавливает его смысловую последовательность.
Как уточняет ТАСС, система умеет работать со сложной версткой, в том числе со старыми газетами в несколько колонок. Собственная языковая модель анализирует расположение блоков и помогает не смешивать фрагменты, находящиеся в разных частях страницы.
Для обучения использовали подшивку газеты «Кадры стране» за 1968 год. Благодаря этому алгоритм научился учитывать особенности печати того периода, распространенные артефакты, сокращения, специфическую лексику и действовавшие тогда орфографические нормы.
Сначала программа делит скан на отдельные смысловые элементы, включая заголовки, основной текст, таблицы и изображения. После визуальной очистки и распознавания через OCR модель объединяет разорванные слова и восстанавливает последовательность абзацев.
Разработчики видят основное применение технологии в архивах, библиотеках и научных проектах по оцифровке фондов. Также рассматривается дальнейшая адаптация для юридической и криминалистической работы, а также для обработки документов, пострадавших при чрезвычайных ситуациях.