Разработка модели по распознаванию и выделению контентной части документа
На вход системе подается набор однообразных документов. Необходимо построить систему, которая сможет заполнять электронную версию этих документов с высокой точностью. Требуется построить как средство разметки, так и модель распознаванию, основанну...

Задача
Автоматизировать заполнение электронных форм по однотипным бумажным или сканированным документам. На вход системы поступает набор сканов документов одного типа (анкеты, бланки, формы) — нужно без ручного ввода распознать содержимое и заполнить соответствующие поля электронной формы с высокой точностью.
Решение
Разработан программный комплекс из двух взаимосвязанных компонентов.
Компонент 1 — Инструмент разметки документов:
- Позволяет описать структуру нового типа документа: указать расположение каждого поля, его тип и связь с полем электронной формы
- Хранит описания структуры в системе
- Расширяем: новый тип документа добавляется через интерфейс разметки без написания кода
Компонент 2 — Модель распознавания:
Обработка каждого документа проходит в 4 этапа:
-
Text Detection (TD) — локализация всех текстовых блоков на изображении документа. Находит границы текста независимо от ориентации и качества скана.
-
OCR (Optical Character Recognition) — распознавание символов внутри найденных блоков. Поддерживает кириллицу, латиницу, цифры.
-
Document Classification — определение типа документа по структуре и содержимому. Нужно при обработке смешанного потока документов разных видов.
-
Document Recognition — извлечение конкретных смысловых полей и их маппинг на поля электронной формы.
Результат
Метрики на тестовой выборке:
- OCR: 96%
- Text Detection: 98%
- Document Classification: 99%
- Document Recognition: 94%
Система обеспечивает точность, сопоставимую с ручным вводом квалифицированного оператора, при скорости обработки сотен документов в час. Применима в: банках (анкеты клиентов), страховании (бланки заявлений), медицине (медицинские формы), госсекторе (административные документы).
Система применима в: банках (обработка анкет и заявлений клиентов), страховании (заявления о страховых случаях), медицине (заполнение медицинских форм), государственном секторе (обработка административных документов), логистике (транспортные и таможенные документы). Решение сокращает ручной ввод данных и снижает количество ошибок операторов.
Подход TD+OCR+Classification+Recognition обеспечивает стабильную высокую точность на однотипных документах даже при плохом качестве скана, повороте страниц и различных шрифтах.
Похожие кейсы
Машинное зрение
Машинное зрение + LLM на промышленном объекте: выявлены хищения в пилоте
Юнипро: контроль ввоза/вывоза транспорта и строительных работ на энергетическом объекте — машинное зрение, Large Vision Model и LLM. В пилоте выявлены хищения, сумма которых превысила стоимость проекта.
Машинное зрение
Разработка онлайн примерочной чехлов для диванов
Еврочехол: AR-примерочная на сайте — покупатель загружает фото своего дивана и видит, как на нём будет смотреться выбранный чехол. Снижение возвратов на 15%, рост конверсии.
Машинное зрение
Система автоматизированного доступа и видеоаналитики покупателей
Для крупной российской сети магазинов: ИИ-система на базе компьютерного зрения анализирует эмоциональные реакции покупателей на товар в реальной торговой точке — гендер, эмоции на трёх этапах контакта с продуктом.