Разработка набора моделей по анализу текстов, разметка текстового массива при помощи генеративных моделей
Выполнен целевой набор задач и активностей Изучение методов анонимизации персональных данных с использованием внутренних моделей и кода (RU LLAMA/BERT для NER + замена персональных данных по правилам) было завершено. Был настроен пайплайн для анон...

Задача
Клиенту нужно было обработать большой массив текстов: классифицировать документы, проставить теги и метки, выделить тематики и сущности. Ручная разметка такого объёма дорога и медленна, а нанимать и обучать команду разметчиков под разовый или периодический процесс невыгодно. Задача: построить набор моделей для анализа текстов и автоматизировать разметку массива при помощи генеративных моделей с приемлемым качеством.
Решение
Мы разработали набор моделей для анализа текстов и наладили автоматическую разметку массива. Генеративные модели берут на себя первичную разметку: классифицируют тексты по категориям, выделяют сущности и тематики, проставляют теги по заданной схеме. На основе размеченных генеративными моделями данных мы дообучаем компактные классификаторы, которые работают быстро и дёшево на больших объёмах. Спорные и низкоуверенные случаи отправляются на проверку человеку, а его правки возвращаются в обучение.
Технологии
Генеративные модели для разметки и извлечения сущностей с промпт-инжинирингом под схему задачи. Дообученные классификаторы на трансформерных архитектурах для промышленного прогона по массиву. Активное обучение: модель отбирает спорные примеры для ручной проверки. Пайплайн разметки, валидации и переобучения. Инференс развёрнут на платформе Z-mind.
Результат
Разметка большого текстового массива выполнена без найма команды разметчиков: генеративные модели сделали основной объём, человек проверял только спорное. Получен набор моделей, который классифицирует и размечает новые тексты автоматически. Стоимость и сроки обработки снизились в разы по сравнению с ручным подходом. Схема активного обучения позволяет наращивать качество по мере накопления проверенных примеров.
Похожие кейсы
NLP
Arkeda
Данные в бумажных документах получить сложно и медленно Бумаги требуют много ручного труда и человеческих ресурсов Оцифрованные документы содержат много ошибок Неструктурированные данные приводят к сбоям в принятии решений Многие отрасли тонут в б...
NLP
AI Documents - Платформа kosynka
Договоры компании предусматривают разнообразные условия. При этом существенная часть условий автоматизированно не учитываются и не контролируются
NLP
Модель автоматической классификации текстов обращений клиентов
Автоматизировать процесс классификации входного потока текстовой информации по тематическим разделам