Все кейсы
NLP1 января 2024 г.

Разработка набора моделей по анализу текстов, разметка текстового массива при помощи генеративных моделей

Выполнен целевой набор задач и активностей Изучение методов анонимизации персональных данных с использованием внутренних моделей и кода (RU LLAMA/BERT для NER + замена персональных данных по правилам) было завершено. Был настроен пайплайн для анон...

Разработка набора моделей по анализу текстов, разметка текстового массива при помощи генеративных моделей

Задача

Клиенту нужно было обработать большой массив текстов: классифицировать документы, проставить теги и метки, выделить тематики и сущности. Ручная разметка такого объёма дорога и медленна, а нанимать и обучать команду разметчиков под разовый или периодический процесс невыгодно. Задача: построить набор моделей для анализа текстов и автоматизировать разметку массива при помощи генеративных моделей с приемлемым качеством.

Решение

Мы разработали набор моделей для анализа текстов и наладили автоматическую разметку массива. Генеративные модели берут на себя первичную разметку: классифицируют тексты по категориям, выделяют сущности и тематики, проставляют теги по заданной схеме. На основе размеченных генеративными моделями данных мы дообучаем компактные классификаторы, которые работают быстро и дёшево на больших объёмах. Спорные и низкоуверенные случаи отправляются на проверку человеку, а его правки возвращаются в обучение.

Технологии

Генеративные модели для разметки и извлечения сущностей с промпт-инжинирингом под схему задачи. Дообученные классификаторы на трансформерных архитектурах для промышленного прогона по массиву. Активное обучение: модель отбирает спорные примеры для ручной проверки. Пайплайн разметки, валидации и переобучения. Инференс развёрнут на платформе Z-mind.

Результат

Разметка большого текстового массива выполнена без найма команды разметчиков: генеративные модели сделали основной объём, человек проверял только спорное. Получен набор моделей, который классифицирует и размечает новые тексты автоматически. Стоимость и сроки обработки снизились в разы по сравнению с ручным подходом. Схема активного обучения позволяет наращивать качество по мере накопления проверенных примеров.