ISSN 2713-3192 · EISSN 2713-3206
Языки: ru · en

Статья: КОМБИНИРОВАННЫЙ МЕТОД ИЗВЛЕЧЕНИЯ ТЕРМИНОВ ДЛЯ ЗАДАЧИ МОНИТОРИНГА ТЕМАТИЧЕСКИХ ОБСУЖДЕНИЙ В СОЦИАЛЬНЫХ МЕДИА (2024)

Читать онлайн

Извлечение терминов является важным этапом автоматизированного построения систем знаний на основе естественно-языковых текстов, поскольку обеспечивает формирование базовой системы понятий, используемой затем в прикладных задачах интеллектуальной обработки информации. В статье рассмотрена проблема автоматизированного извлечения терминов из естественно-языковых текстов с целью их дальнейшего использования при построении формализованных систем знаний (онтологий, тезаурусов, графов знаний) в рамках задачи мониторинга тематических обсуждений в социальных медиа. Данная задача характеризуется необходимостью включения в формируемую систему знаний как понятий из нескольких различных предметных областей, так и некоторых общеупотребительных понятий, используемых аудиторией социальных медиа в рамках тематических обсуждений. Кроме того, формируемая система знаний является динамичной как с точки зрения состава охватываемых ею предметных областей, так и состава релевантных понятий, подлежащих включению в систему. Применение существующих классических методов извлечения терминов в данном случае затруднительно, поскольку они ориентированы на извлечение терминов в рамках одной предметной области. Исходя из этого, для решения рассматриваемой задачи предложен комбинированный метод, совмещающий в себе подходы на основе внешних источников знаний, инструментов NER и правил. Результаты проведенных экспериментов демонстрируют эффективность предложенной комбинации подходов к извлечению терминов для задачи мониторинга и анализа тематических обсуждений в социальных медиа. Разработанный метод значительно превосходит по точности существующие инструменты извлечения терминов. В качестве дальнейшего направления исследования рассмотрена возможность развития метода для решения задачи выделения вложенных терминов или сущностей.

Ключевые фразы: ИНТЕЛЛЕКТУАЛЬНЫЙ АНАЛИЗ ТЕКСТОВ, ИЗВЛЕЧЕНИЕ ТЕРМИНОВ, СОЦИАЛЬНЫЕ МЕДИА, ИЗВЛЕЧЕНИЕ ЗНАНИЙ
Автор (ы): Пимешков Вадим Константинович, Никонорова Марина Леонидовна, Шишаев Максим Геннадьевич
Журнал: ИНФОРМАТИКА И АВТОМАТИЗАЦИЯ

Идентификаторы и классификаторы

УДК
004.912. Обработка текста
eLIBRARY ID
68499958
Для цитирования:
ПИМЕШКОВ В. К., НИКОНОРОВА М. Л., ШИШАЕВ М. Г. КОМБИНИРОВАННЫЙ МЕТОД ИЗВЛЕЧЕНИЯ ТЕРМИНОВ ДЛЯ ЗАДАЧИ МОНИТОРИНГА ТЕМАТИЧЕСКИХ ОБСУЖДЕНИЙ В СОЦИАЛЬНЫХ МЕДИА // ИНФОРМАТИКА И АВТОМАТИЗАЦИЯ. 2024. Т. 23 № 4
Текстовый фрагмент статьи