Статья: РАЗРАБОТКА МЕТОДА ОБРАБОТКИ НЕСЛОВАРНЫХ СЛОВ ДЛЯ ПОВЫШЕНИЯ ТОЧНОСТИ МОРФОЛОГИЧЕСКОГО АНАЛИЗА ТЕКСТОВ НА РУССКОМ ЯЗЫКЕ (2024)

Читать онлайн

Необходимость автоматической обработки текстовой информации из-за постоянного увеличения ее количества привела к появлению программных продуктов для автоматизации обработки текста на естественном языке. Сложность естественного языка обусловила разделение процесса анализа текста на несколько последовательных этапов - графематического, морфологического, синтаксического и семантического. Точность обработки на каждом из этапов влияет на последующие этапы анализа текста. На морфологическом этапе анализа текста происходит определение для каждого слова морфологических характеристик. Одним из способов проведения морфологического анализа является метод с использованием словаря словоформ. Его преимуществом является высокая точность из-за хранения лексем целиком, что позволяет учитывать исключения, встречающиеся в естественном языке. Однако, сложность постоянной поддержки словаря в актуальном состоянии из-за развития языка, а также встречающиеся в текстах опечатки показывают необходимость наличия в морфологических анализаторах возможности проведения морфологического анализа несловарных слов. В рамках статьи проведен обзор существующих методов морфологического анализа несловарных слов, а также предложен собственный метод обработки неизвестных слов, учитывающий особенности словообразования в русском языке и реализованный в одном из постоянное развивающийся инструмента морфологического анализа JMorfSdk.

Ключевые фразы: морфологический анализ, несловарные слова, АВТОМАТИЧЕСКАЯ ОБРАБОТКА ТЕКСТА, компьютерная лингвистика, инструменты анализа текста, ПРИКЛАДНАЯ ЛИНГВИСТИКА
Автор (ы): Рыкунов Александр Николаевич, Полицына Екатерина Валерьевна, Полицын Сергей Александрович, Поречный Александр Сергеевич
Журнал: ВЕСТНИК ВОРОНЕЖСКОГО ГОСУДАРСТВЕННОГО УНИВЕРСИТЕТА. СЕРИЯ: СИСТЕМНЫЙ АНАЛИЗ И ИНФОРМАЦИОННЫЕ ТЕХНОЛОГИИ

Предпросмотр статьи

Идентификаторы и классификаторы

SCI
Информатика
УДК
519.862.6. Эконометрика (математические вопросы)
Для цитирования:
РЫКУНОВ А. Н., ПОЛИЦЫНА Е. В., ПОЛИЦЫН С. А., ПОРЕЧНЫЙ А. С. РАЗРАБОТКА МЕТОДА ОБРАБОТКИ НЕСЛОВАРНЫХ СЛОВ ДЛЯ ПОВЫШЕНИЯ ТОЧНОСТИ МОРФОЛОГИЧЕСКОГО АНАЛИЗА ТЕКСТОВ НА РУССКОМ ЯЗЫКЕ // ВЕСТНИК ВОРОНЕЖСКОГО ГОСУДАРСТВЕННОГО УНИВЕРСИТЕТА. СЕРИЯ: СИСТЕМНЫЙ АНАЛИЗ И ИНФОРМАЦИОННЫЕ ТЕХНОЛОГИИ. 2024. № 1
Текстовый фрагмент статьи