IMT journal
IMT journal articlePublicationAcademic article
Обработка слабоструктурированных текстовых данных для использования в моделях анализа
http://libmeta.ru/object/imt_pub_143
Abstract
При создании моделей анализа данных часто целесообразно использовать в них данные различной формы и структуры – числовые, категориальные, текстовые, видео и т.д. В статье выполнено исследование влияния текстовых данных без чёткой структуры на качество моделей анализа, выявлена зависимость точности моделей анализа от используемых способов обработки слабоструктурированных текстовых данных. Описана модель интелле ктуальной обработки слабоструктурированных текстовых данных, включающая в себя методы визуализации и алгоритмы трансформации данных, предложенные автором в предыдущих работах. Предложена модификация алгоритма трансформации ошибочных написаний, построенная на использовании моделей векторного представления слов. Проведен эксперимент по использованию данных разной структуры в рамках решения задачи классификации резюме соискателей. Приведен пример обработки слабоструктурированных текстовых данных для решения за дачи классификации резюме соискателей по подходящим им профессиям. Описаны этапы построения модели интеллектуальной обработки данных, включая разведочный анализ, извлечение и трансформацию данных. Описаны проблемы, свойственные данным, использующимся в экс перименте, таким как: орфографические ошибки, использование разной терминологии для описания одних и тех же понятий и т.д. Приведены примеры объединения словосочетаний с высокой степенью семантической близости и поиска ошибочных написаний распространенных в выборке терминов. Рассчитана точность применения моделей классификации, построенных на данных, обработанных различными способами. Эксперименты показали, что использование слабоструктурированных данных для этой задачи почти не даёт прироста точности моде ли в случае использования их без предварительной обработки и повышает точность классификации на несколько процентов в случае их корректной обработки.
Данные
| pages | 178-188 |
| year | 2023 |
| pageEnd | 188 |
| pageStart | 178 |
topic
cites
Russian text vectorization: an approach based on SRSTI classifier.
Support vector machine classification algorithm and its application.
Text preprocessing for text mining in organizational research: review and recom…
Textual analysis and machine leaning: crack unstructured data in finance and ac…
The CRISP-DM model: the new blueprint for data mining.
Approaches to visualizing big text data at the stage of collection and pre-proc…
Автоматическая обработка текстов на естественном языке и анализ данных: учеб. п…
A comprehensive survey of grammatical error correction.
A review on evaluation metrics for data classification evaluations.
Машинное обучение с помощью библиотеки Scikit-learn языка Python
Методы обработки слабоструктурированных данных в автоматизированных системах на…
Модель обработки слабоструктурированных текстовых данных на русском языке для и…
+7
references
Russian text vectorization: an approach based on SRSTI classifier.
Support vector machine classification algorithm and its application.
Text preprocessing for text mining in organizational research: review and recom…
Textual analysis and machine leaning: crack unstructured data in finance and ac…
The CRISP-DM model: the new blueprint for data mining.
Approaches to visualizing big text data at the stage of collection and pre-proc…
Автоматическая обработка текстов на естественном языке и анализ данных: учеб. п…
A comprehensive survey of grammatical error correction.
A review on evaluation metrics for data classification evaluations.
Машинное обучение с помощью библиотеки Scikit-learn языка Python
Методы обработки слабоструктурированных данных в автоматизированных системах на…
Модель обработки слабоструктурированных текстовых данных на русском языке для и…
+7
keyword
UDC
published in
in abstract
mentions concept
in keywords
Входящие связи
← contains article · 1
← fragment of · 21
Внешние ссылки
- https://www.imt-journal.ru/archive/public/article?id=302 (fullTextUrl)