面向XGBoost 的课程评价文本智能分类模型
2021-09-28晋百川杨鸿波胡大胆
软件导刊 2021年9期
晋百川,杨鸿波,胡大胆
(北京信息科技大学自动化学院,北京 100192)
0 引言
互联网的快速发展带动电商与线上教育平台融合,随之而来的是大量的商品评价和课程评价的文本信息。企业关注的是对大量评价文本信息快速处理,精准地将差评分为一类,再根据差评提取出的关键词确定企业问题所在,据此快速改进问题,弥补损失。
文本信息处理研究较多,如文献[1-5]针对KNN 算法提出了一种基于密度的样本选择算法,对文本特征进行处理,取得较好的分类效果;文献[6-8]结合文本相似度和NaveBayes 方法,提出了新的类别区分词特征选择方法;文献[9-11]提出了一种基于LDA 模型的文本分类算法,对传统的特征降维方法进行改进。以上方法对数据集要求很高,对评价日常文本内容表现欠佳。文献[12-16]采用改进的KNN 算法对短文本内容进行分类,但分类效率还有待提高;文献[17-19]使用改进的CNN 网络,在提高文本分类精度方面效果显著,但在文本处理方面还有一定不足。
以上方法均为在评价文本数据方面进行细致分类与分析。本文使用数据可视化分析方法对特征进行重点关联分析,采用jieba 分词和停用词的处理方法对文本数据进行词向量表示,使用PCA(主成分分析)进行特征降维,采用XGBoost 来训练评价文本分类模型,使用交叉验证方法选取模型的最优参数,对评价文本内容进行快速有效分类。
1 数据预处理
数据中存在一定的错误、缺失和一些劣质数据,劣质数据往往会直接导致模型效果不佳,甚至对模型精准率造成很大影响,所以在建模之前需要对数据集进行预处理。……
登录APP查看全文
