一种基于黏液菌觅食机制的特征选择算法及其在文本情感识别中的应用
2021-11-11徐济惠颜晨阳
徐济惠,颜晨阳
(宁波城市职业技术学院 信息与智能工程学院,浙江 宁波 315211)
文本情感分析指的是从文本中提取情感信息,进而对文本感情极性进行分类。词袋模型(Bag of words,BOW)结合各类机器学习分类算法是目前进行文本情感分析的主要方法之一,但词袋模型可能会生成维度极高、冗余度极大,甚至包含了许多噪声的特征空间,将这些特征直接用于机器学习分类算法会造成“维度灾难”,且会造成数据处理中所谓GIGO(Garbage in,garbage out)[1]的后果,特征选择正是解决这一问题的有效工具。
特征选择实际上是一类子集求解问题(Sub set problem,SSP),且是一个NP-hard问题[2]。常见的特征选择方法可以分为三类[3]:(1)过滤方法(Filter),也即采用某种指标计算对每个特征评分,由高到低选择特征,特征选择过程与后续分类模型无关。常见的有reliefF系列算法[4]、基于粗糙集理论(Rough set theory)[5]、相关系数(Correlation coefficient)[6]、互信息(Mutual information)[7],卡方检验(Chi squared test)[8],信息增益(Information gain)[9],词频-逆文档频率(tf-idf)[10]等等的方法。(2)基于封装器的方法(Wrapper),即在候选集合中搜索使用特定分类模型能够获得最好性能的特征子集,封装器方法往往和具体启发式搜索算法[11],尤其是一些集群仿生优化算法[12,13]结合在一起,如进化算法[14,15]、粒子群优化算法[16,17]、蚁群优化算法[18,19],以及其他各类启发式算法[20-22]。(3)嵌入式方法(Embedded)。嵌入式选择是将特征选择过程与学习器训练过程融合为一体,两者在同一个优化过程中完成,即在学习器训练过程中自动地进行了特征选择。最典型的就是基于L1正则化的学习方法,如LASSO[23]和l1-SVM[24]等。
本文将提出一种模仿黏液菌觅食决策的特征选择算法(Slime-FS),这种算法大体上仍是一种封装方法,但也有过滤方法的一些特点。……
