多重筛选的随机森林不平衡特征选择算法研究
2021-11-29王红霞汪楷翔
沈阳理工大学学报 2021年5期
王红霞,汪楷翔
(沈阳理工大学 信息科学与工程学院,沈阳110159)
工业传感器所采集的数据集为典型的高维不平衡数据集,本文以工业冲压机温度传感器、压力传感器、三相电传感器等数据集为实验对象,针对随机森林算法对不平衡数据的特征选择与分类问题进行优化。
分类算法包括随机森林、朴素贝叶斯、决策树、K近邻算法、支持向量机算法等。这些分类算法通常假设数据集合中每个类别数量相同,即数据是平衡的。但在现实中,如工业生产过程中大部分时间设备运行为正常状态,故传感器采集到的正常数据要远远大于异常数据。少数类数据量非常少,多数类数据数量非常多,数据是非常不平衡的。本文实验使用的冲压机传感数据集大小为10000条,特征维度为15维,且少数类数据占比不到15%,数据集非常容易发生过拟合的现象。因此针对不平衡数据集研究效率较高的特征选择算法非常必要。
文献[1]中提出针对非平衡数据改进的随机森林分类算法,通过对抽样结果增加约束条件来改进装袋(bagging)重抽样方法,减少抽样对非平衡性的影响。但此方法必须保证每次抽到的少数类样本至少要占总体少数类样本的2/3,约束条件过于严格。文献[2]提出了基于混合采样策略的改进随机森林分类算法,但其算法过采样参数和欠采样参数均随机生成,算法存在较高的不稳定性。文献[3]提出了通过改进网格搜索的随机森林参数优化,其优化方式仅在决策树的数量以及分裂属性上增强,对数据集没有进行改进。……
登录APP查看全文
