APP下载

基于分层重组的不平衡数据采样方法研究

2021-09-13邓明阳郭应时

关键词:分类方法

邓明阳,郭应时,刘 通

(1.长安大学 汽车学院, 西安 710064; 2.长春工业大学人文信息学院 汽车工程学院, 长春 130122;3.重庆交通大学 交通运输学院, 重庆 400074)

数据采样作为机器学习中对数据处理的常用方法,经常用于不平衡数据的重采样过程。在现实生活中,各个领域都会产生诸多不平衡数据集合,如在自动驾驶汽车市场调查中,不同地区、不同车型的样本中都会出现多种类小样本数据;其他行业如一年中天气的统计,工厂产品抽样检测,临床医学数据统计中也会涉及到多种类的不平衡数据。由于小样本数据具有种类多、信息量丰富和价值高等特点,数据采样中不可被舍弃,而现有的主流分类算法无法对不平衡数据进行精确处理。故此,需要重新采样来保留高价值的小样本数据[1]。为保证数据分类的精准性,不平衡样本的重采样既要保持原有各个样本的数据特征,又要保持样本中各个分类数据的平衡性。因此,多种类不平衡数据的采样成为机器学习中诸多学者研究的重点领域。

1 采样算法

目前,对平衡数据采样方法的研究主要以数据过采样、欠采样和混合采样为主,每种方法适用的条件各不相同。1993年,自Anand等[2]发现不平衡数据影响神经网络算法的收敛性以来,针对不平衡数据的采样方法被逐渐完善。1995年,Vapnik[3]首次提出一种机器学习算法,命名为支持向量机算法,不仅代替了之前随机采样分类方法,还解决了不同样本的分类问题。在此基础上,各国学者不断提出各种改进算法。……

登录APP查看全文

猜你喜欢

分类方法
分类算一算
垃圾分类的困惑你有吗
学习方法
教你一招:数的分类
用对方法才能瘦
四大方法 教你不再“坐以待病”!
赚钱方法
给塑料分分类吧
捕鱼