APP下载

基于属性选择和采样策略的不平衡数据动态分类方法

2021-06-22赵冬雪王利东

数据采集与处理 2021年3期
关键词:分类实验模型

赵冬雪,王 昕,王利东

(大连海事大学理学院,大连116026)

引 言

类失衡是现实生活中普遍存在的问题,正确识别少数类样本可以获取重要的信息。例如,银行欺诈行为预测(发生欺诈情况远小于正常交易的情况),医疗系统中识别癌症病变(癌变细胞相对于正常细胞的数量极少),工厂机器系统的异常检测(绝大多数时间运转是正常的,极少数时间是非正常的)等均涉及不平衡数据的处理。特别是在大数据背景下,数据比例严重失衡,给生产、生活实践带来巨大挑战。

分类任务中的数据不平衡问题[1]体现在样本类别分布呈偏斜状态,即数据集中一个或多个类(多数类)的样本数量远远超过其他类别(少数类)。而多种经典分类算法是以准确率为主要衡量指标,会侧重多数类的正确率而忽略识别少数类的重要价值,从而难以获得理想的分类结果。因此,数据不平衡问题引起了研究者的关注,并且提出了多种处理方法[2⁃4]。总体来看,解决方案主要采取数据预处理和新算法设计,如数据重采样技术和集成学习等技术。

重采样技术[5]旨在调整各类别间的不平衡率,常用的重采样技术有随机欠采样、SMOTE过采样[6]等。随机欠采样通过降低多数类样本数量达到平衡的目的,但会导致多数类样本信息的丢失;SMOTE过采样通过少数类样本生成新样本,使不平衡数据在一定程度上达到平衡状态,但不足之处在于盲目地扩充少数类容易模糊决策边界。因此许多研……

登录APP查看全文

猜你喜欢

分类实验模型
一半模型
记一次有趣的实验
分类算一算
重尾非线性自回归模型自加权M-估计的渐近分布
做个怪怪长实验
教你一招:数的分类
3D打印中的模型分割与打包
NO与NO2相互转化实验的改进
实践十号上的19项实验