面向不平衡数据分类的研究与应用
2021-09-22郑玮周盛
电子技术与软件工程 2021年13期
郑玮 周盛
(中航西安飞机工业集团股份有限公司 陕西省西安市 710089)
1 引言
不平衡数据集是指由不同类别的数据组得到的集合,某些类别的数据量远大于其他类别,存在着严重的不平衡[1]。现阶段不平衡数据集常被应用于网络入侵检测[2]、欺诈检测[3]、信用卡诈骗[4]等领域,研究人员通过少量的样本完成分类,以得到核心内容。因此,针对不平衡数据集,改变分布,完成分类的有效处理,获取核心数据集,对于不平衡数据集的研究具有重要的理论意义。基于此,为了提高不平衡分类的处理效率,降低时间复杂度,本文将面向不平衡数据完成分类处理。
2 分类算法概述
2.1 基本分类算法概述
机器学习[5]可以定义为:通过已有的函数或者数学模型,结合数据集的输入输出关系,完成对数据集的研究与分析。即在监督学习中,通过标签与特征值的分布,构建训练模型,进而实现数据集的分析处理,完成不平衡数据集的分类;并且由数据集的特征值来赋予不同的标签信息,得到目标函数,实现不平衡数据的基本分类处理,以便于用户对所需要信息的使用。
2.2 不平衡分类算法概述
常用的不平衡分类算法主要划分为基于过采样的分类与基于欠采样的分类。其中,过采样的主要方法是复制或生成少数类样本,而欠采样则是降低不平衡比率,确保数据集能趋于平衡。为了简化操作步骤,便于用户的了解,该算法不需要改变算法本身,主要对数据集预处理,能够被适用于分类。……
登录APP查看全文
