面向不均衡数据集的过抽样数学模型构建
2021-11-17杨思狄王亚玲
计算机仿真 2021年5期
杨思狄,王亚玲
(内蒙古大学满洲里学院,内蒙古 呼伦贝尔 021400)
1 引言
机器学习技术发展迅速,不均衡数据集分类问题已成为机器学习领域的研究热点,不均衡数据集分类问题可完善机器学习体系,具有重要的应用价值[1]。不均衡数据集指数据集内部分类样本明显高于其它类样本,样本较多的类以及样本较少的类分别为多数类与少数类。
文本分类、信息检索在众多实际应用领域中均存在大量不均衡数据集情况。目前,通常采用数据层方法以及算法层方法解决不均衡数据集分类问题[2],算法层方法是通过调节概率密度、成本函数等方式提升少数类样本分类效果;数据层方法又称为重抽样方法,主要方式是操作训练集,利用完成操作的样本训练分类器,提升少数类样本分类效果[3]。重抽样方法主要包括过抽样以及欠抽样两部分,欠抽样仅可降低训练集的非平衡度,容易出现忽略多数类内有用信息的情况;过抽样可利用已有少数类信息以及复制少数类样本生成人工样本[4,5],提升少数类样本规模,令少数类样本具有较高的分类效果。除此之外,宋玲玲等人研究改进的XGBoost在不平衡数据处理中的应用[6];段化娟等人研究一种面向不平衡分类的改进多决策树算法[7],采用传统方法进行过抽样容易导致过学习情况,识别多数类样本识别率较高,对少数类识别率较低,对于少数类样本的分类精度并不理想。因此,需要采用高效方法优化传统过抽样算法,提升过抽样算法的分类精度。……
登录APP查看全文
