密度峰值优化的球簇划分欠采样不平衡数据分类算法
2022-06-21刘学文王继奎杨正国李强易纪海李冰聂飞平
计算机应用 2022年5期
刘学文,王继奎*,杨正国,李强,2,易纪海,李冰,聂飞平
(1.兰州财经大学 信息工程学院,兰州 730020; 2.甘肃省电子商务技术与应用重点实验室(兰州财经大学),兰州 730020;3.西北工业大学 光学影像分析与学习中心,西安 710072)(∗通信作者电子邮箱wjkweb@163.com)
密度峰值优化的球簇划分欠采样不平衡数据分类算法
刘学文1,王继奎1*,杨正国1,李强1,2,易纪海1,李冰1,聂飞平3
(1.兰州财经大学 信息工程学院,兰州 730020; 2.甘肃省电子商务技术与应用重点实验室(兰州财经大学),兰州 730020;3.西北工业大学 光学影像分析与学习中心,西安 710072)(∗通信作者电子邮箱wjkweb@163.com)
在集成算法中嵌入代价敏感和重采样方法是一种有效的不平衡数据分类混合策略。针对现有混合方法中误分代价计算和欠采样过程较少考虑样本的类内与类间分布的问题,提出了一种密度峰值优化的球簇划分欠采样不平衡数据分类算法DPBCPUSBoost。首先,利用密度峰值信息定义多数类样本的抽样权重,将存在“近邻簇”的多数类球簇划分为“易误分区域”和“难误分区域”,并提高“易误分区域”内样本的抽样权重;其次,在初次迭代过程中按照抽样权重对多数类样本进行欠采样,之后每轮迭代中按样本分布权重对多数类样本进行欠采样,并把欠采样后的多数类样本与少数类样本组成临时训练集并训练弱分类器;最后,结合样本的密度峰值信息与类别分布为所有样本定义不同的误分代价,并通过代价调整函数增加高误分代价样本的权重。在10个KEEL数据集……
登录APP查看全文
