一种软件缺陷不平衡数据分类新方法
2021-04-10刘文英林亚林李克文雷永秀
山东科技大学学报(自然科学版) 2021年2期
刘文英,林亚林,李克文,雷永秀
(中国石油大学(华东) 计算机科学与技术学院,山东 青岛 266580)
对软件缺陷预测的研究表明,80%的缺陷集中发生在20%的模块中,这说明软件系统中的数据分布是不平衡的,有缺陷模块的数量远远少于无缺陷模块的数量。虽然有缺陷类样本的数量很少,但正确识别有缺陷样本是软件缺陷预测的关键,错误预测有缺陷样本可能会导致遗漏关键错误从而增加软件开发成本。因此,解决不平衡数据问题对于提高软件质量、减少预测误差和成功部署软件具有重要意义。
不平衡数据处理[1]是机器学习研究中的热点之一,更是软件缺陷预测方向不可或缺的部分,已有不少学者专注于不平衡数据的研究。目前公认的解决不平衡数据问题的方法是从数据和算法两个层面进行的。数据层面通过采样方法进行处理,算法层面通过应用集成分类算法、代价敏感算法等处理数据。例如,Patel等[2]提出合并自适应K最近邻和模糊K最近邻的方法来提高不平衡数据的分类性能。Marwa等[3]提出一种多目标进化方法优化倾斜决策树,并将其应用到不平衡数据分类。Liu等[4]提出了两阶段成本敏感学习方法,该方法将成本信息处理分为特征选择和分类两个阶段。Rodriguez等[5]比较了成本敏感算法、采样方法、混合技术和集成技术来处理不平衡数据集,结果表明,不平衡数据经过处理后提高了预测模型的性能。Ruchika等[6]提出一种新的过采样算法SPIDER3,并将采样算法与成本敏感分类器结合使用,解决缺陷数据集的不平衡问题,提高预测模型的性能。……
登录APP查看全文
