基于SSDBSCAN的跨项目缺陷预测数据筛选方法
2017-09-13伍蔓张建升马传香安格格余啸
伍蔓,张建升,马传香,安格格,余啸
(1.湖北大学计算机与信息工程学院,湖北 武汉 430062;2.湖北省教育信息化工程研究中心,湖北 武汉 430062;3.武汉大学软件工程国家重点实验室,计算机学院,湖北 武汉 430072)
基于SSDBSCAN的跨项目缺陷预测数据筛选方法
伍蔓1,2,3,张建升1,2,马传香1,2,安格格3,余啸3
(1.湖北大学计算机与信息工程学院,湖北 武汉 430062;2.湖北省教育信息化工程研究中心,湖北 武汉 430062;3.武汉大学软件工程国家重点实验室,计算机学院,湖北 武汉 430072)
针对跨项目软件缺陷预测中大量不相关的跨项目数据损害了缺陷预测模型性能的问题,提出了一种基于SSDBSCAN(semi-suppervised density-based clustering)的跨项目缺陷预测数据筛选方法——SSDBSCAN filter.首先,SSDBSCAN filter结合少量带类标号的本项目历史数据、跨项目历史数据和大量不带类标号的本项目数据;然后,利用SSDBSCAN算法对这些数据进行聚类发现子簇;最后,收集子簇中的跨项目数据,不属于任何簇的跨项目数据被作为噪声数据而丢弃.实验使用15个公开的PROMISE数据集,3种分类器和4种性能度量指标.实验结果表明,相比于目前已有的Burak filter和DBSCAN filter方法,SSDBSCAN filter在提高了预测率的同时降低了误报率,且G-measure与AUC度量值更佳.
跨项目缺陷预测;数据筛选;SSDBSCAN
0 引言
软件缺陷是计算机软件或程序中存在的某个破坏正常运行能力的问题、错误以及隐藏的功能缺陷.随着软件系统在工程应用中的不断扩大,软件缺陷导致的经济损失日益增加.因此,高效的软件缺陷预测技术越来越受到研究者的关注.目前,已有很多高效的软件缺陷预……
