快速求解粒球粗糙集约简的属性划分方法
2021-04-09杨习贝
南京理工大学学报 2021年4期
巴 婧,陈 妍,杨习贝
(江苏科技大学 计算机学院,江苏 镇江 212100)
作为处理连续型和混合型等复杂数据的一种拓展粗糙集方法[1,2],胡清华等[3]提出的邻域粗糙集因其灵活的粒度表现形式,受到了众多研究学者的青睐。然而,在使用邻域粗糙集进行属性约简[4-6]这一问题的研究时,往往需要通过大量的尝试或采用一定的参数搜索策略来设置邻域半径的大小[7-9],这势必会带来极大的时间消耗。
为了克服邻域粗糙集中半径选取这一困难,已有相关学者借助自适应的理念,提出了一些能够自主确定半径大小的策略。例如,Zhou等[10]面向在线特征选择问题,提出了Gap邻域的概念,其使用样本间距离的差值确定邻域的大小,从而生成较为紧凑的Gap邻域粒结构;Xia等[11]为提升大规模数据中分类任务的效率,提出了粒球的概念,其过程是迭代使用2-means聚类,从数据自身的分布出发,生成大小不一的粒球,直至粒球的纯度达到预期目标。
粒球的纯度实际上是粒球中样本的标签与粒球标签相吻合的样本的比重,采用这一概念,Xia等[12]进一步地进行了基于粒球纯度的属性约简问题的研究。然而,若采用贪心搜索策略对基于粒球纯度的约简进行求解,依然会存在候选属性空间较大的问题,从而致使搜索效率不高。例如,采用后向贪心搜索时,对于每一个候选属性都要进行逐步的评估与尝试,以判断该属性是否可以被删除;而采用前向贪心搜索时,依然需要对每一个候选属性进行逐步的评估与尝试,以判断该属性是否可以被加入到约简集合中。……
登录APP查看全文
