基于熵的多尺度多重集值信息系统的最优尺度选择与属性约简
2023-07-21王蕾晰吴伟志谢祯晃
模式识别与人工智能 2023年6期
关键词:定义
王蕾晰 吴伟志 谢祯晃
大数据时代下,各行各业产生的数据具有不确定性和复杂性.高效处理数据,挖掘数据背后的规律,并运用于实际问题是数据挖掘的主要任务.粒计算[1-3]是模拟人脑思维以处理数据不确定性和复杂性的一种方法,源于Zadeh[4]提出的“信息粒度”概念.粒计算的核心思想是通过合适的粒化提取信息粒,对信息粒进行处理和计算,进而分析数据规律和解决实际问题[5-7].
在粒计算的研究和发展过程中,粗糙集数据分析发挥重要的作用.粗糙集最早由Pawlak[8]于1982年提出.粗糙集最初讨论的对象-属性取值多为数值或符号.随着数据挖掘的不断深入和实际应用的需要,学者们研究数据类型日趋多样化,如集值、区间值、区间集、模糊数、混合数据类型等.
多重集[9-11]是一种元素可重复出现的集合,元素在多重集中出现的次数称为该元素在多重集中的重数并且元素的顺序可以互换.多重集在组合数学[12]、关系数据库理论[13]、图论[14]等领域都有重要应用.可以使用多重集描述决策分析中很多问题的数据.例如,在专家评审系统中,有4位专家参与评审,专家评审结果可能存在重复,如多重集{well,well,well,bad}中的元素分别为4位专家的评审结果.如果用经典集合{well,bad}则无法体现专家对评审对象的具体评价.此外,多重集在模式识别[15-16]、多准则决策[17]、医疗诊断[18]等领域也有重要应用.
当信息系统的对象-属性取值为多重集时,该系统称为多重集值信息系统,多重集值信息系……
登录APP查看全文
