基于粗糙集理论的不完备数据分析方法的混合信息系统填补算法
2021-03-18,2*
,2*
(1.成都信息工程大学软件工程学院,成都 610225;2.西南交通大学信息科学与技术学院,成都 611756;3.成都大学计算机学院,成都 610106)
0 引言
近年来,由于数据来源广泛且复杂、人类认知的局限性,以及硬件故障、手工录入错误、编程错误等,导致数据产生一定比例的缺失,使得知识的有效获取变得愈来愈困难;如何科学地处理缺失数据、提高数据质量是当下数据挖掘领域的研究难点之一。现实生活中描述数据的形式多种多样,缺失机制也各不相同,使得基于粗糙集理论的不完备数据分析方法(ROUgh Set Theory based Incomplete Data Analysis Approach,ROUSTIDA)[1]无法满足所有数据的需求。本文立足于混合信息系统,即包含离散型(如整型、字符串型、枚举型)、连续型(如浮点数表达)、缺失型属性的信息系统,研究分析发现,混合属性将严重影响ROUSTIDA 对数据之间相似性的度量,从而使得填充效果不理想。为了解决该问题,本文在定义混合距离的基础上结合近邻思想与等价类划分原则,提出了一种基于粗糙集理论的混合信息系统缺失值填补方法(Rough Set theory based Hybrid Information System for Missing data Imputation Approach,RSHISMIA)。本文的主要工作包括5 个方面:
1)使用了混合距离量化样本间相似度。
2)定义了混合距离矩阵,剔除不具备填补能力的数据。
3)采用决策属性等价类划分思想,有效地改善了可能存在的决策属性冲突问题。
4)引入最近邻思想,减轻噪声数据的影响。
5)使用UCI 数据集与4 种填补算法进行对比实验,结果表明RSHISMIA 在查准率和查全率方面显著优于ROUSTIDA,填补后的分类准确率相较4 种对比算法也有所提高。
1 相关工作
自1970 年来,国内外陆续提出的缺失数据的处理方法大致可以分为以下3类。……
