基于属性相关性与特征选择的K-近邻缺失值顺序填充算法
2021-10-12唐晗
锦绣·下旬刊 2021年11期



摘要:由于K-局部近邻插补算法无法直接计算相关性,因此在插补时难以进行特征选择,提出一种基于属性相关性的对于多维数据缺失按顺序并进行特征选择的填充方法,在解决相关性计算的问题同时提出了采用相关性进行填充顺序选择。算法首先提取完整数据集或者投影计算距离相关性,并按照一定的方式按相关性从大到小进行填充,保证在填充时不会因为特征选择出现参照数据集为空的情况,在填充时选择大于相关性临界点的特征在投影的基础上进行近邻填充。实验分别在不同缺失率下计算该方法与其它算法的均方误差结果,结果表明,该算法在填充效果上明显优于其它算法。
关键词:距离相关性;特征选择;顺序插补
引言
数据缺失在现实中是一种非常常见的现象,它产生的原因可能是信息难以获取或者是数据传输中发生错误产生遗漏。数据缺失会导致模型难以建立,使决策分析无法达到好的效果。数据挖掘中预处理占最大比重,而预处理中最关键的就是对缺失数据的处理。
常用的处理方法有加权法、删除法和插补法。加权法通过某些方法把权数从缺失单位上转移到非缺失单位上,删除法则是直接删除存在缺失单位的样本,直接得到一个完整的数据集。删除法虽然简单,但当缺失率比较高的时候可能会删除较多的样本,产生较多误差,因此国内外学者更希望采用其他方法来填补不完整数据,以保证数据的质量,即插补法,插补法是用一个或者多个估计值来代替缺失值的方法,前后分为单值插补和多重插补,常用的单值插补有均值填充、回归填充、冷卡填充和热卡填充等。……
登录APP查看全文
