基于自适应邻域和自表示正则的无监督特征选择算法
2021-09-15张继炎王慧玲黄宏昆刘艳芳
南京理工大学学报 2021年4期
彭 明,张继炎,王慧玲,黄宏昆,刘艳芳
(1.龙岩学院 数学与信息工程学院,福建 龙岩 364012;2.伊犁师范大学 电子与信息工程分院,新疆 伊宁 835000)
随着技术的发展,大量高维数据已成为许多应用领域的问题,例如计算机视觉[1,2],数据挖掘[3-5]和模式识别[6]。高维数据不仅增加了运算的时间复杂度和空间复杂度,也会导致学习模型的过拟合现象。同时,高维数据通常包含很多与学习任务无关的噪声和冗余信息。特征选择是从原始数据中选择最具代表性和区分性的特征子集,是处理高维数据的最重要方法之一。
根据数据中是否有标签信息,特征选择分为监督特征选择、半监督特征选择和无监督特征选择。在许多场合下获取标签很费力,因此在实际应用中,无监督特征选择更为实用,它通过聚类[7,8]将无标签的数据根据某种评估标准划分成有意义或有用的簇,但不可避免会遇到很多挑战。在过去的几十年中,国内外许多研究人员在无监督特征选择方面做出了巨大的努力。流形学习[9]验证了高维空间的数据可以在低维空间表示,且被成功应用于无监督特征选择算法中,构造出了一系列性能良好的基于图正则的无监督特征选择算法。主要算法有:基于拉普拉斯打分的特征选择(Laplacian score,LS)[10]根据同类数据较紧凑的特性,利用K近邻得到数据的局部几何结构图,然后计算每个特征的得分选择特征;基于非负谱分析的无监督特征选择算法[11]通过K近邻的相似矩阵……
登录APP查看全文
