APP下载

基于邻域区间扰动融合的无监督特征选择算法框架

2021-09-15吕晓林

南京理工大学学报 2021年4期
关键词:监督特征方法

吕晓林,杜 亮,2,周 芃,吴 鹏,2

(山西大学 1.计算机与信息技术学院;2.大数据科学与产业研究院,山西 太原 030006;3.安徽大学 计算机科学与技术学院,安徽 合肥 230601)

高维大数据在许多领域随处可见,科技的进步更是加快了大数据的产生,每天都会有数亿的数据产生,以文本、图像、音频、视频等形式存在,覆盖于各个领域。面对如此庞大的数据,从中选择出合适的信息对学习工作进行指导变得极为困难。在这种境况下,特征选择技术显得尤为重要。特征选择技术的主要目的是在一个特定的评估标准下,从原始的高维特征中选择出最重要的特征子集,然后利用选择出的特征子集结合一些有效的算法去完成数据聚类、分类等任务。

根据数据样本是否含有标签信息,特征选择算法可分为有监督特征选择[1,2]、半监督特征选择[3-5]和无监督特征选择[6-8]3类。有监督和半监督特征选择通常会用到样本的标签信息,通过特征和标签信息之间的相关性来评定特征的重要性。现实中采集到的数据很少有标签信息,并且标记标签信息的代价很昂贵,在大规模数据中更是难以实现,因此,研究无监督场景下的特征选择更具有实用价值。

无监督特征选择方法可分为3类:过滤式方法[9]、包装式方法[10]和嵌入式方法[11-13]。过滤式方法的主要思路是对每一维的特征打分,即给每一维的特征赋予权重,权重代表该维特征的重要性,然后依据权重排序。过滤式方法是独立于学习算法的,它的计算量很低,它的性能也有所欠缺。……

登录APP查看全文

猜你喜欢

监督特征方法
突出“四个注重” 预算监督显实效
如何表达“特征”
不忠诚的四个特征
监督见成效 旧貌换新颜
夯实监督之基
用对方法才能瘦
四大方法 教你不再“坐以待病”!
捕鱼
监督宜“补”不宜“比”
线性代数的应用特征