APP下载

基于矩阵分解填充的无监督特征选择方法*

2021-08-30范林歌武欣嵘曾维军

通信技术 2021年8期
关键词:特征方法

范林歌,武欣嵘,童 玮,曾维军

(陆军工程大学,江苏 南京 210007)

0 引言

随着科技的飞速发展,产生了大量数据,而且用于数据挖掘的数据维数越来越大,但高维数据不可避免地含有冗余信息,这不利于后续的数据分析与挖掘。特征选择和特征提取是处理这些高维数据的有力工具。它们的主要区别是特征选择保留原有特征,而特征提取产生新的特征。但是特征选择更具有可解释性,所以本文将重点放在特征选择技术上。

特征选择的目标是从原始特征中选择一个子集,这些子集对后续的任务具有信息性和价值。此外,所选特征还可以加快数据处理速度,提高模型的泛化能力。根据是否使用标签信息,特征选择方法可以分为监督特征选择[1]、半监督特征选择[2-3]和无监督特征选择[4](Unsupervised Feature Selection,UFS)3 种不同类型。有监督特征选择通过评估特征与类标签的相关性来确定特征相关性,半监督特征选择同时使用有标签(数量少)和无标签(数量多)数据,而UFS 利用数据方差和可分离性来评估没有任何类标签的特征的相关性。在许多现实应用程序中,数据标签难以获得,重建模型的代价也很高。因此,无监督和半监督的特征选择方法更为实用。本文主要研究UFS。

传统的UFS 方法,比如主成分分析分数法(Principal Components Analysis,PCAScore)[5]和拉普拉斯分数法(Laplacian Score,LapScore)[6],根据为每个特征计算的分数选择排名最高的特征。Liu 等人[7]提出了一种新的称为多群集特征选择(Multi-Cluster Feature Selection,MCFS)的方法,用于UFS。MCFS 考虑了不同特征之间可能的相关性,并使用了数据的光谱分析(流形学习)和正则化模型进行子集选择。……

登录APP查看全文

猜你喜欢

特征方法
如何表达“特征”
不忠诚的四个特征
学习方法
用对方法才能瘦
四大方法 教你不再“坐以待病”!
赚钱方法
捕鱼
线性代数的应用特征