动态权重最大相关最小冗余算法
2021-12-22殷柯欣谢爱锋翟峻仁
长春工业大学学报 2021年5期
殷柯欣,谢爱锋,翟峻仁
(长春工业大学 计算机科学与工程学院,吉林 长春 130012)
0 引 言
在当今信息爆炸的时代,信息量呈几何倍数的速度扩充,出现了许多高维数据集。这类数据集表现出样本数量巨大、特征维度高等特点。这些出现在各个领域中的高维数据集在促进行业进步、技术发展的同时,也带来了巨大挑战。高维数据集因其庞大的样本个数和特征维度导致大量的计算资源被占用,且需要耗费海量的时间。与此同时,高维数据集中包含了大量无关和冗余的特征,这将会降低后续模型的性能。特征选择[1-2]作为一种数据预处理方式,可以很好地解决高维数据集带来的问题。由于特征选择在降低特征维度的过程中,不曾改变特征原有的物理意义,被广泛应用于文本分类[3]、数据挖掘[4]和模式识别等领域。根据与分类器结合方式不同,可以将特征选择分为包装式[5]、过滤式[6]和嵌入式[7]3类。包装式和嵌入式方法需要与分类器相结合,普适性不强,容易过拟合且计算复杂度高。相比于包装式和嵌入式方法,过滤式特征选择算法不依赖于分类器,普适性强且计算复杂度低,在高维数据集上有很强的实用性。对于过滤式方法,评价准则[8]对其显得尤为重要,它决定了所选特征的优劣。一个优秀的评价准则可以挑选出最优的特征子集。现有的评价准则可以分为距离度量、一致性度量、依赖性度量、信息度量和分类正确率5种。其中,因为信息度量[9]具有量化特征与特征,特征与类别之间的非线性关系的优点,所以信息度量一直是学者研究的热点。……
登录APP查看全文
