基于低方差滤波算法的改进降维算法
2021-08-23乔铭宇陈旻杰张琳那
乔铭宇,陈旻杰,张琳那
(北方工业大学,北京100144)
0 引言
如今,机器学习被广泛应用到各个领域,如人工智能、专家系统、数据挖掘、图像处理[1]等。而随着互联网的兴起和大数据技术的发展深度学习的越来越受欢迎。数据仓库[2]和大数据技术为深度学习提供了可观的数据集。而数据预处理则成为深度学习的不可或缺的重要流程。随着数据记录和属性规模的急剧增长,大数据处理平台和并行数据分析算法也随之出现。于此同时,这也推动了数据降维处理的应用。对于高维度数据,并不便于输入神经网络直接进行处理,所以需要提前对高位数据进行降维操作,由此,降维工作显得格外重要。而对于大规模数据,降维速度的快慢则直接影响后续工作的进程。而越来越多的降维技术被陆续提出并使用。如主成分分析(PCA)[3]、低方差滤波(Low Variance Filter)、高相关滤波(High Correlation Filter)、随机森林/组合树(Random Forests)、反向特征消除(Backward Feature Elimination)、前向特征构造(Forward Feature Construction)、局部线性潜入(LLE)[4]等降维算法。这些算法各有千秋,而本文为了进一步提高降维的运算速度,提出了一种改进的降维算法。
1 降维
在现实世界中,数据多是冗余的,即存在数据相关。高维空间可以用低维空间的联合分布形式表示。例如,MNIST手写数字数据集[5]中的数据,本是高维特征,却可以用低维空间表示。我们很容易得知高维数据的优点,数据维度高,则其所包含的信息量就大。但是数据当然不是维度越高越好,因为还需要考虑实际的计算能力。对于数据而言,维度越高,则所消耗的计算时间越长,对计算设备的要求越高,由此,在计算上所消耗的资金数额也就越大。……
