一种面向海量数据的spilt-and-conquer方法
2018-09-21兰晓然
温 焜,兰晓然
(1.南昌大学 管理学院,南昌 330029;2.江西行政学院,南昌 330003;3.中国人民银行沧州市中心支行,河北 沧州 061000)
0 引言
变量选择[1,2]在对维数过大样本量过多的的数据集进行降维的时候,通常会遇到两个问题:计算开销太大和欠学习。就目前而言大多特征选择算法的时间复杂度是样本数的二次甚至更高次,同时与维数成正比,导致在对高维海量数据集进行变量选择时消耗的时间就会过长;在面对样本数远远大于特征维数的高维小样本数据集时,进行特征选择就容易出现欠学习问题。因此如何有效的对高维海量数据集进行变量选择,是变量选择研究要迫切解决的问题。
在进行变量选择时可以选择Lasso[3],LARS算法[4]SCAD估计方法[5]和MCP估计算法[6]等,本文选择了Lasso方法进行变量选择[3]。这种算法通过构造一个惩罚函数获得一个精炼的模型,通过最终确定一些指标的系数为零,LASSO算法实现了指标集合精简的目的。这是一种处理具有复共线性数据的有偏估计[7]。
1 Lasso方法
LARS算法,SCAD估计方法和MCP估计算法都可以用来进行变量选择,而Lasso算法在某些方面具有一定的优越性,所以本文采用Lasso方法进行研究。Lasso方法是很常用的一种变量选择的方法,是1996年Tibshirani提出的。它既能对变量进行选择,又能得出参数估计值的一种方法,而且选择出的变量具有很好的解释性。
考虑如下普通线性方程:

其中 Y=(y1,y2,…,yn)T为响应变量,n 为样本容量,X=(X1,X2,…,Xn) 为 p 维 预 测 变 量 ,假 设 观 测 数 据(yi,xij),i=1,2,…,n ,j=1,2,…,p 已经过中心标准化处理,即:

除特别说明外,在下文出现的数据(X,Y)均为经过中心标准化处理的。……
