迭代的稳健超高维变量筛选
2018-03-21何晓群马学俊
何晓群,马学俊
(1.安康学院 数学与统计学院,西安 725000;2.中国人民大学 应用统计科学研究中心,北京100872;3.北京工业大学 应用数理学院,北京 100124)
0 引言
随着科学技术的发展,超高维数据越来越多出现在遗传、基因芯片、磁共振成像、信用评分等领域。由于计算成本、统计精度和算法稳定性等原因,传统的处理高维的方法表现并不理想。为此,Fan和Lv(2008)[1]基于Pearson相关系数提出SIS(Sure Independent Screening)。但SIS也存在明显的缺点:(1)不能刻画自变量和因变量非线性的关系;(2)对异常值比较敏感。这个问题最早由Garher和Guddat在讨论Fan和Lv(2008)[1]的SIS文章讨论中提出,即SIS对于模型假设和异常值(Outliers)不稳健。SIS自2008年提出,目前已从线性模型推广到广义线性模型、可加模型、变系数模型和模型释放(Model-free)等(Fan等2009,2010,2011,2014;Liu等2014)[2-6]。本文主要研究模型释放的超高维变量筛选。
模型释放不需要假设具体模型。Zhu等(2011)[7]提出SIRS研究了模型假设的释放,其通过离散化Y实现释放模型假设的效果。Li和Wei等(2012)[8]基于距离相关系数提出DC-SIS,该方法释放了模型的假设,并且也适合组变量的变量筛选。Li等(2012)[9]基于Kendall相关系数提出RRCS(Robust Rank Correlation Screening),该方法对于厚尾分布、离群点和强影响点具有一定的抵抗力。Shao和Zhang(2014)[10]基于鞅差距离(Martingle Difference Correlation)提出MDC-SIS方法。Ma和Zhang(2016)[11]基于分位数相关系数(Quantile Correlation)提出一种新的方法(QC-SIS)。如果不重要的自变量和重要的自变量高度相关,而其他重要变量和因变量的关系比较弱时,或者存在某一些自变量单独对因变量的影响不大,而他们联合起来对因变量影响比较显著;那么前面提到方法将不能胜任。Fan和Lv(2008)[1]提出迭代的SIS方法,即ISIS,但它不能解决自变量和因变量之间的非线性,且对异常值比较敏感。……
