基于自适应Lasso的缺失数据图模型选择
2021-10-16郑倩贞徐平峰
郑倩贞, 徐平峰
(长春工业大学 数学与统计学院, 吉林 长春 130012)
0 引 言
在高斯图模型中,协方差逆阵可解释随机变量间的条件独立性。矩阵中的零元素表示对应两个随机变量间条件独立,因此,协方差逆阵中零元素的估计问题是图模型选择中的关键问题。惩罚似然方法可同时实现模型选择和参数估计,其中Lasso惩罚是常用的求解稀疏估计的惩罚项,例如:Yuan M等[1]、Banerjee O等[2]、Friedman J等[3]、Stidler N等[4]、徐平峰等[5]都采用l1惩罚对数似然方法估计协方差逆阵,从而得到稀疏的图结构。文献[5]基于gCoda方法将成分数据的图模型选择问题转换为高斯图模型的协方差逆阵估计问题;文献[4]研究的是数据存在随机缺失时的高斯图模型选择问题;而其余三者关注的均是数据完全观测下的高斯图模型选择问题,但三者采用的优化算法不同。
研究表明,Lasso惩罚可得到稀疏估计,但其估计结果会产生偏差[6]。Fan J等[6]提出的SCAD惩罚和Zou H[7]提出的自适应Lasso惩罚都能够降低估计的偏差。Fan J等[8]将这两种惩罚应用于完全数据的图模型选择问题以减弱协方差逆阵估计的偏差。但在实际高维复杂数据中,往往存在数据部分缺失的情况。针对数据完全随机缺失情形,文中将采用自适应Lasso惩罚对数似然方法对高斯图模型选择进行研究,并与Stidler N等[1]的l1惩罚对数似然方法(MissGLasso)进行比较。
1 自适应MissGLasso
设x=(xobs,xmis)为来自多元高斯分布Np(μ,Ω-1)的n个独立同分布样本。令样本中的观测数据xobs=(xobs,1,…,xobs,n),缺失数据xmis=(xmis,1,…,xmis,n),其中xobs,i和xmis,i分别表示第i个样本的观测数据和缺失数据的集合,i=1,2,…,n。……
