基于SAEM算法对缺失协变量的Logistic模型参数估计
2021-10-28刘玥施三支
刘玥,施三支
(长春理工大学 理学院,长春 130022)
数据的缺失几乎存在于所有的实证研究领域。可能会出现数据缺失的原因有很多,包括调查无响应、无法测量和单纯的数据丢失等。但同时,现在各类研究不断増多,这就需要不断采集挖掘数据;数据量越大,数据缺失的可能性也就越大,缺失数据就会对统计推断结果造成严重影响。因此,在数据分析的过程中,需要正确恰当的处理缺失值,使得研究更加有意义。
国外对缺失数据现象的问题很早就有了研究。自20世纪40年代起,有关学者便开始了对缺失数据问题的初步研究,并强调处理缺失数据问题的重要性。从缺失机制方面来看,Rubin(1976)[1]首次提出了关于数据缺失的缺失机制问题,并将其分为三种,随机缺失(MAR)、完全随机缺失(MCAR)和非随机缺失(NMAR)。Sinna S K、Saha K 和 Wang S J(2014)[2]利用半参数方法处理非单调缺失数据,并提出了在不可忽视机制(NI)基础下的NI-缺失机制。从处理缺失数据方法的方面来看,Rubin等人(1977)[3]首次提出了用来处理缺失数据的EM算法,这个算法的提出也是缺失数据处理方面一个极具意义的里程碑。
针对SAEM算法的研究,最初始于Marc Lavielle等人(1999)[4],他们提出了一种新的方法,即随机逼近EM(SAEM)算法,它通过一次随机逼近过程的迭代代替了EM算法的期望步骤,并证明了在一些附加条件下,SAEM算法的吸引平稳点对应于函数的局部极大值。SAEM算法的提出大大推动了EM算法的发展。Wei Jiang等人(2020)[5]提出了EM算法的一个基于Metropolis-Hastings抽样的随机逼近版本(SAEM),对含有不完全数据的Logistic回归进行统计推断。……