APP下载

海量数据下线性混合效应模型的估计算法

2019-05-27李志强陈少东

北京化工大学学报(自然科学版) 2019年3期

耿 俏 李志强 陈少东

(北京化工大学 理学院, 北京 100029)

引 言

纵向数据是通过对每个个体在不同的时间点上进行观测得到的数据集,广泛应用在经济学、医学等领域,具有组内数据相关、组间数据独立的特点。线性混合效应模型[1-5]能够很好地刻画数据间的组内相关性和组间独立性,因此是分析处理纵向数据的常用模型之一。

随着信息、网络技术的迅速发展,数据增长变化速度惊人,呈现出数据海量化趋势[6]。传统的线性混合模型估计方法在海量数据下遇到一系列的挑战,如存储瓶颈、计算效率等问题[7-8],因此有必要探求新的算法对以往线性混合效应模型的估计方法进行改进。

为了构造线性混合效应模型中系数的最优估计,Wu等[5]提出了基于协方差结构的加权最小二乘法,但该估计方法的效率与纵向数据的协方差结构估计方法密切相关。常用的协方差结构估计方法有极大似然法和限制极大似然法等,然而这些方法需要进行反复的迭代计算及优化步骤,当数据量非常大时会导致很高的计算时间和计算量成本。为了解决此类问题,Sun等[9]在研究随机效应变系数模型时提出了一种方差分量估计的简便方法,该方法不需要进行迭代计算,能够适应海量数据情形。

然而直接利用矩阵形式的加权最小二乘法估计模型系数会遇到存储问题,因此分治算法被提出并在海量数据的统计计算中得到了广泛应用[10-13]。分治算法的核心思想是先把复杂问题分解成几个子问题,找到这几个子问题的解法后,再利用合适的方法把每个子问题的结果组合起来得到整个问题的结果。……

登录APP查看全文