不同缺失数据处理方法对D-vine Copula分类器的影响
2021-03-31付志慧
沈阳师范大学学报(自然科学版) 2021年1期
杨 光,王 蕾,付志慧
(1.沈阳师范大学 数学与系统科学学院,沈阳 110034;2.闽南师范大学 数学与统计学院,福建 漳州 363000)
0 引 言
现实世界中,数据缺失是不可避免的问题。尤其是随着大数据时代的到来,数据量级和复杂程度增加,但缺失现象依旧普遍存在,极大地增加了数据的管理和分析难度。如果数据集中的缺失比例过高,会导致数据质量下降,分析得到的结果不够准确甚至毫无意义,影响决策的准确性。因此,对缺失数据进行填补是十分必要的。
D-vine copula分类器利用D-vine copula模型在拟合变量间的线性或非线性相关性时选择出最合适的函数,对贝叶斯分类器在处理变量相关性方面进行优化,从而提高了贝叶斯分类器的分类性能。本文介绍了5种常用的缺失数据处理方法,模拟不同的缺失比例,说明各处理方法对D-vine copula分类器的影响。
1 理论依据
1.1 常见的缺失数据处理方法
均值插补法(mean imputation,MeanI)一般用观测数据的平均值代替缺失数据对数据集进行填补,可以选择总体数据的均值,也可以用样本数据填补缺失数据。此方法虽然简单易行,但是用同一个均值替换变量中的缺失值,忽略了数据的特征,低估了估计量的方差,只适合比较简单的数据集,不适合较复杂的需要方差估计的分析[1]。
随机插补法(random imputation,RI)是采用某种概率抽样的方式,从缺失变量的已知数据中随机抽取一些数据作为缺失数据的替补值。随机插补法虽然会造成估计量的方差增大,但能够避免发生均值插补法中替补值过于集中的情况,使处理后的数据分布更接近数据集的真实分布,在估计和样本有关的参数时更具优势[2]。……
登录APP查看全文
