APP下载

不同缺失数据处理方法对D-vine Copula分类器的影响

2021-03-31付志慧

关键词:数据处理分类方法

杨 光,王 蕾,付志慧

(1.沈阳师范大学 数学与系统科学学院,沈阳 110034;2.闽南师范大学 数学与统计学院,福建 漳州 363000)

0 引 言

现实世界中,数据缺失是不可避免的问题。尤其是随着大数据时代的到来,数据量级和复杂程度增加,但缺失现象依旧普遍存在,极大地增加了数据的管理和分析难度。如果数据集中的缺失比例过高,会导致数据质量下降,分析得到的结果不够准确甚至毫无意义,影响决策的准确性。因此,对缺失数据进行填补是十分必要的。

D-vine copula分类器利用D-vine copula模型在拟合变量间的线性或非线性相关性时选择出最合适的函数,对贝叶斯分类器在处理变量相关性方面进行优化,从而提高了贝叶斯分类器的分类性能。本文介绍了5种常用的缺失数据处理方法,模拟不同的缺失比例,说明各处理方法对D-vine copula分类器的影响。

1 理论依据

1.1 常见的缺失数据处理方法

均值插补法(mean imputation,MeanI)一般用观测数据的平均值代替缺失数据对数据集进行填补,可以选择总体数据的均值,也可以用样本数据填补缺失数据。此方法虽然简单易行,但是用同一个均值替换变量中的缺失值,忽略了数据的特征,低估了估计量的方差,只适合比较简单的数据集,不适合较复杂的需要方差估计的分析[1]。

随机插补法(random imputation,RI)是采用某种概率抽样的方式,从缺失变量的已知数据中随机抽取一些数据作为缺失数据的替补值。随机插补法虽然会造成估计量的方差增大,但能够避免发生均值插补法中替补值过于集中的情况,使处理后的数据分布更接近数据集的真实分布,在估计和样本有关的参数时更具优势[2]。……

登录APP查看全文

猜你喜欢

数据处理分类方法
认知诊断缺失数据处理方法的比较:零替换、多重插补与极大似然估计法*
ILWT-EEMD数据处理的ELM滚动轴承故障诊断
分类算一算
教你一招:数的分类
用对方法才能瘦
基于希尔伯特- 黄变换的去噪法在外测数据处理中的应用
四大方法 教你不再“坐以待病”!
捕鱼
基于POS AV610与PPP的车辆导航数据处理