APP下载

基于R软件的数据清洗

2019-10-21冯英华

锦绣·下旬刊 2019年7期

摘 要:大数据的处理中数据的清洗工作很重要。运用R语言对数据清洗,需要对缺失值、异常值进行处理,文章给出了清洗的方法和相关程序语言。

关键词:数据清洗;缺失值;异常值

现在在数据处理与挖掘中数据的预处理是很重要的,数据的处理主要是指对原始数据进行清洗、集成、变换及规约。数据清洗是将删除原始数据中的一些无关、重复数据,筛选掉一些与挖掘主题没有关系的数据,对缺失值、异常值进行处理。

一、缺失值、异常值的处理

在R中缺失值用NA表示,用is.na()判断缺失值是否存在。判断后需进行缺失值处理,经常用的方法一般有:删除法、插补法、替换法。

(1)删除法,这也是最简单的方法。

na.emit()移除所有含缺失数据的行,适用于缺失值占表较少的情况。data[,-p]其中data表示目标数据集,p表示缺失变量所在的列。适用于变量有较大缺失且对研究目标影响不大的情况,意味着要删除整个变量。

(2)替换法。

变量分为数值型和非数值型,数值型变量中缺失的可以用其他所有对象取值的均值来替换;非数值型变量中缺失的可以用其他全部有效观测值的中位数或众数替换。

(3)插补法,这是比上面两种都要好的方法。

常用的插补法有,回归插补法、多重插补法。回归插补法,利用回归模型将需插值补缺的变量作为因变量,其他变量为自变量,通过回归函数lm()预测出因变量的值来补缺。多重插补法,从一个包含缺失值的数据集中生成一组完整的数据,如此多次,从而产生缺失值的一个随机样本。……

登录APP查看全文