大数据下的保险公司退保数据分析
2021-08-23毛麒麟杨杉
现代计算机 2021年20期
毛麒麟,杨杉
(四川大学锦城学院,计算机与软件学院,成都611731)
1 分析思路
其是借助一整套模块化的分析系统完成对相关数据的处理,具有操作简单、功能强大、简洁明了的特点[1]。分析续保数据列发现,总保费、客户性别、客户年龄和客户过去三年平均年收入之间存在可以挖掘的关系和价值,本文主要针对这几列做出了独立样本T检验、皮尔逊相关性分析、单因素方差分析和探索分析。
2 数据说明
2.1 数据描述
该续保数据集一共有218480行16列,包含机构、险种、投保时间、缴费方式、缴费期限、投保份数、总保费、保额、客户号、性别、年龄、婚姻状况、教育程度、过去三年平均年收入、职业、家庭人口字段。
2.2 数据清洗
删除投保时间、投保份数、教育程度、家庭人口无效列;
筛选保额为0的行并删除;
筛选过去三年平均年收入除无职业、无兼职离退休、无兼职其他人员、无业家庭主妇、学生、婴幼儿等职业外在1000元以下的行并删除;
筛选婚姻状况为X的行并删除;
添加婚姻状况代码列,并通过IF函数嵌套将M(已婚)设置为1、S(未婚)设置为2,D(离异)设置为3、W(丧偶)设置为4;
添加年龄层次代码列,并通过IF函数嵌套将18岁以下设置为1、18-30岁设置为2,30-50岁设置为3、50岁以上设置为4;
添加过去三年平均年收入层次代码列,并通过IF函数嵌套将1w以下设置为1、1w-3w设置为2,3w-5w设置为3、5w-10w设置为4、10w-100w设置为5、100w以上设置为6;
原数据218480行16列,清洗数据103029行15列。
3 数据分析
3.1 独立样本T检验方法数据分析
分析过程:选择分析工具栏下的比较均值的独立样本T检验工具,检验变量设置为过去三年的平均年收入,分组变量设置为性别,选项中将置信区间百分比设置为95%。……
登录APP查看全文
