基于随机森林的用户流失预警研究
2021-06-06余建波李艳冰
精密制造与自动化 2021年2期
陈 静 余建波 李艳冰
(1.同济大学 机械与能源工程学院 上海201804;2.上海质量管理科学研究院 上海200052)
近年来用户流失预测问题在学术界引起了广泛关注, 范围涉及 MOOC 平台、社交平台、电信等多个领域。它是结合用户的历史数据,对其进行建模,从而训练出能判别用户是否流失的分类器,是一个常见的二分类问题[1]。 流失用户在传统意义是指曾经某时间段内使用过某产品或服务,后期由于种种原因退订该产品或服务。对于流失用户的定义依行业不同而不同,APP领域以用户一定时期内不再登录、卸载软件且不再二次安装以及选择其他同类APP为标准界定流失用户[2],而商业银行用户流失是指终结与商业银行所有业务往来的情形,包括交易锐减、停止交易或者清户[3]。
1 数据预处理与特征工程
1.1 数据预处理
1.1.1 数据清洗
对数据集进行分析发现,无重复值,而对于缺失值和异常值,考虑银行数据的敏感性本文未进行处理,对无关字段用户ID进行了删除。
1.1.2 数据转换
通过数据观察可以了解到,性别、家庭住址和电话信息为字符型变量,本文采用LabelEncoder编码,将文本数据转换成连续的数值型变量,即对不连续的数字或者文本进行编号。如表1所示。

表1 字符型变量编码
1.2 数据不平衡问题处理
数据不平衡,又称样本比例失衡,以二分类问题为例,假设正类的样本数量远大于负类的样本数量,即称为不平衡数据集。正类的样本数量如图 1所示。

图1 正负样本数量
由图1可知,本文数据集的正负样本比例接近10:1,采用SMOTE合成少数类过采样技术,其基本原理是利用自助法和K近邻法,基于特征空间生成与少数类相似的新数据,来降低分类器的误差。……
登录APP查看全文
