基于改进的K近邻和支持向量机客户流失预测
2018-07-13卢光跃王航龙李创创赵宇翔李四维
西安邮电大学学报 2018年2期
关键词:分类
卢光跃,王航龙,李创创,赵宇翔,李四维
(西安邮电大学 陕西省信息通信网络及安全重点实验室, 陕西 西安 710121)
有效预测客户流失情况,可以提升客户挽留率。电信客户流失预测是一个典型的不平衡数据二分类问题[1],客户流失数据集的主要特点有:数据集存在极度的非均衡性;两类样本错分代价之间的差异性大,可以用非均衡代价来刻画;数据量大,维数高等[2]。
K近邻(K-nearest neighbor,KNN)算法是一种简单易行的数据挖掘分类方法、其基于类比思想的学习算法,每个类别都要具有相当数量及代表性的训练样本才能确保分类的精确度[3],所以对平衡数据的分类效果好。由于分类时需要计算测试样本到所有训练集样本之间的距离,所以计算量与存储量都比较大,经典的KNN算法很难在大数据样本集上得以良好应用[4]。当数据集里两类样本数量不均衡时,会导致判决规则倾斜于多数类样本,从而会降低少数类的检测精度[5-6]。
支持向量机(support vector machine,SVM)是数据挖掘领域比较经典的分类器,在1995年由Vapnik提出[7],是一种基于统计学习理论和结构风险最小化理论的机器学习方法[8],它在解决高维非线性数据集的分类问题时表现出了优良的分类性能[9]。SVM算法在样本均衡的数据集上有较好的分类效果,当数据集样本不均衡时,分类效果较差,分类的结果偏向于多数类样本[10],从而使少数类样本的漏检概率增大。通过进一步对传统SVM错分样本的具体分布进行分析,发现其错分的样本点基本聚集在分类平面附近[11]。……
登录APP查看全文
