基于Stacking 集成学习的员工离职预测方法
2021-06-24李佳浩褚治广
辽宁工业大学学报(自然科学版) 2021年3期
李佳浩,李 昕,褚治广
(辽宁工业大学 计算中心,辽宁 锦州 121001)
如今大公司的人员流失越来越严重,尤其是一些专业的员工。但是,拥有不同追求的员工往往不满于现状,抑或是因为种种的原因,缺乏与企业的沟通交流,一时选择离职来解决问题[1]。员工的离职不仅会给公司带来收益降低,而且会给企业发展带来很多危害,比如商业机密的泄露,一些重要客户的丢失,在市场中失去了企业竞争力。因此一种能够提前洞悉员工离职想法的系统非常必要,通过IBM 公司提供的相关数据,对其进行大数据分析[2]。通过对数据进行数据清洗等预处理,数据可视化分析,本实验用了一种基于 Stacking 集成算法Adaboost 和随机森林算法一起构建的一种LRA 员工离职倾向模型。学习数据中蕴含的规律,对员工离职因素数据集进行分析。最后对可能影响员工离职的重要因素进行分析,从而减少员工想要离职的想法,减少企业的不必要的经济损失、让企业领导者做出正确的决定,来减少想要离职的员工人数[3]。
1 算法介绍
1.1 Adaboost 算法
Adaboost 是Boosting算法中最具有代表性的一种算法之一。算法过程如下:
假设训练集

M为样本的个数,(其中,i=1,2,...,M)。
带有权值分布的Dm训练数据集,在第m次运算后得到的基本分类器其中,m代表次数)。
计算Gm(x)的分类误差:

计算Gm(x)的系数:

更新训练集的权限分布:

其中,i=1,2,...,M,Zm是规范化因子,

其目的是得到最终分类器,

线性组合f(x)实现M个基学习器的加权表决,αm表示基本分类器Gm(x)的重要程度[4]。
1.2 随机森林算法
设样本有M个特征,随机森林随机抽取了K个 bootstrap 数据集,对应有K个 OOB 数据集,特征重要性排序的步骤如下:……p>
登录APP查看全文
