APP下载

基于Stacking 集成学习的员工离职预测方法

2021-06-24李佳浩褚治广

关键词:特征满意度模型

李佳浩,李 昕,褚治广

(辽宁工业大学 计算中心,辽宁 锦州 121001)

如今大公司的人员流失越来越严重,尤其是一些专业的员工。但是,拥有不同追求的员工往往不满于现状,抑或是因为种种的原因,缺乏与企业的沟通交流,一时选择离职来解决问题[1]。员工的离职不仅会给公司带来收益降低,而且会给企业发展带来很多危害,比如商业机密的泄露,一些重要客户的丢失,在市场中失去了企业竞争力。因此一种能够提前洞悉员工离职想法的系统非常必要,通过IBM 公司提供的相关数据,对其进行大数据分析[2]。通过对数据进行数据清洗等预处理,数据可视化分析,本实验用了一种基于 Stacking 集成算法Adaboost 和随机森林算法一起构建的一种LRA 员工离职倾向模型。学习数据中蕴含的规律,对员工离职因素数据集进行分析。最后对可能影响员工离职的重要因素进行分析,从而减少员工想要离职的想法,减少企业的不必要的经济损失、让企业领导者做出正确的决定,来减少想要离职的员工人数[3]。

1 算法介绍

1.1 Adaboost 算法

Adaboost 是Boosting算法中最具有代表性的一种算法之一。算法过程如下:

假设训练集

M为样本的个数,(其中,i=1,2,...,M)。

带有权值分布的Dm训练数据集,在第m次运算后得到的基本分类器其中,m代表次数)。

计算Gm(x)的分类误差:

计算Gm(x)的系数:

更新训练集的权限分布:

其中,i=1,2,...,M,Zm是规范化因子,

其目的是得到最终分类器,

线性组合f(x)实现M个基学习器的加权表决,αm表示基本分类器Gm(x)的重要程度[4]。

1.2 随机森林算法

设样本有M个特征,随机森林随机抽取了K个 bootstrap 数据集,对应有K个 OOB 数据集,特征重要性排序的步骤如下:

登录APP查看全文

猜你喜欢

特征满意度模型
一半模型
多感谢,生活满意度高
16城市公共服务满意度排行
重尾非线性自回归模型自加权M-估计的渐近分布
浅谈如何提升脱贫攻坚满意度
如何表达“特征”
明天村里调查满意度
不忠诚的四个特征
3D打印中的模型分割与打包
线性代数的应用特征