[论文解读] IBM Employee Attrition Analysis
本研究利用随机森林、K均值聚类和二元逻辑回归分析IBM员工流失情况,识别员工离职的关键预测因子。研究发现,频繁出差员工(流失风险高出2.4倍)、人力资源部门员工以及工作满意度较低的员工更可能离职,而收入较高、年龄较大和工作经验丰富的员工则流失风险较低。二元逻辑回归模型在预测员工流失方面达到了88.43%的准确率。
In this paper, we analyzed the dataset IBM Employee Attrition to find the main reasons why employees choose to resign. Firstly, we utilized the correlation matrix to see some features that were not significantly correlated with other attributes and removed them from our dataset. Secondly, we selected important features by exploiting Random Forest, finding monthlyincome, age, and the number of companies worked significantly impacted employee attrition. Next, we also classified people into two clusters by using K-means Clustering. Finally, We performed binary logistic regression quantitative analysis: the attrition of people who traveled frequently was 2.4 times higher than that of people who rarely traveled. And we also found that employees who work in Human Resource have a higher tendency to leave.
研究动机与目标
- 利用机器学习识别影响IBM员工流失的主要因素。
- 通过二元逻辑回归和集成模型预测员工离职。
- 基于K均值聚类对员工进行分类,依据其流失风险。
- 通过统计分析量化人口统计学和工作相关变量对流失的影响。
- 为人力资源部门提供可操作的见解,以降低离职率并提升工作满意度。
提出的方法
- 应用随机森林对特征重要性进行排序,识别出月收入、年龄和曾就职公司数量为最重要的预测因子。
- 使用K均值聚类根据流失风险将员工分为两类,揭示了不同的行为模式。
- 执行二元逻辑回归,对分类变量的流失优势比进行建模,以流失作为二元结果(0:否,1:是)。
- 通过相关性矩阵去除低相关性特征,以提高模型效率。
- 将数据集按80%训练集、20%测试集进行划分,以评估模型性能并防止过拟合。
- 计算优势比(OR)及其95%置信区间,以量化每个预测因子对流失的影响。
实验结果
研究问题
- RQ1哪些员工特征对IBM员工自愿离职的可能性影响最为显著?
- RQ2工作角色、出差频率和婚姻状况如何影响员工流失率?
- RQ3机器学习模型能否利用人口统计学和工作相关特征准确预测员工流失?
- RQ4高流失风险与低流失风险员工之间存在哪些显著的行为聚类?
- RQ5工作满意度(体现在收入和职位层级)与员工留任之间有何相关性?
主要发现
- 频繁出差员工的流失优势比为2.411倍,相较于极少出差者(p < 0.05)。
- 人力资源部门员工的流失优势比为4.060倍,相较于销售代表(p < 0.05)。
- 已婚和离婚员工的流失优势比分别为单亲员工的0.427倍和0.304倍(p < 0.05)。
- 女性员工的流失优势比为男性的0.659倍,表明女性员工的流失率较低(p < 0.05)。
- 加班员工的流失优势比仅为0.138倍,表明其与流失呈强烈负相关(p < 0.05)。
- 二元逻辑回归模型在预测员工流失方面达到88.43%的准确率,优于随机森林模型(准确率84.56%)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。