[论文解读] Career Path Prediction using Resume Representation Learning and Skill-based Matching
该论文提出CareerBERT,一种用于简历文本的新型表示学习模型,通过结合基于技能的匹配与基于文本的预测,实现对职业路径的预测。在包含2,164份经匿名化处理的职业经历的新数据集上,该模型在召回率@10上达到43.01%,优于单独使用任一方法的性能。
The impact of person-job fit on job satisfaction and performance is widely acknowledged, which highlights the importance of providing workers with next steps at the right time in their career. This task of predicting the next step in a career is known as career path prediction, and has diverse applications such as turnover prevention and internal job mobility. Existing methods to career path prediction rely on large amounts of private career history data to model the interactions between job titles and companies. We propose leveraging the unexplored textual descriptions that are part of work experience sections in resumes. We introduce a structured dataset of 2,164 anonymized career histories, annotated with ESCO occupation labels. Based on this dataset, we present a novel representation learning approach, CareerBERT, specifically designed for work history data. We develop a skill-based model and a text-based model for career path prediction, which achieve 35.24% and 39.61% recall@10 respectively on our dataset. Finally, we show that both approaches are complementary as a hybrid approach achieves the strongest result with 43.01% recall@10.
研究动机与目标
- 通过创建并发布一个包含2,164份经匿名化处理的职业经历、并标注有ESCO职业类别的数据集,解决职业路径预测领域缺乏公开可用数据集的问题。
- 开发一种针对工作经历文本的领域特定表示学习模型CareerBERT,以提升职业路径预测性能。
- 探究简历中的文本描述是否能在传统基于技能或职位名称的方法之外,进一步提升职业路径预测效果。
- 评估基于技能与基于文本的预测模型之间的互补性,以提升整体性能。
- 证明将文本表示与技能本体信息结合,可带来优于单一模态的预测性能。
提出的方法
- 作者从简历中构建了一个包含2,164份经匿名化处理的职业经历的数据集,每条记录均标注有ESCO职业类别,以支持结构化预测。
- 提出了CareerBERT,一种基于BERT的微调模型,通过在工作经历描述上进行训练,学习职业轨迹的上下文表示。
- 评估了三种CareerBERT变体:LAST(仅使用最后一条经历)、FULL(使用所有经历)和ALL(使用所有经历并进行完整序列建模),并分别测试是否添加线性投影头。
- 基于ESCO本体映射,实现了一个基于技能的预测模型,用于将当前技能与未来职位要求进行匹配。
- 通过可学习权重α将基于文本和基于技能的预测结果进行融合,该α通过在验证集上进行网格搜索进行优化。
- 最终模型采用α = 0.8,以在测试集上实现最佳性能,实现文本与技能信号的平衡。
实验结果
研究问题
- RQ1简历中的非结构化文本描述是否能超越传统基于职位名称或公司名称的方法,提升职业路径预测性能?
- RQ2像CareerBERT这样的领域特定表示模型,在从自由文本的工作经历描述中捕捉职业轨迹模式方面有多有效?
- RQ3基于技能与基于文本的预测模型在职业路径预测中,其互补性在多大程度上体现?
- RQ4将文本表示与结构化的技能本体信息结合,是否能带来优于单独使用任一模态的性能?
- RQ5在职业路径预测中,整合基于文本与基于技能的预测的最优融合策略是什么?
主要发现
- 结合基于文本与基于技能预测的混合模型在召回率@10上达到最高性能,为43.01%,优于两种独立方法。
- 使用CareerBERT-ALL并添加线性投影头的基于文本的模型,达到39.61%的召回率@10,证明了简历文本中强大上下文表示的价值。
- 仅使用基于技能的模型达到35.24%的召回率@10,表明仅靠技能匹配即可提供强大的基线性能。
- 基于倒序历史的基线模型仅达到26.49%的召回率@10,凸显了更复杂建模的必要性。
- 线性投影头在大多数情况下均提升了性能,尤其在采用α = 0.8的混合模型中表现最佳。
- CareerBERT-ALL(使用序列中所有经历)优于其他CareerBERT变体,证实了完整序列建模的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。