[论文解读] SkillSpan: Hard and Soft Skill Extraction from English Job Postings
本论文提出了SkillSpan,一个包含14.5K条职位招聘文本句子的新数据集,其中包含12.5K个经专家标注的硬技能与软技能跨度,通过专家标注创建。该研究提出在职位招聘文本上微调的领域自适应BERT模型,结果表明,与标准BERT相比,领域自适应预训练显著提升了性能,而单任务学习优于多任务学习。
Skill Extraction (SE) is an important and widely-studied task useful to gain insights into labor market dynamics. However, there is a lacuna of datasets and annotation guidelines; available datasets are few and contain crowd-sourced labels on the span-level or labels from a predefined skill inventory. To address this gap, we introduce SKILLSPAN, a novel SE dataset consisting of 14.5K sentences and over 12.5K annotated spans. We release its respective guidelines created over three different sources annotated for hard and soft skills by domain experts. We introduce a BERT baseline (Devlin et al., 2019). To improve upon this baseline, we experiment with language models that are optimized for long spans (Joshi et al., 2020; Beltagy et al., 2020), continuous pre-training on the job posting domain (Han and Eisenstein, 2019; Gururangan et al., 2020), and multi-task learning (Caruana, 1997). Our results show that the domain-adapted models significantly outperform their non-adapted counterparts, and single-task outperforms multi-task learning.
研究动机与目标
- 为解决职位招聘文本中技能提取缺乏高质量、专家标注数据集的问题。
- 制定全面的标注指南,用于硬技能与软技能的标注,包括嵌套的技能-知识组件结构。
- 评估领域自适应语言模型在技能提取中的有效性,尤其针对长跨度的技能。
- 比较单任务学习与多任务学习设置在技能与知识组件提取中的表现。
- 发布SkillSpan数据集、标注指南与代码,以支持技能提取领域的可复现研究。
提出的方法
- 作者从英文职位招聘文本中收集了14.5K条句子,并由领域专家对其中的硬技能与软技能进行跨度级别的标注。
- 他们制定了详细的标注指南,以区分技能(S)与知识组件(K),包括嵌套结构。
- 他们在SkillSpan数据集上微调了基于BERT的模型,实验了针对长跨度优化的模型以及在职位招聘文本上预训练的模型。
- 他们对职位招聘领域数据进行了连续预训练,并通过联合训练技能与知识组件提取任务,探索了多任务学习方法。
- 他们使用标准的命名实体识别(NER)指标(精确率、召回率、F1)评估模型性能,并通过ASO检验在多个随机种子下的统计显著性。
- 他们发布了数据集、标注指南与代码,以确保研究的可复现性与社区共享。
实验结果
研究问题
- RQ1与标准BERT相比,基于职位招聘文本进行领域自适应预训练对技能提取性能有何影响?
- RQ2在长跨度优化模型上进行微调是否能提升职位招聘文本中复杂技能跨度的提取效果?
- RQ3联合训练技能与知识组件提取任务的多任务学习是否比单任务学习更有效?
- RQ4与标准NER任务相比,专家标注的跨度在长度与复杂度上如何?
- RQ5所提出的数据集与标注方案在多大程度上提升了对新兴或非标准技能的覆盖能力?
主要发现
- 领域自适应BERT模型显著优于标准BERT基线模型,证明了在职位招聘文本上进行预训练的价值。
- 针对长跨度优化的模型性能反而低于标准BERT,表明在此场景下处理长技能跨度仍具挑战性。
- 单任务学习优于多任务学习,表明在该设置下,对技能与知识组件进行联合优化可能并无益处。
- SkillSpan中技能与知识组件的平均跨度长度显著长于典型NER任务,反映出更高的复杂性。
- 该数据集包含来自391份职位招聘文本的超过12,500个标注跨度,软技能与领域特定知识组件频繁出现。
- 数据集、标注指南与代码的发布,为未来技能提取研究提供了支持,并推动了可复现的基准测试。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。