[论文解读] Kompetencer: Fine-grained Skill Classification in Danish Job Postings via Distant Supervision and Transfer Learning
本文介绍了 Kompetencer,这是首个带有技能和知识要素(SKC)跨度级标注的丹麦语职位招聘数据集,通过利用 ESCO 分类法进行远程监督,生成细粒度标签。结果表明,经过领域适应的 RemBERT 在零样本和少样本迁移学习设置中均优于所有其他模型,在丹麦语技能分类任务中分别实现了 0.354(零样本)和 0.472(少样本)的加权宏 F1 分数。
Skill Classification (SC) is the task of classifying job competences from job postings. This work is the first in SC applied to Danish job vacancy data. We release the first Danish job posting dataset: Kompetencer (en: competences), annotated for nested spans of competences. To improve upon coarse-grained annotations, we make use of The European Skills, Competences, Qualifications and Occupations (ESCO; le Vrang et al., 2014) taxonomy API to obtain fine-grained labels via distant supervision. We study two setups: The zero-shot and few-shot classification setting. We fine-tune English-based models and RemBERT (Chung et al., 2020) and compare them to in-language Danish models. Our results show RemBERT significantly outperforms all other models in both the zero-shot and the few-shot setting.
研究动机与目标
- 为解决非英语劳动力市场数据中多语言且细粒度的技能分类缺失问题,特别是针对丹麦语。
- 创建一个高质量的、针对丹麦语职位招聘中技能与知识要素(SKC)的跨度级标注数据集。
- 探索使用领域适应的 BERT 模型,从英语到丹麦语进行零样本和少样本跨语言迁移学习。
- 评估通过 ESCO API 实现的远程监督在生成细粒度技能分类可靠‘银色’标签方面的有效性。
- 对比同语言丹麦语模型与跨语言迁移模型,包括领域适应和多语言 BERT 变体。
提出的方法
- 对 60 份丹麦语职位招聘进行嵌套跨度的技能与知识要素(SKC)标注,构建一个黄金标准数据集。
- 利用 ESCO 分类法 API 通过远程监督将标注的 SKC 跨度自动映射到细粒度的 ESCO 标签,生成‘银色’标签。
- 在远程监督数据上微调多语言和同语言 BERT 模型,包括领域适应的丹麦语 BERT 和 RemBERT。
- 在零样本(英语预训练 → 丹麦语推理)和少样本(在少量丹麦语样本上微调)设置下训练并评估模型。
- 进行人工评估以评估标签质量,报告在英语和丹麦语子集上的准确率。
- 在 2450 万份丹麦语职位招聘上应用领域自适应预训练,以提升同语言性能。
实验结果
研究问题
- RQ1通过 ESCO API 实现的远程监督能否有效生成丹麦语职位招聘中技能分类的可靠细粒度标签?
- RQ2与同语言丹麦语模型相比,从英语 BERT 模型进行的零样本跨语言迁移在技能分类中的表现如何?
- RQ3在丹麦语职位招聘上进行领域自适应预训练是否能提升模型在技能分类任务中的性能?
- RQ4在少量丹麦语职位招聘上对多语言模型进行少样本微调的有效性如何?
- RQ5模型架构(如 RemBERT 与标准 BERT)对丹麦语技能分类中零样本与少样本性能的影响是什么?
主要发现
- Kompetencer 数据集包含 60 份丹麦语职位招聘中的 665 个技能跨度和 255 个知识跨度,是首个公开可用的、高质量的、跨度级标注的丹麦语技能分类数据集。
- 人工评估显示,远程监督生成的标签在丹麦语开发集上准确率为 70.4%,在测试集上为 14.1%,表明需要进行黄金标准校正。
- RemBERT 在零样本和少样本设置中均表现最佳,分别取得 0.354 ± 0.021 和 0.472 ± 0.014 的加权宏 F1 分数。
- 在 2450 万份丹麦语职位招聘上进行的领域自适应预训练显著提升了模型性能,尤其在低资源设置下。
- 通过 RemBERT 实现的从英语到丹麦语的跨语言迁移在两种评估设置中均优于标准英语 BERT 和同语言丹麦语模型。
- 本研究发现,技术技能(如 ReactJS、AWS)经常缺失于 ESCO 分类法中,导致远程监督存在标签空白。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。