[论文解读] Extreme Multi-Label Skill Extraction Training using Large Language Models
本文提出了一种成本效益高的方法,通过使用大型语言模型(LLMs)生成的合成数据和对比学习,训练极端多标签技能抽取模型。通过从ESCO本体论生成138K个合成的(技能,职位广告语句)配对,并应用一种新颖的增强策略,该方法在远距离监督基线上的R-Precision@5指标上实现了15–25个百分点的提升,甚至优于使用真实描述进行训练的模型。
Online job ads serve as a valuable source of information for skill requirements, playing a crucial role in labor market analysis and e-recruitment processes. Since such ads are typically formatted in free text, natural language processing (NLP) technologies are required to automatically process them. We specifically focus on the task of detecting skills (mentioned literally, or implicitly described) and linking them to a large skill ontology, making it a challenging case of extreme multi-label classification (XMLC). Given that there is no sizable labeled (training) dataset are available for this specific XMLC task, we propose techniques to leverage general Large Language Models (LLMs). We describe a cost-effective approach to generate an accurate, fully synthetic labeled dataset for skill extraction, and present a contrastive learning strategy that proves effective in the task. Our results across three skill extraction benchmarks show a consistent increase of between 15 to 25 percentage points in extit{R-Precision@5} compared to previously published results that relied solely on distant supervision through literal matches.
研究动机与目标
- 解决职位广告中极端多标签技能抽取缺乏大规模、高质量标注数据集的问题。
- 开发一种基于ESCO本体论的、完全基于合成数据的低成本生成管道。
- 通过对比学习提升技能抽取性能,使句子和技能表示在嵌入空间中对齐。
- 引入一种简单但有效的数据增强策略,以提升模型泛化能力。
- 发布一个涵盖ESCO本体论99.5%内容的综合性138K个(技能,语句)数据集,以支持未来研究。
提出的方法
- 利用大型语言模型生成138K个合成的职位广告语句,每个语句均基于ESCO本体论中的一个技能及其描述。
- 使用对比学习微调一个句子-嵌入器双编码器模型,将技能名称及其对应的合成语句嵌入到同一向量空间中。
- 应用一种数据增强技术,将每个(技能,语句)对与一个随机的无关语句拼接,迫使模型专注于相关上下文。
- 使用对比损失优化模型,以最小化批次中正样本对(技能,语句)之间的距离,同时最大化负样本对之间的距离。
- 使用token嵌入的平均值作为最终的句子表示,以提升可解释性及下游推理性能。
- 在三个基准数据集(TECH、HOUSE和专有的TECHWOLF集合)上训练和评估模型,使用MRR和R-Precision@5作为评估指标。
实验结果
研究问题
- RQ1当缺乏大规模标注数据集时,LLM生成的合成数据是否能在技能抽取任务中超越真实世界标注数据?
- RQ2与基于文本片段的方法相比,在完整句子上使用对比学习是否能提升技能抽取性能?
- RQ3在训练过程中拼接无关语句的简单数据增强策略有多有效?
- RQ4每个技能仅使用一个合成语句是否能优于基于ESCO技能描述训练的模型?
- RQ5增加每个技能的合成语句数量在多大程度上能提升模型性能?
主要发现
- 所提出的方法在远距离监督基线(基于字面匹配)上的R-Precision@5指标上实现了15–25个百分点的提升。
- 即使每个技能仅使用一个合成语句,其性能也优于基于ESCO技能描述训练的模型,证明了LLM生成数据的质量。
- 在TECH基准上,使用GPT生成语句并结合增强策略的模型实现了54.62的R-Precision@5,在TECHWOLF上为54.57,在HOUSE上为45.74。
- 增强策略在所有基准上均一致提升了性能,其中在TECHWOLF集上提升最为显著(从46.50提升至52.55的R-Precision@5)。
- 性能随训练数据量增加而提升,但即使每个技能仅有一个语句,其结果也优于基于描述的训练方法。
- 基于合成数据训练的模型超越了在真实数据上微调的all-mpnet-base-v2模型,表明合成数据生成与对比学习管道的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。