Skip to main content
QUICK REVIEW

[논문 리뷰] SkillSpan: Hard and Soft Skill Extraction from English Job Postings

Mike Zhang, Kristian Nørgaard Jensen|arXiv (Cornell University)|2022. 04. 27.
Topic Modeling참고 문헌 41인용 수 7
한 줄 요약

이 논문은 전문가가 참여한 주석 처리를 통해 14.5만 개의 직무 공고 문장과 12.5만 개의 하드 스킬 및 소프트 스킬 구간을 포함한 새로운 데이터셋인 SkillSpan을 소개한다. 또한 직무 공고에 맞게 미세조정된 BERT 기반 모델을 제안하며, 표준 BERT보다 도메인 적응형 사전 훈련이 성능을 크게 향상시키는 것으로 나타났고, 단일 작업 학습이 다중 작업 학습보다 우수한 성능을 보였다.

ABSTRACT

Skill Extraction (SE) is an important and widely-studied task useful to gain insights into labor market dynamics. However, there is a lacuna of datasets and annotation guidelines; available datasets are few and contain crowd-sourced labels on the span-level or labels from a predefined skill inventory. To address this gap, we introduce SKILLSPAN, a novel SE dataset consisting of 14.5K sentences and over 12.5K annotated spans. We release its respective guidelines created over three different sources annotated for hard and soft skills by domain experts. We introduce a BERT baseline (Devlin et al., 2019). To improve upon this baseline, we experiment with language models that are optimized for long spans (Joshi et al., 2020; Beltagy et al., 2020), continuous pre-training on the job posting domain (Han and Eisenstein, 2019; Gururangan et al., 2020), and multi-task learning (Caruana, 1997). Our results show that the domain-adapted models significantly outperform their non-adapted counterparts, and single-task outperforms multi-task learning.

연구 동기 및 목표

  • 직무 공고에서 스킬 추출을 위한 고품질의 전문가 주석 처리 데이터셋 부족 문제를 해결하기 위해.
  • 하드 스킬 및 소프트 스킬에 대한 포괄적인 주석 가이드라인을 개발하여 중첩된 스킬-지식 구성 요소를 포함하기 위해.
  • 특정 도메인에 적합한 언어 모델의 효과를 평가하여, 특히 긴 스플릿에서의 스킬 추출 성능을 분석하기 위해.
  • 스킬 및 지식 구성 요소 추출을 위한 단일 작업 학습과 다중 작업 학습 설정 간의 성능 비교를 위해.
  • SkillSpan 데이터셋, 주석 가이드라인, 코드를 공개하여 스킬 추출 분야의 재현 가능 연구를 지원하기 위해.

제안 방법

  • 저자들은 영어 직무 공고에서 14.5만 개의 문장을 수집하여 도메인 전문가를 활용해 스플릿 수준에서 하드 스킬 및 소프트 스킬을 주석 처리했다.
  • 스킬(S)과 지식 구성 요소(K)를 구분하는 상세한 주석 가이드라인을 개발하였으며, 중첩된 구조도 포함하였다.
  • SkillSpan 데이터셋을 기반으로 BERT 기반 모델을 미세조정하였으며, 긴 스플릿을 고려해 최적화된 모델과 직무 공고 전용 텍스트로 사전 훈련된 모델을 실험하였다.
  • 직무 공고 도메인 데이터를 활용한 연속적 사전 훈련을 적용하고, 스킬 및 지식 구성 요소 추출을 동시에 학습하는 다중 작업 학습을 탐색하였다.
  • 표준 NER 메트릭(정밀도, 재현율, F1)을 사용해 모델을 평가하였으며, 여러 랜덤 시드를 기반으로 통계적 유의성 분석을 위해 ASO 테스트를 적용하였다.
  • 재현 가능성을 보장하고 커뮤니티의 재사용을 지원하기 위해 데이터셋, 가이드라인, 코드를 공개하였다.

실험 결과

연구 질문

  • RQ1표준 BERT와 비교해, 직무 공고 도메인에서 사전 훈련된 도메인 적응형 BERT 모델은 스킬 추출 성능에 어떤 영향을 미치는가?
  • RQ2긴 스플릿에 최적화된 모델로 미세조정하면, 직무 공고 내 복잡한 스킬 스플릿의 추출 성능이 향상되는가?
  • RQ3스킬 및 지식 구성 요소 추출을 동시에 학습하는 다중 작업 학습이 단일 작업 학습보다 더 효과적인가?
  • RQ4전문가 주석 처리된 스플릿은 표준 NER 작업과 비교해 길이와 복잡도 측면에서 어떻게 다른가?
  • RQ5제안된 데이터셋과 주석 체계는 새로운 또는 비표준 스킬의 커버리지에 얼마나 기여하는가?

주요 결과

  • 도메인 적응형 BERT 모델은 표준 BERT 기반 모델보다 유의미하게 뛰어난 성능을 보이며, 직무 공고 전용 텍스트로 사전 훈련하는 것이 가치가 있음을 입증하였다.
  • 긴 스플릿에 최적화된 모델은 표준 BERT보다 성능이 열 劣하였으며, 이는 이 맥락에서 긴 스킬 스플릿을 다루는 데 어려움이 있음을 시사한다.
  • 단일 작업 학습이 다중 작업 학습보다 성능이 뛰어나, 이 설정에서는 스킬과 지식 구성 요소를 동시에 최적화하는 것이 유의미하지 않음을 시사한다.
  • SkillSpan에서 스킬 및 지식 구성 요소의 평균 스플릿 길이는 일반적인 NER 작업보다 유의미하게 길며, 더 높은 복잡도를 반영한다.
  • 데이터셋은 391개의 직무 공고에 걸쳐 12,500개 이상의 주석 처리 스플릿을 포함하고 있으며, 소프트 스킬과 도메인 특화 지식 구성 요소가 자주 등장한다.
  • 데이터셋, 가이드라인, 코드의 공개로 향후 스킬 추출 분야의 연구가 가능해지고 재현 가능한 벤치마킹이 지원된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.