Skip to main content
QUICK REVIEW

[논문 리뷰] Design of Negative Sampling Strategies for Distantly Supervised Skill Extraction

Jens-Joris Decorte, Jeroen Van Hautte|arXiv (Cornell University)|2022. 09. 13.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 암시적으로 언급된 스킬을 향상시키기 위해 하드 음성 샘플링 전략을 활용한 원거리 지도 학습 기반 엔드 투 엔드 시스템을 제안한다. ESCO 분류 체계를 활용해 정보성 음성 예제를 생성함으로써, 모델 성능이 RP@5 기준 최대 8%p 향상되어 수동 주석이 없는 기준 모델을 능가한다.

ABSTRACT

Skills play a central role in the job market and many human resources (HR) processes. In the wake of other digital experiences, today's online job market has candidates expecting to see the right opportunities based on their skill set. Similarly, enterprises increasingly need to use data to guarantee that the skills within their workforce remain future-proof. However, structured information about skills is often missing, and processes building on self- or manager-assessment have shown to struggle with issues around adoption, completeness, and freshness of the resulting data. Extracting skills is a highly challenging task, given the many thousands of possible skill labels mentioned either explicitly or merely described implicitly and the lack of finely annotated training corpora. Previous work on skill extraction overly simplifies the task to an explicit entity detection task or builds on manually annotated training data that would be infeasible if applied to a complete vocabulary of skills. We propose an end-to-end system for skill extraction, based on distant supervision through literal matching. We propose and evaluate several negative sampling strategies, tuned on a small validation dataset, to improve the generalization of skill extraction towards implicitly mentioned skills, despite the lack of such implicit skills in the distantly supervised data. We observe that using the ESCO taxonomy to select negative examples from related skills yields the biggest improvements, and combining three different strategies in one model further increases the performance, up to 8 percentage points in RP@5. We introduce a manually annotated evaluation benchmark for skill extraction based on the ESCO taxonomy, on which we validate our models. We release the benchmark dataset for research purposes to stimulate further research on the task.

연구 동기 및 목표

  • 정형화된 스킬 데이터가 부족하고 수동 주석이 비현실적인 인사관리 애플리케이션에서 미세한 수준의 스킬 추출 과제를 해결한다.
  • 비용이 많이 들거나 세밀한 레이블이 필요한 데이터셋에 의존하거나 암시적으로 언급된 스킬을 탐지하지 못하는 기존 방법의 한계를 극복한다.
  • 수동 주석된 학습 데이터에 대한 의존도를 최소화하기 위해 문장 일치를 통한 원거리 지도 학습을 활용해 확장 가능한 자동 스킬 추출 시스템을 설계한다.
  • 다양한 음성 샘플링 전략을 도입하고 평가하여 암시적 스킬 언급에 대한 모델 일반화 능력을 향상시킨다.
  • 재현 가능한 평가 및 향후 자동 스킬 추출 연구를 가능하게 하기 위해 ESCO 분류 체계 기반으로 수동 주석이 내려진 벤치마크 데이터셋을 공개한다.

제안 방법

  • 스킬 추출을 다중 레이블 분류 문제로 설정하며, 각 스킬에 대해 독립된 이진 분류 문제로 분해한다.
  • 기존에 알려진 스킬을 텍스트와 정확히 일치시켜 원거리 지도 학습을 적용함으로써, 거짓 양성 예측이 최소한인 대규모 학습 세트를 자동으로 생성한다.
  • 세 가지 음성 샘플링 전략을 도입한다: (1) 레벤슈타인 거리 기반 문자열 유사도, (2) ESCO 분류 체계 계층에서의 형제 스킬, (3) 사전 학습된 모델에서 유도한 의미적 임베딩.
  • 세 전략을 제어 가능한 샘플링 비율(최대 5%의 하드 음성 예제)로 조합하여 과적합을 방지하면서도 모델 일반화 능력을 향상시킨다.
  • 하드 음성 예제가 보강된 원거리 지도 학습 데이터에 기반해 RoBERTa 기반 모델을 미세조정하며, 하이퍼파라미터 튜닝을 위해 소규모 검증 세트를 사용한다.
  • 각 긍정 문장당 10개의 음성 예제를 고정 비율로 샘플링하며, 전략별 최적의 성능은 5% 이하의 하드 음성 예제 샘플링 비율에서 달성된다.

실험 결과

연구 질문

  • RQ1원거리 지도 학습 하에서 다양한 음성 샘플링 전략이 암시적으로 언급된 스킬 탐지에 얼마나 효과적인가?
  • RQ2모델 성능 저하 없이 학습 과정에 포함할 수 있는 하드 음성 예제의 최적 비율은 얼마인가?
  • RQ3단일 전략을 별도로 사용하는 것보다 다수의 음성 샘플링 전략을 조합하면 성능 향상이 더 크게 이루어지는가?
  • RQ4ESCO 분류 체계의 계층적 관계를 활용한 방법이 문자열 유사도나 임베딩 기반 방법에 비해 정보성 음성 예제 선택에 더 효과적인가?
  • RQ5수동 주석이 필요 없이 원거리 지도 학습 데이터에 훈련된 모델이 새로운 암시적 스킬 언급에 얼마나 잘 일반화되는가?

주요 결과

  • 레벤슈타인, 형제 스킬, 임베딩 전략을 모두 조합한 경우가 가장 높은 성능 향상을 보였으며, 기준 모델 대비 RP@5 기준 최대 8%p 향상되었다.
  • ESCO 분류 체계의 계층적 구조를 활용한 형제 스킬 기반 전략이 가장 큰 성능 향상을 이끌었으며, 문자열 유사도나 임베딩 기반 방법보다 더 효과적이었다.
  • 최적의 하드 음성 예제 비율은 5% 이하로 확인되었으며, 이보다 높은 비율은 성능 저하를 초래했고, 이는 이전 연구 결과와 일치했다.
  • ESCO의 계층적 구조가 이용 가능하지 않은 경우, 임베딩 기반 전략이 강력한 대안이 되었으며, 형제 스킬 전략과 유사한 성능을 보였다.
  • 형제 스킬 전략을 제거했을 때 성능 저하가 가장 컸으며, 레벤슈타인 전략을 제거했을 때는 영향이 가장 작았는데, 이는 이 전략이 관련 없거나 노이즈가 많은 음성 예제를 선택할 가능성이 높기 때문이다.
  • 최종 모델은 TECH 데이터셋에서 MRR 0.339, RP@5 31.11을 달성했으며, HOUSE 데이터셋에서는 MRR 0.298, RP@5 30.14를 기록하여 다양한 도메인 간 강력한 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.