Skip to main content
QUICK REVIEW

[논문 리뷰] Resume Evaluation through Latent Dirichlet Allocation and Natural Language Processing for Effective Candidate Selection

Vidhita Jagwani, Smit Meghani|arXiv (Cornell University)|2023. 07. 28.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 잠재 Dirichlet 분할(Latent Dirichlet Allocation, LDA)과 SpaCy 기반 명명된 실체 인식(Named Entity Recognition, NER)을 사용하여 교육, 경력, 기술을 추출하고 분석함으로써 콘텐츠 중심의 이력서 평가 시스템을 제안한다. 이방법은 이력서 실체를 주제로 모델링하여 총 이력서 평가 정확도 82%를 달성하였으며, 어휘적 주제 모델링과 실체 인식 기반 표현 학습을 통해 키워드 기반 접근 방식을 능가한다.

ABSTRACT

In this paper, we propose a method for resume rating using Latent Dirichlet Allocation (LDA) and entity detection with SpaCy. The proposed method first extracts relevant entities such as education, experience, and skills from the resume using SpaCy's Named Entity Recognition (NER). The LDA model then uses these entities to rate the resume by assigning topic probabilities to each entity. Furthermore, we conduct a detailed analysis of the entity detection using SpaCy's NER and report its evaluation metrics. Using LDA, our proposed system breaks down resumes into latent topics and extracts meaningful semantic representations. With a vision to define our resume score to be more content-driven rather than a structure and keyword match driven, our model has achieved 77% accuracy with respect to only skills in consideration and an overall 82% accuracy with all attributes in consideration. (like college name, work experience, degree and skills)

연구 동기 및 목표

  • 키워드 매칭이나 구조적 포맷에 의존하기보다 콘텐츠 의미를 우선시하는 이력서 평가 시스템을 개발하는 것.
  • 추출된 실체에 기반한 LDA를 활용해 잠재 주제로 이력서를 모델링함으로써 지원자 선별 정확도를 향상시키는 것.
  • SpaCy의 NER가 이력서에서 교육, 경력, 기술 실체를 추출하는 데서의 성능을 평가하는 것.
  • 의미적 관련성과 완전성을 반영하는 콘텐츠 중심의 이력서 평가 점수를 수립하는 것.
  • 기존의 키워드 기반 또는 구조에 의존하는 이력서 스크리닝 방법보다 더 높은 정확도를 달성하는 것.

제안 방법

  • SpaCy를 사용한 명명된 실체 인식(NER)을 통해 교육, 경력, 학위, 기술 등의 핵심 이력서 실체를 추출하는 것.
  • 추출된 실체에 기반해 잠재 주제 모델을 구축하기 위해 잠재 Dirichlet 분할(Latent Dirichlet Allocation, LDA)을 적용하여 이력서를 주제 분포로 표현하는 것.
  • 각 실체에 대해 주제 확률을 할당하여 이력서의 의미적 관련성과 콘텐츠의 풍부함을 정량화하는 것.
  • 대학명, 학위, 경력 이력, 기술 등 다양한 실체 유형을 통합된 평가 프레임워크에 통합하는 것.
  • 실체 공존 및 분포를 기반으로 LDA를 적용하여 이력서의 의미적 표현을 생성하는 것.
  • 키워드 빈도나 포맷에 대한 의존도를 최소화하고 콘텐츠 중심의 평가에 중점을 두어 설계된 점수 시스템

실험 결과

연구 질문

  • RQ1LDA와 NER 기반 실체 추출이 지원자 평가를 위한 이력서의 의미적 콘텐츠를 얼마나 정확하게 모델링할 수 있는가?
  • RQ2콘텐츠 중심 접근 방식이 키워드 기반 또는 구조 기반 이력서 평가보다 어느 정도 뛰어나게 성능을 발휘하는가?
  • RQ3SpaCy의 NER가 실제 이력서에서 교육, 경력, 기술 실체를 추출하는 데서의 성능은 어떠한가?
  • RQ4다양한 이력서 속성(교육, 경력, 기술)을 통합할 경우 전체 평가 정확도에 어떤 영향을 미치는가?
  • RQ5추출된 실체에 대한 주제 모델링이 지원자 자격의 더 의미 있고 정확한 표현을 도출할 수 있는가?

주요 결과

  • 제안된 시스템은 교육, 경력, 학위, 기술 등 모든 속성을 고려할 때 총 이력서 평가 정확도 82%를 달성하였다.
  • 기본적으로 기술 요소만 평가할 경우 모델은 77%의 정확도를 기록하여 이력서 평가의 核심 요소에서 뛰어난 성능을 보였다.
  • SpaCy의 NER는 상세히 평가되었으며 실체 탐지 성능에 대한 보고된 지표가 제공되었지만, 요약에는 구체적 수치가 포함되어 있지 않다.
  • LDA의 활용은 구조화된 실체 입력에서 잠재 주제를 식별함으로써 이력서의 효과적인 의미적 표현을 가능하게 하였다.
  • 모델은 키워드 매칭과 구조적 포맷에 대한 의존도를 줄여 의미 기반 콘텐츠 분석을 우선시하는 데 성공하였다.
  • 결과적으로, 추출된 실체에 대한 주제 모델링이 기존의 방법보다 지원자 선별 정확도를 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.