Skip to main content
QUICK REVIEW

[논문 리뷰] Data-driven HR - Résumé Analysis Based on Natural Language Processing and Machine Learning

Tim Zimmermann, Leo Kotschenreuther|arXiv (Cornell University)|2016. 06. 17.
AI and HR Technologies인용 수 10
한 줄 요약

이 논문은 자연어 처리(NLP)와 기계학습을 활용해 레이저에서 비정형적인 이력서 정보를 자동으로 추출하고 구조화한 후, 교육, 경력, 기술을 종합적으로 고려한 가중치가 부여된 적합도 점수를 기반으로 지원자를 순위 매기는 데이터 기반 HR 시스템을 제안한다. 프로토타입은 시각화 기능을 통해 채용 담당자가 순위를 걸러내고 검증할 수 있도록 하여 채용 효율성을 높이고 편향을 줄인다. 객관적이고 설명 가능한 지원자 평가 방식을 제공한다.

ABSTRACT

Recruiters usually spend less than a minute looking at each résumé when deciding whether it's worth continuing the recruitment process with the candidate. Recruiters focus on keywords, and it's almost impossible to guarantee a fair process of candidate selection. The main scope of this paper is to tackle this issue by introducing a data-driven approach that shows how to process résumés automatically and give recruiters more time to only examine promising candidates. Furthermore, we show how to leverage Machine Learning and Natural Language Processing in order to extract all required information from the résumés. Once the information is extracted, a ranking score is calculated. The score describes how well the candidates fit based on their education, work experience and skills. Later this paper illustrates a prototype application that shows how this novel approach can increase the productivity of recruiters. The application enables them to filter and rank candidates based on predefined job descriptions. Guided by the ranking, recruiters can get deeper insights from candidate profiles and validate why and how the application ranked them. This application shows how to improve the hiring process by giving an unbiased hiring decision support.

연구 동기 및 목표

  • 채용 담당자가 한 명당 1분 미만으로 레이저를 검토하고 흔히 키워드 기반 필터링에 의존하는 등 수작업 레이저 스크리닝의 비효율성과 편향 문제를 해결하기 위해.
  • 비정형 레이저(주로 PDF 형식)에서 교육, 경력, 기술 등의 구조화된 정보를 자연어 처리(NLP)와 기계학습(ML)을 통해 자동으로 추출하는 파이프라인을 개발하기 위해.
  • 직무 설명과의 가중치 비교를 기반으로 한 적합도 점수(0–100)를 생성하기 위해, 기술은 교육과 경력보다 두 배의 가중치를 부여한다.
  • 채용 담당자가 순위를 시각화하고 점수의 근거를 설명하는 기능을 통해 설명 가능한 인공지능(Explainable AI) 기능을 제공하는 인터랙티브 애플리케이션을 제공하기 위해.
  • 데이터 기반의 편향 없는 채용 워크플로우를 통해 시간당 채용 시간을 단축하고 지원자 매칭의 질을 향상시키기 위해.

제안 방법

  • 레이아웃 및 콘텐츠 분석을 사용해 PDF 레이저를 HTML로 변환하고, 사전 훈련된 기계학습 분류기를 사용해 섹션 분할을 수행한다.
  • 도메인 특화 NLP 프로세서를 적용해 이름, 날짜, 기관, 직무 등의 실체를 추출하고, 명시적 실체 인식(NEP)과 비표준 날짜 형식에 대한 규칙 기반 정규화를 사용한다.
  • 80만 개의 프로필에서 훈련된 워드 임베딩(Word2Vec)을 사용해 기술 간 관계를 모델링하고, 차원 감소를 위해 t-SNE를 적용하여 유사 기술 그룹을 식별하고 시각화 및 매칭에 활용한다.
  • 가중치 평균을 사용해 복합 적합도 점수를 계산한다: 기술(가중치 2), 교육, 경력. 교육 점수는 학위 유형과 대학 순위에 기반한다.
  • 세 가지 뷰를 갖춘 프로토타입 애플리케이션을 구현한다: 표 형태의 점수, 순위 비교를 위한 차트, 원본 레이저에서 기술 언급 부분을 인터랙티브하게 강조 표시하는 프로필 뷰.
  • 사용자가 추출된 항목 위에 마우스를 올리면 원본 문서에서 해당 항목의 발생 위치를 강조 표시하고, 유사 기술과 일치 확률 점수를 확인할 수 있도록 설명 가능성 기능을 구현한다.

실험 결과

연구 질문

  • RQ1비정형 레이저에서 구조화된 정보를 추출할 때 레이아웃과 맥락을 유지하는 방식으로 자연어 처리(NLP)와 기계학습(ML)을 어떻게 활용할 수 있는가?
  • RQ2다양한 날짜 형식과 교육 자격을 표준화된 기계 처리 가능한 형태로 표현하고 정규화하는 데 가장 효과적인 방법은 무엇인가?
  • RQ3정확한 키워드 매칭이 없는 경우에도 기술 유사성을 어떻게 모델링하고 시각화하여 근사 매칭을 지원할 수 있는가?
  • RQ4교육, 경력, 기술을 종합한 가중치 점수 시스템이 지원자 순위 매기기 정확도와 채용 담당자의 효율성에 얼마나 기여하는가?
  • RQ5인터랙티브 인터페이스는 자동화된 지원자 순위 매기기의 근거를 검증하고 이해하는 데 어떻게 지원할 수 있는가?

주요 결과

  • 레이아웃 분석, NLP, 기계학습의 조합을 통해 다양한 형식의 비정형 레이저에서 일관된 구조화된 데이터 추출이 가능해져, 다양한 형식에서도 일관된 파싱이 가능하다.
  • 사전 훈련된 워드 임베딩과 t-SNE 클러스터링을 활용해 정확한 용어가 다를 경우에도 유사 기술 간의 효과적인 시각화 및 매칭이 가능하다.
  • 기본적으로 기술에 두 배의 가중치를 부여한 프로토타입의 순위 시스템은 0에서 100 사이의 스케일링된 해석 가능한 적합도 점수를 제공하며, 확장성이 뛰어나다.
  • 표 형태의 점수 뷰와 점수 차트와 같은 시각화 기능을 통해 채용 담당자는 상위 지원자를 신속히 식별하고 기술 및 경력 등 다양한 차원에서 성능을 비교할 수 있다.
  • 맥락 인식형 호버 기능과 유사성 기반 기술 확장 기능은 투명성을 높이고, 채용 담당자가 순위의 근거를 검증하고 추론 과정을 탐색할 수 있도록 한다.
  • 추출된 데이터를 원본 문서 콘텐츠와 연결함으로써 더 깊이 있는 지원자 분석이 가능해져 신뢰도와 의사결정 품질이 향상된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.