[논문 리뷰] Curriculum Vitae Recommendation Based on Text Mining
이 논문은 텍스트 마이닝 및 NLP 기법을 활용하여 페루의 직업 시장에 적합한 이력서 추천 시스템을 제안한다. 특히 TF-IDF 가중치를 사용하여 직무 공고와의 관련성에 따라 이력서를 순위 매긴다. 이 방법은 이력서와 직무 설명서 간의 어휘 빈도 및 역문서 빈도 점수를 계산하여 정규화된 관련성 점수(0.000 ~ 0.549)를 산출하며, 이는 정확하고 결정적인 이력서 추천 평가 기준이 되며, 일반 TF-IDF 평균은 후보자 매칭을 위한 신뢰할 수 있는 자격 평가 지표로 기능한다.
During the last years, the development in diverse areas related to computer science and internet, allowed to generate new alternatives for decision making in the selection of personnel for state and private companies. In order to optimize this selection process, the recommendation systems are the most suitable for working with explicit information related to the likes and dislikes of employers or end users, since this information allows to generate lists of recommendations based on collaboration or similarity of content. Therefore, this research takes as a basis these characteristics contained in the database of curricula and job offers, which correspond to the Peruvian ambit, which highlights the experience, knowledge and skills of each candidate, which are described in textual terms or words. This research focuses on the problem: how we can take advantage from the growth of unstructured information about job offers and curriculum vitae on different websites for CV recommendation. So, we use the techniques from Text Mining and Natural Language Processing. Then, as a relevant technique for the present study, we emphasize the technique frequency of the Term - Inverse Frequency of the documents (TF-IDF), which allows identifying the most relevant CVs in relation to a job offer of website through the average values (TF-IDF). So, the weighted value can be used as a qualification value of the relevant curriculum vitae for the recommendation.
연구 동기 및 목표
- 페루의 직업 포털에서 흔히 볼 수 있는 비정형적이고 텍스트 기반의 데이터에서 직업 구직자와 관련된 공고를 효과적으로 매칭하는 데 도전한다.
- 이력서와 공고의 명시적 텍스트 내용을 활용하여 채용 효율성을 향상시키는 추천 시스템을 개발한다.
- 실제 페루 고용 데이터를 활용하여 TF-IDF가 특정 공고에 대한 이력서의 관련성을 정량화하는 데 얼마나 효과적인지 평가한다.
- 어휘 관련성과 역문서 빈도를 기반으로 한 데이터 모델을 제안하여 자동화된 이력서 추천을 구현한다.
- 주요 역량과 요구되는 프로필을 파악하여 대학 프로그램 및 직업 시장 분석을 지원한다.
제안 방법
- Scrapy와 BeautifulSoup를 사용한 웹 스크래핑을 통해 Computrabajo 및 Bumeran과 같은 페루 직업 플랫폼에서 스페인어로 작성된 10,000건의 공고와 10,000건의 이력서를 추출한다.
- NLTK를 활용한 텍스트 전처리 과정으로, ASCII 문자 제거, 소문자 변환,标 punctuations 및 음절 제거, 정지어 필터링을 수행한다.
- 모든 어휘에 대해 어휘 빈도(TF)와 역문서 빈도(IDF)를 계산하며, 공식은 다음과 같다: $ \text{TF-IDF} = \text{TF} \times \text{IDF} $, 여기서 $ \text{IDF} = \log\left(\frac{N}{\text{df}(t)}\right) $.
- 각 이력서별로 특정 공고에 대해 TF-IDF 점수를 집계하며, 문서별 평균과 전체 문서에 대한 일반 평균을 계산한다.
- 최소-최대 정규화를 통해 관련성 점수를 정규화한다: $ X_{cs} = \frac{X - X_{\text{min}}}{X_{\text{max}} - X_{\text{min}}} $, 값은 0.000에서 0.549 사이로 변동한다.
- 이력서와 공고 간의 관련성 점수를 담은 5000×9998 행렬을 구축하여 체계적인 분석과 추천을 가능하게 한다.
실험 결과
연구 질문
- RQ1페루의 직업 포털에서 유래한 비정형적 텍스트 데이터는 어떻게 체계적인 관련성 점수로 변환될 수 있는가?
- RQ2TF-IDF 가중치 방법이 특정 공고에 대한 이력서의 관련성을 얼마나 정확하게 반영하는가?
- RQ3문서 간 TF-IDF 점수의 일반 평균은 이력서 추천을 위한 신뢰할 수 있고 결정적인 평가 기준으로서 유용한가?
- RQ4TF-IDF 값의 정규화는 추천 시스템 내에서의 해석 가능성과 사용성에 어떻게 기여하는가?
- RQ5어휘 관련성 분석을 통해 페루의 직업 시장에서 요구되는 역량과 경험에 관해 어떤 통찰을 도출할 수 있는가?
주요 결과
- TF-IDF 방법은 어휘 빈도와 역문서 빈도에 기반한 결정적인 비확률적 계산을 통해 이력서와 공고 간의 관련성을 성공적으로 정량화했다.
- 정규화된 관련성 점수의 최고치는 0.549였고, 최저치는 0.000이었으며, 이는 후보자 적합도의 명확한 범위를 나타낸다.
- CV 2와 8은 관련 어휘의 평균 TF-IDF 점수가 가장 높아, Job 7에 대해 가장 관련성이 높은 것으로 확인되었다.
- 전체 문서에 걸쳐 계산된 일반 TF-IDF 점수 평균(0.092)은 이력서 관련성 순위 매기기의 강력하고 일관된 지표로 기능했다.
- 이 연구에서 도출된 데이터 모델은 5000×9998의 이력서-공고 관련성 점수 행렬을 생성하여 확장 가능하고 체계적인 후보자 추천을 가능하게 했다.
- 본 연구는 정규화된 TF-IDF 점수를 확률 모델링이나 사용자 피드백 없이도 추천 시스템 내에서 자격 평가 값으로 직접 사용할 수 있음을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.