[논문 리뷰] IPOD: Corpus of 190, 000 Industrial Occupations.
IPOD는 LinkedIn 프로필에서 추출한 190,000개의 산업 직무 제목을 포함한 새로운 공개 코퍼스로, 고도화된 직업 데이터 마이닝을 가능하게 한다. 저자들은 전문가가 태깅한 명시적 개체를 BIOES 형식으로 사용한 지식 기반의 가제타르를 활용해 여러 NER 모델을 훈련시켰으며, 정확도와 F1 스코어에서 정확도가 인간 수준을 초월하는 CRF 및 LSTM-CRF 성능을 달성했다.
Job titles are the most fundamental building blocks for occupational data mining tasks, such as Career Modelling and Job Recommendation. However, there are no publicly available dataset to support such efforts. In this work, we present the Industrial and Professional Occupations Dataset (IPOD), which is a comprehensive corpus that consists of over 190,000 job titles crawled from over 56,000 profiles from Linkedin. To the best of our knowledge, IPOD is the first dataset released for industrial occupations mining. We use a knowledge-based approach for sequence tagging, creating a gazzetteer with domain-specific named entities tagged by 3 experts. All title NE tags are populated by the gazetteer using BIOES scheme. Finally, We develop 4 baseline models for the dataset on NER task with several models, including Linear Regression, CRF, LSTM and the state-of-the-art bi-directional LSTM-CRF. Both CRF and LSTM-CRF outperform human in both exact-match accuracy and f1 scores.
연구 동기 및 목표
- 공개적으로 이용 가능한 산업 직업 데이터 마이닝을 위한 데이터셋 부족 문제를 해결하기 위해.
- 실제 LinkedIn 프로필에서 유래한 종합적이고 대규모의 직무 제목 코퍼스를 구축하기 위해.
- 지식 기반 접근 방식을 활용해 산업 직무 제목에 대한 신뢰할 수 있는 명시적 개체 인식(NER) 시스템을 개발하기 위해.
- 산업 직업 데이터에 대한 NER 작업을 위한 기준 모델을 수립하고 인간 태깅 결과와의 성능 비교를 위해.
제안 방법
- 코퍼스 구축을 위해 56,000개 이상의 LinkedIn 프로필을 크롤링하여 190,000개의 고유한 직무 제목을 확보했다.
- 전문가가 태깅한 명시적 개체를 사용해 도메인 특화 가제타르를 구축했다.
- 가제타르를 활용해 지식 기반의 시퀀스 태깅 접근 방식을 적용해 모든 직무 제목을 자동으로 태깅했다.
- NER 작업에 대해 선형 회귀, CRF, LSTM, 양방향 LSTM-CRF의 네 가지 기준 모델을 훈련 및 평가했다.
- 모델 성능 평가를 위해 정확도의 정확한 매칭과 F1 스코어를 사용하여 인간 태깅 결과와 비교했다.
실험 결과
연구 질문
- RQ1실제 LinkedIn 프로필에서 유래한 대규모 공개 코퍼스를 효과적으로 산업 직무 제목 데이터로 구축할 수 있는가?
- RQ2지식 기반의 가제타르 접근 방식은 산업 직무 제목의 명시적 개체 인식에 얼마나 효과적인가?
- RQ3LSTM-CRF와 같은 딥러닝 모델이 이 NER 작업에서 전통적 모델인 CRF를 능가하는가?
- RQ4기계 학습 모델이 직무 제목 NER 작업에서 정확도의 정확한 매칭과 F1 스코어에서 인간 수준 성능을 초월할 수 있는가?
주요 결과
- IPOD 데이터셋은 56,000개 이상의 LinkedIn 프로필에서 유래한 190,000개의 산업 직무 제목을 포함한 공개된 코퍼스로서, 이와 같은 유형의 첫 번째 데이터셋이다.
- CRF 모델은 NER 작업에서 인간 태거보다 정확도의 정확한 매칭과 F1 스코어에서 높은 성능을 기록했다.
- 양방향 LSTM-CRF 모델은 CRF를 포함한 모든 다른 모델보다 정확도의 정확한 매칭과 F1 스코어에서 뛰어난 성능을 보였다.
- 지식 기반의 가제타르 접근 방식을 통해 전문가가 태깅한 도메인 개체를 활용해 190,000개의 모든 직무 제목에 대해 일관되고 확장 가능한 태깅을 구현했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.