Skip to main content
QUICK REVIEW

[논문 리뷰] Scraping and Clustering Techniques for the Characterization of Linkedin Profiles

Kais Dai, Celia Gónzalez Nespereira|arXiv (Cornell University)|2015. 05. 05.
Web Data Mining and Analysis참고 문헌 29인용 수 13
한 줄 요약

이 논문은 웹 스크래핑을 통해 수집한 570만 개의 공개 LinkedIn 프로필로 구성된 대규모 프로필 데이터셋을 제시한다. 자연어 처리(NLP)와 K-means 군집화 기법을 활용해 교육 배경을 다섯 가지 카테고리로 분류하고, 자유형식의 요약문을 바탕으로 아홉 가지의 유의미한 전문 직무 군집을 식별한다. 주요 기여는 학술 연구를 위한 대표성 있는, 공개로 접근이 불가능한 데이터셋을 제공함으로써 LinkedIn 내 교육-직업 연계성과 전문 직무 군집에 대한 통찰을 가능하게 한다.

ABSTRACT

The socialization of the web has undertaken a new dimension after the emergence of the Online Social Networks (OSN) concept. The fact that each Internet user becomes a potential content creator entails managing a big amount of data. This paper explores the most popular professional OSN: LinkedIn. A scraping technique was implemented to get around 5 Million public profiles. The application of natural language processing techniques (NLP) to classify the educational background and to cluster the professional background of the collected profiles led us to provide some insights about this OSN's users and to evaluate the relationships between educational degrees and professional careers.

연구 동기 및 목표

  • 학술 연구를 위한 공개 가능하고 대규모인 LinkedIn 데이터셋의 부족을 보완하기 위해.
  • LinkedIn 내에서 교육 배경과 전문 직업 경로 간의 관계를 탐색하기 위해.
  • 대규모로 프로필을 분류하고 특성화하기 위해 자연어 처리(NLP) 및 군집화 기법을 개발하고 적용하기 위해.
  • 비정형 프로필 데이터에서 전문 직무 군집과 경력 추세에 대한 실질적인 통찰을 도출하기 위해.
  • 시계열 데이터와 교육 정보를 활용해 경력 경로 예측 모델링의 기반을 마련하기 위해.

제안 방법

  • API 제한을 우회하기 위해 웹 스크래핑 기법을 사용해 공개 LinkedIn 프로필을 추출함.
  • 자연어 처리(NLP) 기법을 적용해 교육 배경을 유네스코 기반의 다섯 가지 카테고리로 분류함: 박사, 석사, 학사, 중등, 기타.
  • 전문 요약문을 기반으로 프로필을 군집화하기 위해 K-means 군집화 알고리즘을 사용하였으며, 최적의 군집 수는 팔꿈치 방법(elbow method)을 통해 결정함.
  • 각 군집의 주요 키워드와 전문 직무 정체성을 시각화하기 위해 태그 클라우드를 생성함.
  • 분류 및 군집화 정확도 향상을 위해 데이터 전처리 및 정규화를 수행함.
  • 기존의 소규모 연구에 비해 대표성을 높인 570만 개의 프로필로 구성된 맞춤형 데이터셋을 활용함.

실험 결과

연구 질문

  • RQ1LinkedIn 프로필 내에서 교육 배경는 어떻게 분포되어 있으며, 전문 직무 역할과의 관계에서 어떤 패턴이 드러나나?
  • RQ2자유형식 프로필 요약문에 대해 비지도 학습 기법을 적용했을 때, 어떤 전문 직무 군집이 식별될 수 있는가?
  • RQ3특정 교육 자격이 LinkedIn 내 특정 전문 직업 경로와 어떻게 연관되어 있는가?
  • RQ4NLP 및 군집화 기법을 통해 비정형 소셜 미디어 데이터 내에 숨겨진 구조를 어느 정도 드러낼 수 있는가?
  • RQ5프로필 내 시계열 데이터는 경력 진행 예측 모델링을 지원하는 데 어느 정도 기여하는가?

주요 결과

  • 이 데이터셋은 570만 개의 LinkedIn 프로필을 포함하고 있으며, 사회망 연구를 위한 대규모이자 공개로 접근이 불가능한 자원으로서의 가치를 지닌다.
  • 가장 빈도가 높은 교육 카테고리는 '석사'였고, 이어 '학사'가 뒤를 이었으며, '박사' 프로필은 연구 중심의 고유한 군집을 형성하였다.
  • 아홉 개의 전문 직무 군집이 식별되었으며, 가장 큰 군집(5,152명)은 조교수 및 연구 중심 역할을 나타내었다.
  • 태그 클라우드 분석을 통해 학술 군집에서는 'university'(대학), 'teaching'(강의), 'professor'(교수) 등의 전문 용어가 두드러지게 나타났다.
  • '부교수' 군집은 국제 프로젝트 참여와 행정 역할이 두드러지게 특징지어졌다.
  • 75명의 다학제적 군집은 경영, 연구, 강의 역할을 병행함으로써 경력의 다각화를 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.