Skip to main content
QUICK REVIEW

[論文レビュー] Scraping and Clustering Techniques for the Characterization of Linkedin Profiles

Kais Dai, Celia Gónzalez Nespereira|arXiv (Cornell University)|May 5, 2015
Web Data Mining and Analysis参考文献 29被引用数 13
ひとこと要約

本稿では、ウェブスクレイピングを用いて収集した570万件の公開LinkedInプロファイルからなる大規模なデータセットを提示する。自然言語処理(NLP)とK-meansクラスタリングを活用し、教育的背景を5つのカテゴリーに分類し、自由記述の要約に基づいて9つの異なる職業的クラスタを特定する。主な貢献は、教育と職業の関連性およびLinkedIn上での職業的グループ化に関する知見を可能にする代表的で、公に入手できないデータセットを提供することにある。

ABSTRACT

The socialization of the web has undertaken a new dimension after the emergence of the Online Social Networks (OSN) concept. The fact that each Internet user becomes a potential content creator entails managing a big amount of data. This paper explores the most popular professional OSN: LinkedIn. A scraping technique was implemented to get around 5 Million public profiles. The application of natural language processing techniques (NLP) to classify the educational background and to cluster the professional background of the collected profiles led us to provide some insights about this OSN's users and to evaluate the relationships between educational degrees and professional careers.

研究の動機と目的

  • 学術的調査のための公開可能で大規模なLinkedInデータセットが不足しているという問題に対処すること。
  • LinkedIn上における教育的背景と職業的キャリアの流れの関係を調査すること。
  • 自然言語処理(NLP)およびクラスタリング技術を活用し、スケールに応じたプロファイルの分類と特徴化を実施すること。
  • 非構造化プロファイルデータから職業的グループ化およびキャリアトレンドに関する実用的知見を生成すること。
  • 時間的および教育的データを用いた予測的キャリアパスモデリングの基盤を構築すること。

提案手法

  • APIの制限を回避するため、ウェブスクレイピングを用いて公開LinkedInプロファイルを抽出した。
  • 自然言語処理(NLP)技術を用いて、教育的背景を5つのUNESCOベースのカテゴリーに分類した:博士号(PhD)、修士号(master)、学士号(bachelor)、中等教育(secondary)、その他(others)。
  • 職業的要約に基づいてプロファイルをクラスタリングするためにK-meansクラスタリングアルゴリズムを用い、最適なクラスタ数はエルボー法によって特定した。
  • 各クラスタの代表的なキーワードと職業的アイデンティティを可視化するため、タグクラウドを生成した。
  • 分類およびクラスタリングの正確性を向上させるために、データ前処理としてクリーニングと正規化を実施した。
  • 本研究では、従来の小規模な研究と比較して代表的であることが向上した、独自に構築した570万件のプロファイルデータセットを活用した。

実験結果

リサーチクエスチョン

  • RQ1教育的背景はLinkedInプロファイル全体にどのように分布しているのか。また、職業的役割と関連してどのようなパターンが浮き彫りになるか。
  • RQ2自由記述のプロファイル要約を対象とした非教師あり学習によって、どのような職業的クラスタが特定できるか。
  • RQ3教育的資格はLinkedIn上での特定の職業的キャリアパスとどの程度相関しているか。
  • RQ4NLPおよびクラスタリング技術は、非構造化ソーシャルメディアデータに隠れた構造をどの程度明らかにできるか。
  • RQ5プロファイルに含まれる時間的データは、キャリア進捗の予測モデリングを支援できるか。

主な発見

  • 本データセットは570万件のLinkedInプロファイルを含み、社会的ネットワーク研究に向けた大規模で公に入手できないリソースである。
  • 最も頻度の高かった教育カテゴリーは「master」(修士号)で、次に「bachelor」(学士号)が続いた。博士号(PhD)のプロファイルは、研究志向の明確なクラスタを形成した。
  • 9つの職業的クラスタが特定され、最大のクラスタ(5,152件)はアシスタントプロフェッサーおよび研究志向の役割を表した。
  • タグクラウドから、専門的な用語の明確な差が浮き彫りになった:学術的クラスタでは「university」(大学)、「teaching」(教育)、「professor」(教授)が顕著に現れた。
  • 「associate professor」(准教授)クラスタは、国際的プロジェクトへの関与および管理的役割を特徴としていた。
  • 75件の多様な分野にまたがるクラスタは、経営、研究、教育の役割を統合しており、キャリアの多様化を示唆していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。