Skip to main content
QUICK REVIEW

[論文レビュー] IPOD: Corpus of 190, 000 Industrial Occupations.

Junhua Liu, Chu Guo|arXiv (Cornell University)|Oct 22, 2019
Topic Modeling参考文献 53被引用数 8
ひとこと要約

IPODは、LinkedInプロフィールから抽出した190,000件の産業職種タイトルを含む、公開済みの新規コーパスであり、高度な職業データマイニングを可能にする。著者らは、専門家がアノテートした命名済みエンティティをBIOES形式で使用した知識ベース型のガゼテアラーを用い、複数のNERモデルを訓練。その結果、CRFおよびLSTM-CRFモデルは、正確一致スコアおよびF1スコアにおいて人間の水準を超える精度を達成した。

ABSTRACT

Job titles are the most fundamental building blocks for occupational data mining tasks, such as Career Modelling and Job Recommendation. However, there are no publicly available dataset to support such efforts. In this work, we present the Industrial and Professional Occupations Dataset (IPOD), which is a comprehensive corpus that consists of over 190,000 job titles crawled from over 56,000 profiles from Linkedin. To the best of our knowledge, IPOD is the first dataset released for industrial occupations mining. We use a knowledge-based approach for sequence tagging, creating a gazzetteer with domain-specific named entities tagged by 3 experts. All title NE tags are populated by the gazetteer using BIOES scheme. Finally, We develop 4 baseline models for the dataset on NER task with several models, including Linear Regression, CRF, LSTM and the state-of-the-art bi-directional LSTM-CRF. Both CRF and LSTM-CRF outperform human in both exact-match accuracy and f1 scores.

研究の動機と目的

  • 産業職業データマイニングのための公開可能なデータセットが不足しているという問題に対処すること。
  • 実世界のLinkedInプロフィールから得た、包括的で大規模な職種タイトルコーパスを構築すること。
  • 知識ベースアプローチを用いて産業職種タイトルの信頼性の高い命名エンティティ認識(NER)システムを開発すること。
  • 産業職業データに対するNERのベースラインモデルを確立し、人間のアノテーションと比較してパフォーマンスをベンチマークすること。

提案手法

  • コーパス構築のため、56,000件を超えるLinkedInプロフィールをクロールし、190,000件の固有の職種タイトルを収集した。
  • 専門家がアノテートした命名エンティティを用いて、ドメイン特化型のガゼテアラーを構築した。BIOESタギング方式を採用した。
  • ガゼテアラーを用いて、知識ベース型のシーケンスタギングアプローチを適用し、全職種タイトルを自動的にタグ付けした。
  • NERタスクにおいて、4つのベースラインモデル(線形回帰、CRF、LSTM、双方向LSTM-CRF)を訓練および評価した。
  • モデルパフォーマンスの比較に、正確一致精度とF1スコアを評価指標として使用した。

実験結果

リサーチクエスチョン

  • RQ1実際のLinkedInプロフィールから、大規模かつ公開可能な産業職種タイトルコーパスを効果的に構築できるか?
  • RQ2知識ベース型ガゼテアラー手法は、産業職種タイトルにおける命名エンティティ認識にどの程度効果的か?
  • RQ3LSTM-CRFのようなディープラーニングモデルは、このNERタスクにおいて、CRFのような従来のモデルを上回る性能を示すか?
  • RQ4機械学習モデルは、職種タイトルNERの正確一致精度およびF1スコアにおいて、人間の水準を超えるパフォーマンスを達成できるか?

主な発見

  • IPODデータセットは、56,000件を超えるLinkedInプロフィールから抽出した190,000件の産業職種タイトルを含む、類似した公開コーパスでは初のものである。
  • CRFモデルは、NERタスクにおいて人間のアノテーターを上回る正確一致精度とF1スコアを達成した。
  • 双方向LSTM-CRFモデルは、CRFを含む他のすべてのモデルを上回り、正確一致精度およびF1スコアの両方で最高のパフォーマンスを示した。
  • 知識ベース型ガゼテアラー手法により、専門家がアノテートしたドメイン固有エンティティを用いて、全190,000件の職種タイトルに対する一貫性がありスケーラブルなラベル付けが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。