Skip to main content
QUICK REVIEW

[論文レビュー] Extreme Multi-Label Skill Extraction Training using Large Language Models

Jens-Joris Decorte, Severine Verlinden|arXiv (Cornell University)|Jul 20, 2023
Topic Modeling被引用数 5
ひとこと要約

本稿では、大規模言語モデル(LLM)によって生成された合成データとコントラスト学習を用いて、極めて多値ラベルのスキル抽出モデルをコスト効率よく訓練する手法を提案する。ESCOオントロジーに基づいて138K組の合成(スキル、求人広告文)ペアを生成し、新しい拡張戦略を適用することで、遠隔教師ありベースラインよりR-Precision@5で15–25パーセンテージポイントの向上を達成。実際の記述で訓練されたモデルでさえも上回る性能を発揮した。

ABSTRACT

Online job ads serve as a valuable source of information for skill requirements, playing a crucial role in labor market analysis and e-recruitment processes. Since such ads are typically formatted in free text, natural language processing (NLP) technologies are required to automatically process them. We specifically focus on the task of detecting skills (mentioned literally, or implicitly described) and linking them to a large skill ontology, making it a challenging case of extreme multi-label classification (XMLC). Given that there is no sizable labeled (training) dataset are available for this specific XMLC task, we propose techniques to leverage general Large Language Models (LLMs). We describe a cost-effective approach to generate an accurate, fully synthetic labeled dataset for skill extraction, and present a contrastive learning strategy that proves effective in the task. Our results across three skill extraction benchmarks show a consistent increase of between 15 to 25 percentage points in extit{R-Precision@5} compared to previously published results that relied solely on distant supervision through literal matches.

研究の動機と目的

  • 求人広告における極めて多値ラベルのスキル抽出のための、大規模かつ高品質なラベル付きデータセットの不足に対処すること。
  • ESCOオントロジーに根ざしたLLMを用いた、完全に合成されたデータ生成パイプラインをコスト効率よく開発すること。
  • 埋め込み空間における文とスキルの表現を整列させるコントラスト学習により、スキル抽出の性能を向上させること。
  • モデルの汎化性能を向上させるシンプルだが効果的なデータ拡張戦略を導入すること。
  • 将来の研究を支援するため、ESCOオントロジーの99.5%をカバーする包括的な138K組の(スキル、文)データセットを公開すること。

提案手法

  • 大規模言語モデルを活用し、ESCOオントロジーの各スキルとその説明に基づいて、138K組の合成された求人広告文を生成する。
  • 文埋め込みとその対応する合成文を同じベクトル空間に埋め込むために、コントラスト学習を用いて文埋め込みモデル(sentence-transformer bi-encoder)を微調整する。
  • 各(スキル、文)ペアにランダムな無関係な文を連結するデータ拡張技術を適用し、モデルが関連する文脈に注目するよう強制する。
  • バッチ内の正例ペア(スキル、文)間の距離を最小化し、負例ペア間の距離を最大化するように、コントラスト損失を最適化する。
  • 解釈可能性および下流の推論のため、トークン埋め込みの平均値を最終的な文表現とする。
  • MRRとR-Precision@5を指標として用い、TECH、HOUSE、および独自のTECHWOLFセットの3つのベンチマークでモデルを訓練および評価する。

実験結果

リサーチクエスチョン

  • RQ1大規模なラベル付きデータセットが存在しない状況下で、LLMによって生成された合成データが、実世界のアノテート済みデータを上回る性能を発揮できるか?
  • RQ2テキストスパンではなく、完全な文を対象としたコントラスト学習は、スパンベースの手法と比較してスキル抽出性能を向上させるか?
  • RQ3訓練時に無関係な文を連結するシンプルなデータ拡張戦略は、どの程度効果的か?
  • RQ41スキルあたり1つの合成文を用いることで、ESCOスキルの説明で訓練されたモデルを上回れるか?
  • RQ51スキルあたりの合成文の数を増やすことで、モデル性能がどの程度向上するか?

主な発見

  • 提案手法は、文字列マッチを用いた遠隔教師ありベースラインと比較して、R-Precision@5で15–25パーセンテージポイントの向上を達成した。
  • 1スキルあたり1つの合成文を用いるだけで、ESCOスキルの説明で訓練されたモデルを上回った。これはLLMによって生成されたデータの質の高さを示している。
  • GPTによって生成された文を用いたモデルは、TECHベンチマークで54.62のR-Precision@5、TECHWOLFで54.57、HOUSEで45.74を記録した。
  • 拡張戦略は、すべてのベンチマークで一貫して性能向上をもたらし、特にTECHWOLFセットで最大の向上(46.50から52.55に)を示した。
  • より多くの訓練データを用いることで性能が向上するが、1スキルあたり1文でも、説明ベースの訓練を上回る結果を達成した。
  • 合成データで訓練されたモデルは、実データで微調整されたall-mpnet-base-v2モデルの性能を上回った。これは、合成データ生成とコントラスト学習のパイプラインの有効性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。