[論文レビュー] Learning to Extract Structured Entities Using Language Models
本稿では、事前に定義されたスキーマの下で名前付きエンティティ認識、プロパティ抽出、関係抽出を統合する新しいタスクである構造的エンティティ抽出(SEE)を紹介する。著者らは、抽出を並列段階に分解することで効果性と効率性を向上させる多段階的LLMベースのモデルMuSEEを提案し、ベンチマークデータセットで最先端の性能を達成した。定量的評価および人的評価により、優れた耐性と幻覚の低減が裏付けられている。
Recent advances in machine learning have significantly impacted the field of information extraction, with Language Models (LMs) playing a pivotal role in extracting structured information from unstructured text. Prior works typically represent information extraction as triplet-centric and use classical metrics such as precision and recall for evaluation. We reformulate the task to be entity-centric, enabling the use of diverse metrics that can provide more insights from various perspectives. We contribute to the field by introducing Structured Entity Extraction and proposing the Approximate Entity Set OverlaP (AESOP) metric, designed to appropriately assess model performance. Later, we introduce a new Multistage Structured Entity Extraction (MuSEE) model that harnesses the power of LMs for enhanced effectiveness and efficiency by decomposing the extraction task into multiple stages. Quantitative and human side-by-side evaluations confirm that our model outperforms baselines, offering promising directions for future advancements in structured entity extraction. Our source code and datasets are available at https://github.com/microsoft/Structured-Entity-Extraction.
研究の動機と目的
- 構造的エンティティ抽出(SEE)を、NER、プロパティ抽出、関係抽出、コアリゾリューションを統合する包括的タスクとして形式的に定式化・定義すること。
- SEEの適切な評価指標の欠如に対処するため、予測済みと正解の構造的エンティティ集合を比較するためのセットベースの類似度測定法である近似エンティティ集合オーバーラップ(AESOP)指標を提案し、その複数のバリアントを含む。
- 新規な多段階アーキテクチャを用いて、大規模言語モデル(LLM)を活用した構造的エンティティ抽出の効果性と効率性を向上させること。
- 入力テキストへの根拠(グランドイング)を分析することで、摂動に対するモデルの耐性を評価し、幻覚を低減すること。
- 定量的ベンチマークと人的なサイド-by-side評価を通じて、性能を検証すること。
提案手法
- すべてのエンティティタイプとプロパティキーが事前に定義されたスキーマによって制約される閉形式情報抽出タスクとしてSEEを形式化する。
- 予測済みと正解の構造的エンティティ集合を比較するためのセットベースの類似度測定法であるAESOP指標を提案し、精度、再現率、最大F1の各バリアントを含む。
- エンティティ認識、プロパティ抽出、関係予測の順序付き段階に分解する多段階LLMベースのモデルMuSEEを設計し、並列処理を可能とし、生成トークン数を削減する。
- 段階的分解と焦点的な予測により、冗長なトークン生成を最小限に抑えることで推論の効率性を最適化する。
- テストデータのプロパティ値をカテゴリベースで置換することで摂動を加え、性能低下を測定することで、入力テキストへの依存性とモデルの知識への依存性の両方を評価するグランドイングチェックを実装する。
- スキーマに準拠した構造化JSON出力を生成するようLLMを誘導するため、Few-shotプロンプトとインstructチューニングを用いる。

実験結果
リサーチクエスチョン
- RQ1事前に定義されたスキーマの下で、NER、プロパティ抽出、関係抽出を統合する包括的NLPタスクとして、構造的エンティティ抽出をどのように形式的に定義できるか?
- RQ2予測済みと正解のエンティティ集合(プロパティ付き)を比較する際、構造的エンティティ抽出の品質を最も的確に捉える評価指標は何か?
- RQ3多段階的LLMベースのアーキテクチャは、エンドツーエンドのベースラインと比較して、構造的エンティティ抽出における効果性と効率性を向上させられるか?
- RQ4LLMベースのモデルは、入力テキストへの根拠に依存するのではなく、事前に学習された知識に依存して幻覚を生じる程度はどの程度か?
- RQ5特にレアまたはスパースなプロパティにおいて、モデルの性能はどのように変動するか?
主な発見
- Wikidataベースのデータセットにおいて、MuSEEはすべてのベースラインを上回り、AESOP-MultiProp-Maxスコアで最高を記録した。人的完全性評価では61.75%の好まれ率を達成した。
- 摂動を加えたデータに対して、MuSEEは他のモデルと比較して最も小さな性能低下を示し、入力テキストへの根拠が強く、幻覚が少ないことを示している。
- プロパティレベルの分析では、MuSEEはすべてのプロパティでベースラインを上回り、頻度の高いプロパティ(例:'type'、'entity name')において顕著な改善を示し、レアプロパティ(例:'capital')に対しても強力な性能を発揮した。
- すべてのモデル(MuSEEを含む)が、'place of death' や 'occupation' のようなスパースプロパティにおいて低い性能を示しており、データスパarsityが主な課題であることが示された。
- 人的評価により、MuSEEの正確性(59.32%の好まれ率)と幻覚の低減(57.13%の好まれ率)が確認され、定量的結果と整合的であった。
- MuSEEの多段階的設計により、生成トークン数を削減しながらも高い精度を維持でき、効果性と効率性の良好なトレードオフを実現した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。