Skip to main content
QUICK REVIEW

[論文レビュー] HopRetriever: Retrieve Hops over Wikipedia to Answer Complex Questions

Shaobo Li, Xiaoguang Li|arXiv (Cornell University)|Dec 31, 2020
Topic Modeling被引用数 5
ひとこと要約

HopRetriever は、Wikipedia におけるマルチホップの証拠を、構造的なハイパーリンク関係と非構造的なドキュメントコンテンツを組み合わせることで特定する新しいリtrievalフレームワークを提案する。エンティティ関係をエンコードするためのメンション埋め込みと、事実的コンテンツのためのドキュメント埋め込みを用い、HotpotQA において 86.89% の recall@1 を達成し、先行手法を著しく上回り、解釈可能な証拠選択を提供する。

ABSTRACT

Collecting supporting evidence from large corpora of text (e.g., Wikipedia) is of great challenge for open-domain Question Answering (QA). Especially, for multi-hop open-domain QA, scattered evidence pieces are required to be gathered together to support the answer extraction. In this paper, we propose a new retrieval target, hop, to collect the hidden reasoning evidence from Wikipedia for complex question answering. Specifically, the hop in this paper is defined as the combination of a hyperlink and the corresponding outbound link document. The hyperlink is encoded as the mention embedding which models the structured knowledge of how the outbound link entity is mentioned in the textual context, and the corresponding outbound link document is encoded as the document embedding representing the unstructured knowledge within it. Accordingly, we build HopRetriever which retrieves hops over Wikipedia to answer complex questions. Experiments on the HotpotQA dataset demonstrate that HopRetriever outperforms previously published evidence retrieval methods by large margins. Moreover, our approach also yields quantifiable interpretations of the evidence collection process.

研究の動機と目的

  • 複雑なオープンドメイン質問に対する回答のため、散在するマルチホップの証拠を Wikipedia から収集する課題に対処すること。
  • ハイパーリンクによる暗黙のエンティティ関係(構造的知識)と、エンティティ紹介ページ内の事実的コンテンツ(非構造的知識)を統合し、より良い証拠リtrievalを実現すること。
  • 質問の文脈に基づいて、構造的知識と非構造的知識の寄与度を動的に重み付けることができるリtrievalメカニズムを開発すること。
  • 各ホップ選択におけるメンション埋め込みとドキュメント埋め込みの相対的重要性を分析することで、解釈可能な証拠パスを提供すること。

提案手法

  • ホップを、ハイパーリンク(メンション)とその対応するアウトバウンドリンク先ドキュメントの組み合わせとして定義し、関係的証拠と事実的証拠の両方を表す。
  • BERT を用いてハイパーリンクの周囲の文脈をエンコードし、メンション埋め込みを生成することで、暗黙のエンティティ関係を捉える。
  • 質問を条件として、アウトバウンドドキュメントの全文を BERT でエンコードし、非構造的事実のためのドキュメント埋め込みを生成する。
  • 学習可能な重みを用いてメンション埋め込みとドキュメント埋め込みを統合し、リtrieval用の統一されたホップ表現を生成する。
  • 関連する文レベルの証拠に焦点を当てることでリtrievalを向上させるため、補助的なサポート文予測タスクを導入する。
  • 学習可能なパラメータを備えた重み付き統合メカニズムを適用し、リtrieバル中に構造的知識と非構造的知識の影響をバランスさせる。

実験結果

リサーチクエスチョン

  • RQ1構造的なハイパーリンク関係と非構造的なドキュメントコンテンツを統合することで、Wikipedia におけるマルチホップ証拠リtrievalが向上するか?
  • RQ2明示的な知識グラフに依存せずに、メンション埋め込みが暗黙のエンティティ関係をどの程度正確に捉えられるか?
  • RQ3構造的知識と非構造的知識を統合することで、単一モダリティに依存する手法と比較して、リtrieバル性能がどの程度向上するか?
  • RQ4モデルの注目重みが、各ホップ選択においてどのタイプの知識(関係か事実か)が支配的であるかを解釈可能なインサイトとして提供できるか?

主な発見

  • HopRetriever は HotpotQA テストセットで 86.89% の recall@1 を達成し、以前に発表された証拠リtrieバル手法を著しく上回る。
  • 構造的知識(メンション埋め込みによるもの)を除去すると、recall@1 は 76.35% に低下し、マルチホップ推論においてエンティティ関係が果たす重要な役割を示している。
  • モデルの注目重みは文脈に応じてメンション埋め込みとドキュメント埋め込みの間で動的にシフトし、プロービングタスクで正しいホップと迷惑なホップを 96.42% の正確さで区別している。
  • アブレーションスタディの結果、重み付き統合メカニズムは等重み統合よりも性能が向上しており、補助的な文予測タスクはリtrieバルに悪影響を及ぼさないことが判明した。
  • 曖昧な関係(同じ関係を持つ複数のエンティティ)がある状況では、モデルが正しいホップを選択するためにドキュメント埋め込みにより依存しており、たとえば「第一次世界大戦」と「第二次世界大戦」のケースでその傾向が顕著に現れている。
  • 各埋め込みタイプの寄与度を可視化することで、証拠パスを解釈可能に提供し、各ホップ選択を支配する知識源を分析可能にしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。