Skip to main content
QUICK REVIEW

[論文レビュー] Training a Ranking Function for Open-Domain Question Answering

Phu Mon Htut, Samuel R. Bowman|arXiv (Cornell University)|Apr 12, 2018
Topic Modeling参考文献 8被引用数 6
ひとこと要約

本稿では、オープンドメイン質問応答のための2つのニューラルネットワークランカーを提案する:1つは意味的類似度に基づく(InferSent)、もう1つは語レベルの関連性マッチングに基づく(Relation-Networks)。意味的類似度ランカーは全体的なQAパフォーマンスを顕著に向上させ、ベースライン比で11.6%の向上を達成した。一方、関連性マッチングランカーは高いリtrieval再現率を達成したが、質問との意味的整合性が低いことから、下流のQA精度は悪化した。

ABSTRACT

In recent years, there have been amazing advances in deep learning methods for machine reading. In machine reading, the machine reader has to extract the answer from the given ground truth paragraph. Recently, the state-of-the-art machine reading models achieve human level performance in SQuAD which is a reading comprehension-style question answering (QA) task. The success of machine reading has inspired researchers to combine information retrieval with machine reading to tackle open-domain QA. However, these systems perform poorly compared to reading comprehension-style QA because it is difficult to retrieve the pieces of paragraphs that contain the answer to the question. In this study, we propose two neural network rankers that assign scores to different passages based on their likelihood of containing the answer to a given question. Additionally, we analyze the relative importance of semantic similarity and word level relevance matching in open-domain QA.

研究の動機と目的

  • 検索エンジンが取得したドキュメントを再ランク付けするニューラルランク関数を用いて、オープンドメインQAのパフォーマンスを向上させること。
  • オープンドメインQAにおける意味的類似度と語レベルの関連性マッチングの相対的な重要性を調査すること。
  • ニューラルランカーが、オープンドメイン環境下での機械読解モデルのパフォーマンスを向上させられるかどうかを評価すること。
  • 高リtrieval再現率のモデルが、意味的整合性の欠如によりエンドツーエンドQAで性能を発揮できない理由を分析すること。

提案手法

  • 全質問とドキュメントを固定サイズの分散表現(InferSent)で符号化する意味的類似度に基づくランカーを提案する。
  • 質問とドキュメントの語同士の局所的相互作用を計算する関係ネットワーク(Relation-Networks)に基づく語レベルの関連性マッチングランカーを開発する。
  • 両ランカーをQUASAR-Tデータセットで学習し、与えられた質問に対するドキュメントの関連性スコアを算出する。
  • 各ランカーの上位スコアのドキュメントをDrQAパイプラインに統合し、ニューラルマシンリーダー(BiDAF)と組み合わせる。
  • エンドツーエンドQAパフォーマンスを評価するために、正確一致(EM)とF1スコアを用いる。
  • ランカー間でのリtrieval再現率(正解がトップ-Nドキュメントに含まれる割合)を比較する。

実験結果

リサーチクエスチョン

  • RQ1分散表現における意味的類似度は、語レベルのマッチングと比較して、オープンドメインQAパフォーマンスを向上させるか?
  • RQ2語レベルの関連性マッチングは、オープンドメインQAにおけるリtrieval再現率をどの程度向上させるか?
  • RQ3高再現率のリtrievalモデルが、正解を含むドキュメントを取得しても、なぜ全体的なQA精度が向上しないのか?
  • RQ4意味的類似度と局所的な語マッチングを組み合わせたハイブリッドランキングモデルは、より良い全体的なQAパフォーマンスを達成できるか?

主な発見

  • 意味的類似度に依存するInferSentベースのランカーは、ベースラインDrQAシステム比で11.6%のQAパフォーマンス向上を達成した。
  • Relation-Networksランカーは、InferSent(56.7%)およびベースライン(54.5%)を上回る顕著な高いリtrieval再現率(トップ10で70.3%)を達成した。これは優れたリtrieval能力を示している。
  • 高い再現率にもかかわらず、Relation-NetworksランカーはQAパフォーマンスが低く(EM: 26.0%)なった。これは、取得されたドキュメントが質問と意味的に整合性を持たないことが要因である。
  • InferSentランカーは、DrQAと組み合わせた際、EMスコア31.2%、F1スコア37.6%を達成し、いくつかの先行最先端モデルを上回った。
  • 本研究では、語レベルのマッチングに比べて、意味的類似度が全体的なQAパフォーマンス向上に寄与することがより顕著であることが判明した。
  • Relation-Networksランカーは、質問と意味的関連性のないドキュメントに対しても高いスコアを付与することがあり、これは共起パターンを学習している可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。