Skip to main content
QUICK REVIEW

[論文レビュー] Complex Sequential Question Answering: Towards Learning to Converse Over Linked Question Answer Pairs with a Knowledge Graph

Amrita Saha, Vardaan Pahuja|arXiv (Cornell University)|Jan 31, 2018
Topic Modeling被引用数 22
ひとこと要約

本論文は、大規模な知識グラフ上の事実QAとマルチターン対話システムを統合する新しいタスク、Complex Sequential Question Answering (CSQA) を紹介する。著者らは、論理的・数量的・比較的推論を要する複雑な質問を含む、20万件の対話と160万件の会話回数を有する大規模なデータセットを提示した。最新のモデルを用いても性能は不十分にとどまり、会話的文脈に依存する推論を要するQAにおける現在のアプローチの重大なギャップを浮き彫りにしている。

ABSTRACT

While conversing with chatbots, humans typically tend to ask many questions, a significant portion of which can be answered by referring to large-scale knowledge graphs (KG). While Question Answering (QA) and dialog systems have been studied independently, there is a need to study them closely to evaluate such real-world scenarios faced by bots involving both these tasks. Towards this end, we introduce the task of Complex Sequential QA which combines the two tasks of (i) answering factual questions through complex inferencing over a realistic-sized KG of millions of entities, and (ii) learning to converse through a series of coherently linked QA pairs. Through a labor intensive semi-automatic process, involving in-house and crowdsourced workers, we created a dataset containing around 200K dialogs with a total of 1.6M turns. Further, unlike existing large scale QA datasets which contain simple questions that can be answered from a single tuple, the questions in our dialogs require a larger subgraph of the KG. Specifically, our dataset has questions which require logical, quantitative, and comparative reasoning as well as their combinations. This calls for models which can: (i) parse complex natural language questions, (ii) use conversation context to resolve coreferences and ellipsis in utterances, (iii) ask for clarifications for ambiguous queries, and finally (iv) retrieve relevant subgraphs of the KG to answer such questions. However, our experiments with a combination of state of the art dialog and QA models show that they clearly do not achieve the above objectives and are inadequate for dealing with such complex real world settings. We believe that this new dataset coupled with the limitations of existing models as reported in this paper should encourage further research in Complex Sequential QA.

研究の動機と目的

  • 大規模な知識グラフ上で文脈依存の複雑な質問を繰り返し行うユーザーのリアルワールドのチャットボットシナリオに対処すること。
  • 孤立したQAと対話システムの間のギャップを埋めるために、新しいタスク「Complex Sequential QA (CSQA)」を導入すること。
  • 知識グラフ上で複雑な推論を伴う20万件のマルチターン対話と160万件の会話回数を含む大規模で高品質なデータセットを構築すること。
  • 現在のモデルが複雑で文脈に依存するQAを処理する際の主な課題、例えば推論、共参照解消、メモリ効率性について、同定および分析すること。

提案手法

  • データセットは、社内およびクラウドソーシングによるアノテーターを用いた、部分的に自動化された人的作業を伴うプロセスにより構築された。これにより、整合性がありリンクされたQA対話が生成された。
  • 質問は、大規模な知識グラフ(WikiData, 14-Nov-2016ダンプ)上で、論理的・数量的・比較的推論、またはその組み合わせを要するように設計された。
  • 最新の対話(HRED)とQAアーキテクチャを統合したハイブリッドモデルが提案された。関連する部分グラフ情報を格納・取得するためのキーバリュー記憶ネットワークが導入された。
  • 候補生成ステップではn-gramマッチングに基づくアプローチが採用されたが、これは言い換えやエンティティの同義語による影響を受けて、最適でないことが示された。
  • 共参照や省略の解釈が不確実な場合に、ユーザーに確認を求める明確化メカニズムがシステムに組み込まれた。
  • メモリの構成はフラットなキーバリューネットワークとしてモデル化されたが、10万件を超えるタプルを必要とする複雑な質問に対しては、これがボトルネックであると同定された。

実験結果

リサーチクエスチョン

  • RQ1既存の最先端モデルは、文脈依存性のある大規模知識グラフ上での複雑なマルチターンQAを効果的に処理できるか?
  • RQ2論理的・数量的・比較的推論を要する質問に対するモデルの性能は、単純な事実質問と比べてどの程度異なるか?
  • RQ3現在のモデルは、会話的QAにおける共参照、省略、曖昧さをどの程度適切に処理できるか?
  • RQ4大規模な部分グラフを格納・取得する際、現在のメモリ拡張ネットワークのスケーラビリティと効率性にどのような限界があるか?
  • RQ5複雑なQAにおいて、エンティティおよび関係の言い換えを処理するため、候補生成をどのように改善できるか?

主な発見

  • HREDとQAコンponentを統合したハイブリッドモデルは、CSQAタスクにおいて著しく性能を発揮せず、現在のアーキテクチャに根本的な制限があることを示している。
  • 間接的または不完全な質問(例:省略や共参照を含む)では性能が急激に低下し、HREDが文脈をモデル化しているにもかかわらず、文脈に依存する推論が不十分であることが示された。
  • n-gramマッチングによる候補生成は、エンティティや関係の言い換え(例:'Leo' と 'Leonardo')の影響を受けて低リCALLを引き起こし、モデルの有効性を低下させている。
  • 15%以上の質問が10万件を超える候補タプルを必要としており、フラットなキーバリュー記憶ネットワークでは処理が困難となり、GPUメモリと計算上のボトルネックを引き起こしている。
  • 曖昧な質問の明確化に失敗し、必要な曖昧性解消を促すプロンプトを出せないことが多く、誤った回答を導く傾向がある。
  • データセットは、現在のモデルが推論タイプ(論理的・数量的・比較的)の間で一般化できていないことを明らかにした。特に、複数のターンおよび複数のエンティティをまたがる推論では顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。