Skip to main content
QUICK REVIEW

[論文レビュー] KQA Pro: A Large-Scale Dataset with Interpretable Programs and Accurate SPARQLs for Complex Question Answering over Knowledge Base

Jiaxin Shi, Shulin Cao|arXiv (Cornell University)|Jul 8, 2020
Topic Modeling参考文献 53被引用数 5
ひとこと要約

KQA Pro は、知識ベース上の120K件の複雑な質問を含む大規模で多様なデータセットを提供し、解釈可能な推論プログラムと正確な SPARQL クエリをアノテートしています。このデータセットにより、NLQ から SPARQL または NLQ からプログラムへの監視を用いた学習で、状態の最良のモデルが KBQA で約90%の正確性を達成でき、QA 僅どのベースラインを著しく上回り、人間の専門家水準に近づいています。

ABSTRACT

Complex question answering over knowledge base (Complex KBQA) is challenging because it requires various compositional reasoning capabilities, such as multi-hop inference, attribute comparison, set operation, and etc. Existing benchmarks have some shortcomings that limit the development of Complex KBQA: 1) they only provide QA pairs without explicit reasoning processes; 2) questions are either generated by templates, leading to poor diversity, or on a small scale. To this end, we introduce KQA Pro, a large-scale dataset for Complex KBQA. We define a compositional and highly-interpretable formal format, named Program, to represent the reasoning process of complex questions. We propose compositional strategies to generate questions, corresponding SPARQLs, and Programs with a small number of templates, and then paraphrase the generated questions to natural language questions (NLQ) by crowdsourcing, giving rise to around 120K diverse instances. SPARQL and Program depict two complementary solutions to answer complex questions, which can benefit a large spectrum of QA methods. Besides the QA task, KQA Pro can also serves for the semantic parsing task. As far as we know, it is currently the largest corpus of NLQ-to-SPARQL and NLQ-to-Program. We conduct extensive experiments to evaluate whether machines can learn to answer our complex questions in different cases, that is, with only QA supervision or with intermediate SPARQL/Program supervision. We find that state-of-the-art KBQA methods learnt from only QA pairs perform very poor on our dataset, implying our questions are more challenging than previous datasets. However, pretrained models learnt from our NLQ-to-SPARQL and NLQ-to-Program annotations surprisingly achieve about 90\% answering accuracy, which is even close to the human expert performance...

研究の動機と目的

  • 複雑な知識ベース質問応答(KBQA)のための大規模で多様かつ解釈可能なデータセットの不足を解消すること。
  • 推論トレースがなく、テンプレート生成による低多様性の質問を用いる既存のベンチマークの限界を克服すること。
  • KBQAにおける複数の学習パラダイムを支援するため、SPARQL と正式なプログラムの両方のアノテーションを提供すること。
  • QA 僅どの監視と中間監視(SPARQL/プログラム)の両方の設定でのモデル評価を可能にすること。
  • 現在のモデルを挑戦し、意味解析と構成的推論研究を支援するベンチマークの構築

提案手法

  • 複雑な質問のための段階的推論を表現するための、構成的で解釈可能な正式言語「Program」を定義すること。
  • 少数のテンプレートと構成的戦略を組み合わせて、多様な質問、SPARQL、およびプログラムを生成すること。
  • クラウドソーシングを用いて生成された質問を自然言語に言い換え直し、言語的多様性と流暢さを保証すること。
  • SPARQL とプログラムのアノテーションが正確で補完的であることを確認し、QA タスクと意味解析タスクの両方を支援すること。
  • NLQ から SPARQL および NLQ からプログラムへのアノテーションを事前学習に活用し、モデルの一般化と推論正確性を向上させること。
  • QA 僅どの監視と中間監視の両方のレジームをサポートできるようにデータセットを設計すること。

実験結果

リサーチクエスチョン

  • RQ1KQA Pro のような大規模で多様かつ挑戦的なデータセットにさらされた場合、QA ペair 僅どの学習でモデルが複雑な KBQA に一般化できるか。
  • RQ2NLQ から SPARQL やプログラムへの中間監視が、QA 僅どの監視と比較して、KBQA のパフォーマンスをどの程度向上させるか。
  • RQ3解釈可能な推論プログラムの導入が、複雑な推論タスクにおけるモデルの解釈可能性とパフォーマンスに与える影響は。
  • RQ4質問の多様性、推論の複雑さ、モデルのパフォーマンスの観点から、KQA Pro は既存のベンチマークとどのように比較されるか。
  • RQ5事前学習モデルが NLQ から SPARQL および NLQ からプログラムへのアノテーションで微調整された場合、近い人間の専門家水準のパフォーマンスを達成できるか。

主な発見

  • QA ペアでのみ学習した最先端の KBQA モデルは、KQA Pro では性能を発揮できず、このデータセットが過去のベンチマークよりも複雑であることが示された。
  • NLQ から SPARQL へのアノテーションで微調整した事前学習モデルは、約90%の回答正確性を達成し、人間の専門家水準に近づいた。
  • NLQ からプログラムへの監視で学習したモデルも高い正確性を達成しており、解釈可能な推論監視の価値が裏付けられた。
  • SPARQL とプログラムの両方のアノテーションの組み合わせにより、QA 僅どの監視よりもより強固で汎用性の高い学習が可能になった。
  • データセットの多様性と構成的構造は、現在のモデルを効果的に挑戦し、より良い推論メカニズムの必要性を浮き彫りにした。
  • KQA Pro は、NLQ から SPARQL および NLQ からプログラムへのマッピングのための最大規模の既知のコーパスであり、複雑な KBQA 研究における新しいベンチマークを設定した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。