Skip to main content
QUICK REVIEW

[論文レビュー] Knowledge-driven Data Construction for Zero-shot Evaluation in Commonsense Question Answering

Kaixin Ma, Filip Ilievski|arXiv (Cornell University)|Nov 7, 2020
Topic Modeling参考文献 44被引用数 9
ひとこと要約

本稿では、多様な知識グラフ(例:ConceptNet、ATOMIC)を活用して事前学習用言語モデルのための合成的常識的質問を生成する神経的記号的フレームワークを提案する。このフレームワークにより、5つのベンチマークタスクにわたる強力なゼロショット転移が可能となる。主な貢献は、構造的な質問生成とマージナルランク学習を組み合わせた複数の知識ソースの統合が、知識がタスク固有の推論要件とよく一致する場合に特に顕著な性能向上をもたらすことを示したことである。

ABSTRACT

Recent developments in pre-trained neural language modeling have led to leaps in accuracy on commonsense question-answering benchmarks. However, there is increasing concern that models overfit to specific tasks, without learning to utilize external knowledge or perform general semantic reasoning. In contrast, zero-shot evaluations have shown promise as a more robust measure of a model's general reasoning abilities. In this paper, we propose a novel neuro-symbolic framework for zero-shot question answering across commonsense tasks. Guided by a set of hypotheses, the framework studies how to transform various pre-existing knowledge resources into a form that is most effective for pre-training models. We vary the set of language models, training regimes, knowledge sources, and data generation strategies, and measure their impact across tasks. Extending on prior work, we devise and compare four constrained distractor-sampling strategies. We provide empirical results across five commonsense question-answering tasks with data generated from five external knowledge resources. We show that, while an individual knowledge graph is better suited for specific tasks, a global knowledge graph brings consistent gains across different tasks. In addition, both preserving the structure of the task as well as generating fair and informative questions help language models learn more effectively.

研究の動機と目的

  • ゼロショット常識的質問応答における知識ソース、データ生成戦略、言語モデルの相互作用についての体系的でない研究の欠如に対処すること。
  • 合成的で知識駆動のQAデータで事前学習することで、多様な常識的推論タスクにおける一般化性能が向上するかどうかを調査すること。
  • ゼロショット設定におけるモデル性能と質問品質に与える異なる誤り選択肢のサンプリング戦略の影響を評価すること。
  • 個々のグラフを使用するのと比較して、複数の知識グラフを組み合わせることでゼロショット転移性能が向上するかどうかを特定すること。
  • マージナルランク学習と標準的な言語モデル学習の有効性を、事前学習中にタスク構造をどのように保持するかを評価すること。

提案手法

  • タスク固有のテンプレートを用いて、5つの外部知識リソース(ATOMIC、ConceptNet、Wikidata、VisualGenome、CWWV)を質問-回答ペアに変換することで、複数選択式QAデータセットを合成的に構築する。
  • 4つの制約付き誤り選択肢のサンプリング戦略を実装:ランダムサンプリング、敵対的フィルタリング、ハイブリッドサンプリング(ランダム+敵対的)、意味的類似度に基づく知識認識型サンプリング。
  • GPT-2-LargeおよびRoBERTa-Largeの2つの言語モデルを、標準的な言語モデル学習とマージナルランク学習の2つの学習制御で、合成データセット上で事前学習する。
  • 5つの常識的QAベンチマーク(SocialIQA、PhysicalIQA、CommonSenseQA、aNLI、HellaSwag)におけるゼロショット性能を評価する。
  • 人間による評価を用いて、質問の公平性と情報量を評価し、自動生成されたセットに含まれる曖昧または意味のない質問などの問題を特定する。
  • 敵対的フィルタリングを適用して、誤り選択肢の妥当性を向上させ、公平性と情報量のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1知識ソースの選択が、多様な常識的推論タスクにおけるゼロショット性能にどのように影響するか?
  • RQ2異なる誤り選択肢のサンプリング戦略が、合成データ生成におけるモデルの一般化性能と質問品質に与える影響は何か?
  • RQ3複数の知識グラフを組み合わせることで、個々のグラフを使用する場合と比較して、より良いゼロショット転移性能が得られるか?
  • RQ4マージナルランク学習は、標準的な言語モデル学習と比較して、タスク構造の保持と下流タスクの性能向上にどのように寄与するか?
  • RQ5自動生成された質問はどれほど公平で情報量があり、人間が作成した質問と比較して難易度はどの程度か?

主な発見

  • 合成的で知識駆動のQAデータで言語モデルを事前学習することで、5つの常識的推論タスクにおけるゼロショット一般化性能に顕著な向上が見られた。
  • RoBERTa-Largeは全タスクでGPT-2-Largeを上回り、マージナルランク制御下でATOMICでは45.9%、CWWVでは64.5%の正答率を達成した。
  • 複数の知識ソースを組み合わせることで一貫した性能向上が得られ、特に知識がタスク要件とよく一致する場合、グローバル知識グラフが個々のグラフよりも広範な向上をもたらした。
  • マージナルランク学習は標準的な言語モデル学習を上回り、タスクの構造的整合性をよりよく保持し、ゼロショット転移正答率を向上させた。
  • 人間による評価では、生成された質問の多くがモデルより人間にとって簡単である(意図されたこと)一方で、顕著な数の質問が意味が通じないか曖昧であることが判明し、自動質問生成の品質に課題があることが示された。
  • ランダムサンプリングと敵対的サンプリングを組み合わせたハイブリッドな誤り選択肢サンプリング戦略が最も効果的であり、質問が単純化されすぎないよう、妥当性と情報量の両立を図った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。