Skip to main content
QUICK REVIEW

[論文レビュー] GNN is a Counter? Revisiting GNN for Question Answering

Kuan Wang, Yuyu Zhang|arXiv (Cornell University)|Oct 7, 2021
Topic Modeling参考文献 64被引用数 12
ひとこと要約

本稿では、知識グラフ上でエッジ/ノードのソフトカウントを実行する、1次元の隠れ状態のみを有する最小限のグラフニューラルネットワーク(GNN)であるGraph Soft Counter(GSC)を提案する。最新のGNNと比較して1%未塔のパラメータしか持たないにもかかわらず、CommonsenseQAおよびOpenBookQAの両ベンチマークで優れた性能を示し、既存の複雑なGNNモジュールが単に単純なカウントを実行している可能性を示している。

ABSTRACT

Question Answering (QA) has been a long-standing research topic in AI and NLP fields, and a wealth of studies have been conducted to attempt to equip QA systems with human-level reasoning capability. To approximate the complicated human reasoning process, state-of-the-art QA systems commonly use pre-trained language models (LMs) to access knowledge encoded in LMs together with elaborately designed modules based on Graph Neural Networks (GNNs) to perform reasoning over knowledge graphs (KGs). However, many problems remain open regarding the reasoning functionality of these GNN-based modules. Can these GNN-based modules really perform a complex reasoning process? Are they under- or over-complicated for QA? To open the black box of GNN and investigate these problems, we dissect state-of-the-art GNN modules for QA and analyze their reasoning capability. We discover that even a very simple graph neural counter can outperform all the existing GNN modules on CommonsenseQA and OpenBookQA, two popular QA benchmark datasets which heavily rely on knowledge-aware reasoning. Our work reveals that existing knowledge-aware GNN modules may only carry out some simple reasoning such as counting. It remains a challenging open problem to build comprehensive reasoning modules for knowledge-powered QA.

研究の動機と目的

  • 知識認識QAにおける複雑なGNNモジュールが本当に高度な推論を実行しているのか、それとも単純な操作に限定されているのかを調査すること。
  • アーキテクチャ的要因の分析を通じて、最先端のGNNベースQAシステムの実際の推論能力を診断すること。
  • 既存のGNNモジュールが過剰にパラメータ化されているかどうか、およびより単純なモデルが優れた性能を達成できるかどうかを特定すること。
  • QAに必要な推論機能を捉える最小限で解釈可能かつ効率的な推論モジュールを設計すること。

提案手法

  • 個々のGNN層および初期ノード埋め込みの寄与度を評価するための診断ツールとして、スパース変分ドロップアウト(SparseVD)を適用する。
  • 知識グラフ内のエッジおよびノードに対してソフトカウントを実行する、1次元の隠れ状態を有するGNNであるGraph Soft Counter(GSC)を設計する。
  • 事前学習済みのKG埋め込みや追加のノードスコアリング機構を一切使用せず、エッジおよびノード特徴量のみを用いる。
  • GSCの性能と比較するためのベースラインとして、2層のMLPにハードエッジカウント特徴量を入力するモデルを採用する。
  • 各層におけるソフトカウント値の可視化により、モデルの挙動をトレース可能に保つことで解釈可能性を確保する。
  • CommonsenseQAおよびOpenBookQAにおいて、最新のGNN(例:QA-GNN、MHGRN、KagNet)とGSCをベンチマーク比較する。

実験結果

リサーチクエスチョン

  • RQ1知識認識QAシステムにおける既存のGNNモジュールは、本当に複雑な推論を実行しているのか、それとも単純な操作に限定されているのか?
  • RQ2個々のGNN層および初期ノード埋め込みが推論性能に果たす実際の寄与度は何か?
  • RQ3GSCのような最小限でパラメータ効率の良いモデルが、QAにおいて複雑なGNNアーキテクチャを上回ることができるか?
  • RQ4エッジカウントは、知識を活用したQAにおける推論プロセスにどの程度寄与しているか?

主な発見

  • 最新のGNNの1%未塔のパラメータしか持たないGSCは、CommonsenseQAおよびOpenBookQAの両方でそれらを上回る性能を示した。
  • CommonsenseQAでは、GSCが78.78%の精度を達成し、QA-GNN(78.32%)およびMHGRN(73.89%)を上回ったが、その構造的単純さにもかかわらずである。
  • SparseVD分析により、多くのGNN層および初期ノード埋め込みが不要であることが判明し、過剰パラメータ化の兆候が示された。
  • 2層のMLPにハードエッジカウント特徴量を入力するモデルは、GSCと同等の性能を示し、一部のGNNベースラインをも上回った。
  • GSCにおけるソフトカウント値は非常に解釈可能であり、モデルが各選択肢のスコアをどのように算出しているかを直接トレース可能である。
  • モデルの性能順位(GSC > QA-GNN > MHGRN > RoBERTa)は、エッジオーバーラップ率の順位とよく一致しており、カウントに焦点を当てた類似した推論行動が共通していることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。