Skip to main content
QUICK REVIEW

[論文レビュー] Analyzing Compositionality-Sensitivity of NLI Models

Yixin Nie, Yicheng Wang|arXiv (Cornell University)|Nov 16, 2018
Topic Modeling参考文献 20被引用数 8
ひとこと要約

本稿では、自然言語推論(NLI)モデルの語彙的特徴を超えた推論能力を評価するための構成的敏感性テストの設定を提案する。bag-of-wordsモデルが誤ったラベルを高確率で予測する例を選定することで、構成的理解を隔離し、最先端のモデルでさえ、構成的意味論を一貫して使用できていないことが明らかになった。モデルの性能はアーキテクチャによって顕著に異なる(例:木構造モデルはRNNベースやbag-of-wordsモデルを上回る)。

ABSTRACT

Success in natural language inference (NLI) should require a model to understand both lexical and compositional semantics. However, through adversarial evaluation, we find that several state-of-the-art models with diverse architectures are over-relying on the former and fail to use the latter. Further, this compositionality unawareness is not reflected via standard evaluation on current datasets. We show that removing RNNs in existing models or shuffling input words during training does not induce large performance loss despite the explicit removal of compositional information. Therefore, we propose a compositionality-sensitivity testing setup that analyzes models on natural examples from existing datasets that cannot be solved via lexical features alone (i.e., on which a bag-of-words model gives a high probability to one wrong label), hence revealing the models' actual compositionality awareness. We show that this setup not only highlights the limited compositional ability of current NLI models, but also differentiates model performance based on design, e.g., separating shallow bag-of-words models from deeper, linguistically-grounded tree-based models. Our evaluation setup is an important analysis tool: complementing currently existing adversarial and linguistically driven diagnostic evaluations, and exposing opportunities for future work on evaluating models' compositional understanding.

研究の動機と目的

  • 標準ベンチマークで高い性能を示すにもかかわらず、最先端のNLIモデルに限局的構成理解が不足していることを暴露すること。
  • 標準的評価と既存の敵対的設定が、モデルの語彙的特徴への過剰依存を検出できないことを示すこと。
  • 既存データセットからの自然な例を用いて、構成的推論を隔離する、堅牢で一般化可能な評価手法を開発すること。
  • 特に文法的および構成的構造への感受性の観点から、アーキテクチャ設計によるモデル性能の差を特定すること。
  • 特定の文脈的現象や敵対的摂動に焦点を当てた既存の診断評価を補完し、構成的意味論に焦点を当てること。

提案手法

  • bag-of-wordsモデルが誤ったラベルに高い確率を割り当てるSNLIおよびMNLIの例を特定し、正しく分類するには構成的構造が必要であることを示す。
  • これらの例を構成的敏感性(CS)評価セットとして用い、モデルの構成的意味論の活用能力をテストする。
  • RNNを全結合層に置き換えるなど、アーキテクチャを変更したモデルを訓練・評価し、構成的認識の有無を評価する。
  • 標準ベンチマーク(SNLI/MNLI)とCS評価セットでのモデル性能を比較し、構成的構造への感受性を測定する。
  • LMS(語彙的に誤解を招くスコア)指標を用いて、語彙的特徴のみでbag-of-wordsモデルを誤導する例をフィルタリングする。
  • 敵対的評価を適用し、ある種の構成的摂動に対して成功しても、他の摂動には一般化できないことを示し、特定のパターンへの過適合を示す。

実験結果

リサーチクエスチョン

  • RQ1最先端のNLIモデルは、どの程度語彙的特徴に依存しているのか、構成的意味論に依存していないのか?
  • RQ2標準的評価と既存の敵対的設定は、モデルの構成的理解の欠如を信頼性高く検出できるのか?
  • RQ3アーキテクチャ(例:RNN、木構造、全結合)が構成的構造への感受性に与える影響は何か?
  • RQ4既存のNLIデータセットのフィルタリングされたサブセットを用いて、構成的推論のための堅牢で汎用的な評価を構築できるか?
  • RQ5言語的診断データセットでの成功は、真の構成的理解を示すものなのか、それともモデルが語彙的ショートカットを活用しているだけなのか?

主な発見

  • 7つの最先端NLIモデルは、標準のSNLIおよびMNLIベンチマークで高い性能を示すが、構成的敏感性(CS)テストでは失敗しており、構成的理解が乏しいことが示された。
  • RNNを切断したモデルや、語のシャッフルを施した訓練データを用いたモデルでも、標準ベンチマークでは高い性能を達成しており、標準評価が構成的アクセスの喪失を検出できないことを証明している。
  • bag-of-words型モデルは、順序付きまたは木構造モデルよりもCSテストで顕著に低い性能を示しており、アーキテクチャ設計と構成的感受性の相関が明確に示された。
  • CS評価セットは、モデルの構成的意味論処理能力に基づいてモデルを効果的に区別でき、木構造モデルがRNNベースや全結合モデルを上回った。
  • 敵対的評価は範囲が限定的であり、一般化できない:ある種の敵対的例で成功しても、他の構成的摂動には耐えられないことが示された。
  • LMSスコアは、語彙的特徴のみでbag-of-wordsモデルを誤導する例を効果的に特定でき、構成的推論の対象となるテストを可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。