Skip to main content
QUICK REVIEW

[論文レビュー] Natural Language Inference in Context -- Investigating Contextual Reasoning over Long Texts

Hanmeng Liu, Leyang Cui|arXiv (Cornell University)|Nov 10, 2020
Topic Modeling参考文献 42被引用数 4
ひとこと要約

本稿では、警察採用試験の専門家が設計した口頭推論試験をもとに作成された、段落レベルの自然言語推論(NLI)データセットConTRoLを紹介する。本データセットは、論理的推論、複数ステップ推論、共参照的推論といった複雑な文脈的推論を強調している。BERT や BART といった最先端モデルですら共参照的推論では約75%の精度にとどまり、論理的および複数ステップ推論では顕著に性能が低下し、モデルと人的な性能の大きな格差が明らかになった。これは、文脈的推論評価において本データセットの挑戦性を示している。

ABSTRACT

Natural language inference (NLI) is a fundamental NLP task, investigating the entailment relationship between two texts. Popular NLI datasets present the task at sentence-level. While adequate for testing semantic representations, they fall short for testing contextual reasoning over long texts, which is a natural part of the human inference process. We introduce ConTRoL, a new dataset for ConTextual Reasoning over Long texts. Consisting of 8,325 expert-designed "context-hypothesis" pairs with gold labels, ConTRoL is a passage-level NLI dataset with a focus on complex contextual reasoning types such as logical reasoning. It is derived from competitive selection and recruitment test (verbal reasoning test) for police recruitment, with expert level quality. Compared with previous NLI benchmarks, the materials in ConTRoL are much more challenging, involving a range of reasoning types. Empirical results show that state-of-the-art language models perform by far worse than educated humans. Our dataset can also serve as a testing-set for downstream tasks like Checking Factual Correctness of Summaries.

研究の動機と目的

  • 文書レベルのNLIベンチマークが、文単位の帰結を超えた複雑な文脈的推論を評価するのを補完するという欠如を解消すること。
  • 論理的、複数ステップ、分析的推論といった推論タイプを捉える高品質で専門家がアノテートしたデータセットを構築すること。
  • 現在の最先端言語モデルが、長く文脈が豊富な文章を処理する際の限界を評価すること。
  • 要約の事実的正しさ評価などの下流タスクの信頼できるベンチマークを提供すること。

提案手法

  • ConTRoLデータセットは、実際の競争的選抜および採用試験の文章から構築されており、専門家レベルの品質と複雑さを保証している。
  • 各インスタンスは、8〜15文からなる文脈的文章と仮説から構成され、帰結、矛盾、中立の関係を示すゴールドスタンダードラベルが付与されている。
  • 論理的帰結や複数ステップ推論を含む、複数の文にまたがる複数の事実の統合を要する推論タイプに重点を置いている。
  • モデルはConTRoLで微調整され、ゼロショットおよびフェイントショット設定での評価を通じて汎化性と転移性を評価している。
  • アブレーションスタディでは、文脈または仮説をマスキングすることで、アノテーションのアーチファクトやモデルバイアスの有無をテストしている。
  • BERT、BART、Longformer などのモデルを比較し、5つの推論タイプにわたる分析を行っている。

実験結果

リサーチクエスチョン

  • RQ1最先端NLPモデルは、複雑な文脈的推論を要する段落レベルの自然言語推論をうまく処理できるか?
  • RQ2人間の性能と比較して、論理的、複数ステップ、共参照的推論といった推論タイプにおけるモデルの性能はどの程度か?
  • RQ3アノテーションのアーチファクトや仮説のみに依存するバイアスが、ConTRoLデータセットにおけるモデル予測にどの程度影響を及えるか?
  • RQ4ConTRoLで微調整することで、既存のNLIベンチマーク(例:MultiNLI や SNLI)からの転移学習に比べ、下流の推論タスクでの性能が向上するか?
  • RQ5異なるモデルアーキテクチャ(例:BERT、BART、Longformer)は、長文の文脈的推論と情報統合をどの程度うまく処理できるか?

主な発見

  • BERT と BART は、それぞれ共参照的推論で74.64%および74.92%の精度にとどまり、強い性能を示すが、人間レベルには達していない。
  • 論理的および複数ステップ推論では顕著に性能が低下し、BART ではそれぞれ48.75%および47.89%の精度にとどまり、モデルの限界が顕著に現れた。
  • 人間の性能はモデルの性能を著しく上回っており、文脈的推論能力における大きな格差が確認された。
  • アブレーションスタディの結果、モデルは正確な予測のために文脈と仮説の両方が必要であり、仮説のみでの精度は36.07%(BERT)にとどまり、最小限のアノテーションバイアスが示された。
  • 既存のNLIベンチマーク(例:MultiNLI や SNLI)からの転移学習では、ゼロショット性能が著しく低かった(例:BART-NLI で45.0%)、これはConTRoLと既存データセットとの間で分布の違いがあることを示唆した。
  • Longformer は、文脈のみおよび仮説のみのアブレーションにおいても、BERT や BART を上回る性能を示し、より優れた長文文脈モデリング能力を有していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。