Skip to main content
QUICK REVIEW

[論文レビュー] Investigating Biases in Textual Entailment Datasets

Shawn Tan, Yikang Shen|arXiv (Cornell University)|Jun 23, 2019
Multimodal Machine Learning Applications参考文献 14被引用数 5
ひとこと要約

本稿は、SNLIおよびMultiNLIの自然言語推論データセットにおけるラベルバイアスを調査し、モデルが仮説のみを用いて64%の精度を達成できることを示しており、顕著な表面的相関関係があることを示している。著者らは、仮説-ラベル相関を低減するためのグリーディなビグラムベースのプルーニング手法を提案しており、これによりトレーニングデータのすり抜けるようなパターンが減少し、モデルの頑健性が向上する。

ABSTRACT

The ability to understand logical relationships between sentences is an important task in language understanding. To aid in progress for this task, researchers have collected datasets for machine learning and evaluation of current systems. However, like in the crowdsourced Visual Question Answering (VQA) task, some biases in the data inevitably occur. In our experiments, we find that performing classification on just the hypotheses on the SNLI dataset yields an accuracy of 64%. We analyze the bias extent in the SNLI and the MultiNLI dataset, discuss its implication, and propose a simple method to reduce the biases in the datasets.

研究の動機と目的

  • SNLIおよびMultiNLIデータセットに、VQAデータセットで見られるように、モデルが表面的相関関係を悪用するようなバイアスが含まれているかどうかを調査すること。
  • 最先端のRTEモデルが、真のテキスト帰納的推論ではなく、これらのバイアスに過剰に依存しているかどうかを評価すること。
  • 仮説に顕著に予測可能なビグラムが含まれるインスタンスをプルーニングすることで、トレーニングデータのバイアスを低減するシンプルでヒューリスティックな手法を提案すること。
  • このようなバイアスを除去することで、仮説のみの分類で性能が低下することを示し、表面的相関関係への依存が減少することを示すこと。
  • テストセットがトレーニングセットと分布的に異なるように、データ分割とデータセットのキュレーションを再考する必要性を提言することにより、ベンチマークの妥当性を高めること。

提案手法

  • SNLIおよびMultiNLIのデータセットに対して、RNNベースの仮説のみの分類器を訓練し、仮説のみを用いた場合の性能を測定することで、それ以上の確率を超える精度が得られることからバイアスを特定する。
  • トレーニングセットおよびテストセットの仮説に対してビグラム頻度分析を実施し、ラベル分布と強く相関するn-gramを同定する。
  • グリーディなプルーニング戦略を用いてトレーニングセットを処理し、最も予測可能なビグラムを含むインスタンスを削除することで、仮説-ラベル相関を低減する。
  • ESIMモデルを用いて、プルーニングされたデータセットを完全なRTEタスクで評価し、元のデータセットおよびランダムプルーニングベースラインと比較する。
  • プルーニングの影響を、仮説のみの分類と前提-仮説分類の両方の性能評価を通じて測定し、バイアス低減の有効性を評価する。
  • モデルアーキテクチャの変更ではなく、データ分布の変更によってバイアスの悪用を低減するというアプローチを強調する。

実験結果

リサーチクエスチョン

  • RQ1SNLIおよびMultiNLIデータセットに、モデルが仮説のみを用いてラベルを予測できるようなバイアスがどの程度含まれているか。
  • RQ2これらのバイアスは、特に性能の過剰評価を引き起こす要因となるのか、最先端のRTEモデルの評価にどのように影響を与えるか。
  • RQ3ビグラム頻度に基づくシンプルな、データ駆動型のプルーニング手法が、RTE全体の性能に悪影響を及げることなく、仮説-ラベル相関を低減できるか。
  • RQ4仮説レベルのバイアスを低減することで、表面的パターンではなく前提-仮説の推論に依存するより頑健なモデルが得られるか。
  • RQ5トレーニングセットとテストセットの分布的類似性が、NLI分野におけるベンチマーク評価の妥当性にどのような影響を及えるか。

主な発見

  • 仮説のみの分類器は、SNLIのテストセットで64%の精度を達成しており、これは偶然より顕著に高い結果であり、仮説とラベルの間の強い表面的相関関係があることを示している。
  • MultiNLIでは、仮説のみの分類器が不一致開発セットで51%の精度を達成しており、SNLIほど表面的バイアスが少ないことが示唆されている。
  • 提案されたグリーディなプルーニング手法により、SNLIの仮説のみの精度は64%から56%に低下し、表面的相関関係の効果的な緩和が確認された。
  • テストセット性能が3%低下したものの、プルーニングされたデータセットでは仮説のみの精度が低下しており、微小特徴の悪用が減少していることが示された。
  • ランダムプルーニングベースラインは、RTE性能は同程度であったが、仮説のみの精度は低く、これは予測可能な特徴の削除によるものであり、単にデータサイズの変化によるものではないことを確認した。
  • 結果から、現在の最先端モデルのスコアは、真の帰納的推論ではなく表面的パターンへの依存によって過剰に評価されている可能性があると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。