Skip to main content
QUICK REVIEW

[論文レビュー] Robustness to Spurious Correlations in Text Classification via Automatically Generated Counterfactuals

Zhao Wang, Aron Culotta|arXiv (Cornell University)|Dec 18, 2020
Text and Document Classification Technologies参考文献 31被引用数 12
ひとこと要約

本稿では、因果的特徴の特定と反意語置換を用いて、自動的に反事実的訓練サンプルを生成する手法を提案する。因果的特徴を反意語に置き換え、ラベルを反転させたこれらの反事実的サンプルを訓練データに追加することで、元のデータの性能を維持したまま、人間が生成した反事実的テストセットにおいて12%〜25%の精度向上を達成した。これは、因果的特徴に注目し、誤った相関関係を軽視することで、一般化性能が向上したことを示している。

ABSTRACT

Spurious correlations threaten the validity of statistical classifiers. While model accuracy may appear high when the test data is from the same distribution as the training data, it can quickly degrade when the test distribution changes. For example, it has been shown that classifiers perform poorly when humans make minor modifications to change the label of an example. One solution to increase model reliability and generalizability is to identify causal associations between features and classes. In this paper, we propose to train a robust text classifier by augmenting the training data with automatically generated counterfactual data. We first identify likely causal features using a statistical matching approach. Next, we generate counterfactual samples for the original training data by substituting causal features with their antonyms and then assigning opposite labels to the counterfactual samples. Finally, we combine the original data and counterfactual data to train a robust classifier. Experiments on two classification tasks show that a traditional classifier trained on the original data does very poorly on human-generated counterfactual samples (e.g., 10%-37% drop in accuracy). However, the classifier trained on the combined data is more robust and performs well on both the original test data and the counterfactual test data (e.g., 12%-25% increase in accuracy compared with the traditional classifier). Detailed analysis shows that the robust classifier makes meaningful and trustworthy predictions by emphasizing causal features and de-emphasizing non-causal features.

研究の動機と目的

  • 分布シフトや微小な入力摂動に対してモデル性能を低下させるテキスト分類における誤った相関関係の問題に対処すること。
  • 高価な人手による反事実的サンプルに依存するのを減らし、高品質な反事実的訓練サンプルを自動生成すること。
  • データ拡張によって因果的特徴を強調し、非因果的特徴を軽視することで、モデルの耐性を向上させること。
  • 少数の人の提供する因果的特徴が、大規模な人手による反事実的サンプルと同等の耐性を達成できるかどうかを評価すること。

提案手法

  • キーワードの反意語を特定する統計的「最も近い反対語マッチング」手法を用いて、因果的特徴の可能性を同定する。
  • 因果的特徴をその反意語に置き換え、新しいサンプルに逆のラベルを割り当てることで、反事実的サンプルを生成する。
  • 元の訓練データと自動的に生成された反事実的データを組み合わせ、耐性のある分類器を学習する。
  • 組み合わせたデータセット上でL2正則化を施したロジスティック回帰を用いて、最終的な分類器を訓練する。
  • 特徴の重要度の変化を比較するために、係数分析を実施する。
  • スケーラビリティと性能のトレードオフを評価するために、限定的な人手による因果的特徴を用いたアブレーションスタディを実施する。

実験結果

リサーチクエスチョン

  • RQ1自動生成された反事実的サンプルは、分布がシフトしたデータや悪意のあるテストデータにおけるモデルの耐性を向上させることができるか?
  • RQ2耐性のある分類器の性能は、元のデータと反事実的テストセットの両方でベースライン分類器と比べてどうなるか?
  • RQ3少数の人の提供する因果的特徴を用いることで、大規模な人手による反事実的サンプルと同等の耐性を達成できるか、その程度はいかほどか?
  • RQ4因果的語と非因果的語の係数変化が、一般化性能の向上にどのように寄与するか?
  • RQ5文書長さは、因果的語の重みを増やすことと非因果的語の重みを減らすことの相対的影響にどのように影響するか?

主な発見

  • 元のデータのみで学習したベースライン分類器は、人間が生成した反事実的テストセットで10%〜37%の精度低下を示し、誤った相関関係に対して高い感受性を示していた。
  • 元のデータと自動生成された反事実的データを組み合わせて学習した耐性のある分類器は、反事実的テストセットにおいて、ベースラインと比べて12%〜25%の絶対的な精度向上を達成した。
  • 耐性のある分類器は、特徴係数の調整を通じて、因果的語(例:'awesome'、'awful')を強調し、非因果的語(例:'free'、'movie')を軽視することで、より信頼できる予測を学習した。
  • 50個の人の提供する因果的特徴のみを用いても、先行研究で得られた1,700個の人の生成した反事実的サンプルで学習したモデルと同等の性能を達成した。
  • IMDB-Lでは、因果的語の係数を増やすことが、非因果的語の係数を減らすことよりも予測の是正に大きな影響を与えたが、より小さなデータセットでは逆の傾向が見られ、文書長さが係数調整の相対的重要度に影響を与えることが示唆された。
  • 誤差解析により、耐性のある分類器が、因果的語の重みを増やし、非因果的語の影響を減らすことで、誤った特徴がモデルを誤導するケースで誤分類を是正していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。