Skip to main content
QUICK REVIEW

[論文レビュー] Identifying Spurious Correlations for Robust Text Classification

Zhao Wang, Aron Culotta|arXiv (Cornell University)|Oct 6, 2020
Topic Modeling参考文献 34被引用数 8
ひとこと要約

本稿では、因果推定手法を特徴量として用いることで、文書分類における誤った相関関係を識別する教師あり手法を提案する。限られたラベル付き例(200~300例)で訓練された単語分類器は、AUCスコアが0.66~0.82に達し、予測された誤った相関度の順に誤った語をフィルタリングすることで、分布シフトや公平性の懸念に対して耐性が向上する下流タスクにおける最悪ケース精度を向上させる。

ABSTRACT

The predictions of text classifiers are often driven by spurious correlations -- e.g., the term `Spielberg' correlates with positively reviewed movies, even though the term itself does not semantically convey a positive sentiment. In this paper, we propose a method to distinguish spurious and genuine correlations in text classification. We treat this as a supervised classification problem, using features derived from treatment effect estimators to distinguish spurious correlations from "genuine" ones. Due to the generic nature of these features and their small dimensionality, we find that the approach works well even with limited training examples, and that it is possible to transport the word classifier to new domains. Experiments on four datasets (sentiment classification and toxicity detection) suggest that using this approach to inform feature selection also leads to more robust classification, as measured by improved worst-case accuracy on the samples affected by spurious correlations.

研究の動機と目的

  • 『スパイクバーグ』という語が肯定的センチメントと相関するが、それは意味的意味ではなく、成功した映画と統計的に関連しているため、文書分類器が誤った相関に依存する問題に対処する。
  • テストデータが訓練データから逸脱する分布シフトが生じる状況(例:新しい否定的評価のスパイクバーグ映画)において、このような誤った特徴量を特定・フィルタリングすることで、モデルの耐性を向上させる。
  • 語が人種的・文化的背景と関連している場合でさえ、その語が本質的に有毒でないにもかかわらず、毒性予測が過剰になるのを防ぐことで、文書分類における公平性を向上させる。
  • 誤った特徴量に依存することでモデル意思決定への信頼を損なう要因を低減することで、NLPにおける説明可能性を支援する。
  • 再訓練を完全に再開することなく、ドメインをまたいで一般化可能な、データ効率の良い誤った特徴量同定手法を開発する。

提案手法

  • 因果推定技術から得られる単語レベル特徴量を用いて、誤った相関と真の相関を識別する教師あり二値分類問題として定式化する。
  • マッチングに基づく処置効果推定を用い、文脈的共起パターンを制御した上で、各語がラベルに与える因果的影響を分離する。
  • マッチングプロセスから得られる一般的な低次元特徴量(平均処置効果、傾向スコアなど)のセットを構築し、単語分類器の訓練に使用する。
  • ラベル付き単語例(200~300例)の小さなセットを用いて、これらの処置効果由来特徴量を入力として、単語が誤ったものか真のものかを予測する二値分類器を訓練する。
  • 訓練済みの単語分類器を用いて、語彙内のすべての語を予測された誤った相関度の順にランク付けし、下流の文書分類タスクにおける特徴選択を可能にする。
  • ランク付けされたリストを基に、主な分類タスクにおける特徴選択を実施し、予測された誤った相関度が低い順に語を削除することで、最悪ケース精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1処置効果推定を用いて、誤った相関と真の相関を識別するための効果的で低次元の特徴量を構築できるか?
  • RQ2ラベル付き例が限られた(200~300例)単語分類器は、ラベルと強い相関を持つ語に対しても、誤った語を同定する能力を示すか?
  • RQ3あるドメインで訓練された単語分類器が、他のドメインに移行する際、顕著な性能低下を伴わずに適用可能か?
  • RQ4単語分類器の予測を特徴選択に活用することで、分布シフトが生じた下流タスクにおける最悪ケース精度が向上するか?
  • RQ5本手法は、感情スコアの辞書ベースラインと比較して、文脈に依存する真の感情や毒性特徴をどれほどうまく同定できるか?

主な発見

  • 提案手法の単語分類器は、ラベルと強い相関を持つ語に対しても、誤った相関を同定するAUCスコアが0.66~0.82に達し、限られた訓練データでも高い耐性を示す。
  • 本手法はドメインをまたいで良好に一般化する:IMDBなどの1つのデータセットで訓練された単語分類器は、有毒コメントなどの別のデータセットに適用しても高い性能を維持する。
  • 単語分類器の予測に基づく特徴選択(予測された誤った相関度が低い順に語を削除)により、分布がシフトしたテストセットにおける最悪ケース精度が向上し、耐性の向上が確認された。
  • 本手法は、4つのデータセット(IMDB、Kindle、有毒コメント、有毒ツイート)すべてにおいて、感情スコアの辞書ベースラインを上回り、F1やAUCの差が0.05~0.2に達する。これは、文脈依存的でない真の特徴や感情とは関係のない特徴をよりよく検出できるためである。
  • 処置効果推定に加え、頻度や共起パターンなどの追加特徴を組み合わせることで、処置効果のみを用いる場合よりも分類器の性能が向上し、マルチモーダルな特徴工学の価値が示された。
  • 本手法は、毒性分類において、人種的・文化的背景と関連する語への依存を効果的に低減し、誤った相関に起因する公平性リスクを軽減する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。