Skip to main content
QUICK REVIEW

[論文レビュー] Incorporating Priors with Feature Attribution on Text Classification

Frederick Liu, Besim Avci|arXiv (Cornell University)|Jun 19, 2019
Machine Learning and Data Classification参考文献 43被引用数 8
ひとこと要約

本論文では、訓練中に統合勾配による特徴量の寄与度と事前に定義されたターゲット寄与度値とのL2距離を最小化することで、ドメイン固有の事前知識をテキスト分類モデルに組み込む手法を提案する。このアプローチにより、元のタスクのパフォーマンスを損なうことなく、アイデンティティ用語へのモデル依存度を低減し、公平性を向上させる。また、低データ環境下でも既知の有害語に注目させることで性能を向上させることができ、ウィキペディアの有害コメントデータセットを用いた検証で有効性が確認された。

ABSTRACT

Feature attribution methods, proposed recently, help users interpret the predictions of complex models. Our approach integrates feature attributions into the objective function to allow machine learning practitioners to incorporate priors in model building. To demonstrate the effectiveness our technique, we apply it to two tasks: (1) mitigating unintended bias in text classifiers by neutralizing identity terms; (2) improving classifier performance in a scarce data setting by forcing the model to focus on toxic terms. Our approach adds an L2 distance loss between feature attributions and task-specific prior values to the objective. Our experiments show that i) a classifier trained with our technique reduces undesired model biases without a trade off on the original task; ii) incorporating priors helps model performance in scarce data settings.

研究の動機と目的

  • テキスト分類におけるモデルバイアス、特にアイデンティティ用語と有害性予測との間の意図しない関連性を是正すること。
  • 元のタスクパフォーマンスを損なうことなく、実務家がドメイン固有の事前知識をモデルの学習に組み込めるようにすること。
  • 解釈可能な特徴量の寄与度を訓練信号として用いて、望ましくないモデル行動を直接是正する手法を提供すること。
  • 既知の有害語や関連語に注目させるように誘導することで、データが少ない状況下でのモデルの頑健性とパフォーマンスを向上させること。
  • データ拡張や敵対的デバイアス手法とは異なり、公平性と精度のトレードオフを回避するスケーラブルで実行可能な代替手法を提供すること。

提案手法

  • 本手法は、モデルの目的関数に、事前に選択したトークンの統合勾配による寄与度とターゲット寄与度値(例:アイデンティティ用語に対しては0、有害語に対しては1)とのL2距離損失を導入する。
  • 公平性の観点から、アイデンティティ用語にはターゲット寄与度を0として設定し、モデルがこれらの用語に予測を寄与させることをペナルティ付ける。
  • 低データパフォーマンスの観点から、既知の有害語にはターゲット寄与度を1として設定し、訓練中にそれらに注目させることを促進する。
  • 組み合わせられた目的関数には交差エントロピー損失と特徴量寄与度に基づくL2損失が含まれており、同時に最適化可能である。
  • パス統合勾配を用いてトークンレベルで動作させることで、解釈可能性を保ち、人間が理解可能な入力単位と整合性を保つ。
  • 事前学習済みモデルを最小限のエポック数で微調整することで、バイアスの少ないより頑健な予測が得られる。

実験結果

リサーチクエスチョン

  • RQ1元のタスクのパフォーマンスを低下させることなく、アイデンティティ用語へのモデルバイアスを低減できるか?
  • RQ2訓練目的関数に事前寄与度値を組み込むことで、有害コメント分類における公平性がどの程度向上するか?
  • RQ3特徴量寄与度の事前知識を用いて、既知の有害語に注目させるように誘導することで、低データ環境下でのモデルパフォーマンスを向上させられるか?
  • RQ4提案手法は、標準的な訓練と比較して、より優れた単語表現を副次的に得られるか?
  • RQ5この手法は、ドメイン固有の特徴量重要度制約を必要とする他のNLPタスクにも適用可能か?

主な発見

  • 提案手法で訓練されたモデルは、元のタスクで同等またはより高いパフォーマンスを達成するとともに、アイデンティティ用語への寄与度を顕著に低減した。
  • 本手法は、バイアスのない合成データセット上で公平性指標とAUCを向上させたが、元のタスクの精度を損なわなかった。
  • ウィキペディアの有害コメントデータセットにおいて、ベースラインと比較してアイデンティティ用語(例:'gay'、'jew')への平均寄与度が低かった。
  • 低データ環境下では、ターゲット寄与度を1として有害語に注目させるように強制することで、分類器のパフォーマンスが向上した。
  • 本手法は、ベースラインモデルと比較して、より高品質な単語ベクトルを副次的に得た。
  • 特徴量損失を用いた微調整は、数エポックでバイアスの少ない分類器に収束した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。