Skip to main content
QUICK REVIEW

[論文レビュー] Refining Language Models with Compositional Explanations

Huihan Yao, Ying Chen|arXiv (Cornell University)|Mar 18, 2021
Topic Modeling参考文献 59被引用数 17
ひとこと要約

この論文では、誤ったパターンを低減し、公平性を向上させるために、人間が提供する構成的説明を用いて事前学習済み言語モデルを微調整するRemoteというフレームワークを提案している。説明を実行可能な論理規則に解析し、それらをラベルなしデータに一般化することで、Remoteは正則化のカバー範囲を拡大し、特徴量の寄与度と相互作用を両方組み込む。その結果、嫌がらせ発言およびセンチメント分類タスクにおいて、性能向上とバイアス低減が達成された。

ABSTRACT

Pre-trained language models have been successful on text classification tasks, but are prone to learning spurious correlations from biased datasets, and are thus vulnerable when making inferences in a new domain. Prior work reveals such spurious patterns via post-hoc explanation algorithms which compute the importance of input features. Further, the model is regularized to align the importance scores with human knowledge, so that the unintended model behaviors are eliminated. However, such a regularization technique lacks flexibility and coverage, since only importance scores towards a pre-defined list of features are adjusted, while more complex human knowledge such as feature interaction and pattern generalization can hardly be incorporated. In this work, we propose to refine a learned language model for a target domain by collecting human-provided compositional explanations regarding observed biases. By parsing these explanations into executable logic rules, the human-specified refinement advice from a small set of explanations can be generalized to more training examples. We additionally introduce a regularization term allowing adjustments for both importance and interaction of features to better rectify model behavior. We demonstrate the effectiveness of the proposed approach on two text classification tasks by showing improved performance in target domain as well as improved model fairness after refinement.

研究の動機と目的

  • 複雑な人間のフィードバックを捉える能力に欠ける、既存のモデル正則化手法のカバー範囲と表現力の限界を是正すること。
  • 低リソースまたはドメイン外の設定において、モデルの頑健性と公平性を向上させるために、人間が提供する構成的説明でモデルを微調整すること。
  • 小さな例のセットにおける人間によるアノテーションフィードバックを、ターゲットドメインの広範なラベルなしインスタンスに一般化すること。
  • 個々の特徴量の寄与度を超えて、特徴量の相互作用を正則化に組み込むことで、人間のフィードバックの表現力を高めること。
  • 上流のトレーニングデータにアクセスできない状況でも、効率的かつ非侵襲的なモデル微調整を可能にすること。

提案手法

  • 後処理の説明ヒートマップから、誤ったパターン、特に特徴量の寄与度と相互作用を特定する人間による構成的説明を収集する。
  • 特徴量の重要度と相互作用制約を両方エンコードする実行可能な一階論理規則にこれらの説明を解析する。
  • 原子的演算を緩和することで、ターゲットドメインのラベルなしインスタンスに論理規則を一般化し、ノイズありだが情報豊富な教師信号を生成する。
  • 微調整中に特徴量の寄与度と相互作用の両方を同時に最適化するための微分可能な正則化項を導入する。
  • ラベルなし文内の関連する語句をソフトマッチング機構で特定し、一般化された論理規則に基づいてターゲットスコアを割り当てる。
  • 標準的な交差エントロピーと一般化された人間のフィードバックに基づく正則化項を組み合わせた損失関数でモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1単なる特徴量の寄与度を超えた構成的説明——特に相互作用を含む——は、言語モデル微調整の一般化性と頑健性を向上させるか?
  • RQ2ラベルなしデータへの人間のフィードバックのルールベース一般化は、ドメイン外のテキスト分類においてモデル性能を向上させるのにどの程度有効か?
  • RQ3正則化プロセスに特徴量の相互作用を組み込むことで、寄与度のみを正則化する手法よりも、誤った相関関係の緩和が改善されるか?
  • RQ4正則化項の強度に、モデル微調整の性能がどの程度敏感か?
  • RQ5上流のトレーニングデータにアクセスできない状況でも、このフレームワークはモデルの意図しないバイアスを低減できるか?

主な発見

  • Remoteは、ターゲットドメインにおけるソースモデルの性能を向上させ、HatEval → GHC 嫌がらせ発言分類タスクで45.7%のF1スコアを達成した。これは直接転送の42.1%を上回った。
  • 寄与度と相互作用の両方の正則化(Reg. with a.&i.)が、最も高い性能(45.7% F1)を達成し、バイアスも低減された。これは、寄与度のみまたは相互作用のみを正則化する手法を上回った。
  • 正則化強度に対してモデルの性能が頑健であり、ハイパーパrameter値の広い範囲(α ∈ [0.003, 0.03])で安定した性能を示した。
  • 嫌がらせラベル付きの規則のみを用いた正則化が、非嫌がらせラベル付きの規則を用いた場合よりも優れた性能を示し、有害なパターンに焦点を当てることで、より良いモデル微調整が達成された。
  • ソフト正則化損失を使用した場合、1トレーニングイテレーションあたりの時間コストが約50秒増加したが、1インスタンスあたり数個の語句でのスコアリングが疎であるため、依然として管理可能であった。
  • アプローチにより、特に低リソース設定において、低い公平性違反と改善された一般化が確認されたことから、意図しないバイアスが顕著に低減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。