Skip to main content
QUICK REVIEW

[論文レビュー] On Explaining Your Explanations of BERT: An Empirical Study with Sequence Classification

Zhengxuan Wu, Desmond C. Ong|arXiv (Cornell University)|Jan 1, 2021
Topic Modeling参考文献 29被引用数 15
ひとこと要約

本稿は、文書分類タスクにおけるBERTの意思決定を説明するための4つの帰属割り当て手法—勾配感受性(GS)、勾配×入力(GI)、レイヤーワイズ関係性伝播(LRP)、および注意付きLRP(LAT)—を評価する。GS、GI、LRPは感情分析データセット全体で信頼性があり、頑健かつ意味的に意味のある説明を生成するが、LATは性能が著しく低い。特に、すべての手法が意味的に類似したタスク間で関係スコアの強い一般化を示すことが判明した。

ABSTRACT

BERT, as one of the pretrianed language models, attracts the most attention in recent years for creating new benchmarks across GLUE tasks via fine-tuning. One pressing issue is to open up the blackbox and explain the decision makings of BERT. A number of attribution techniques have been proposed to explain BERT models, but are often limited to sequence to sequence tasks. In this paper, we adapt existing attribution methods on explaining decision makings of BERT in sequence classification tasks. We conduct extensive analyses of four existing attribution methods by applying them to four different datasets in sentiment analysis. We compare the reliability and robustness of each method via various ablation studies. Furthermore, we test whether attribution methods explain generalized semantics across semantically similar tasks. Our work provides solid guidance for using attribution methods to explain decision makings of BERT for downstream classification tasks.

研究の動機と目的

  • BERTの文書分類意思決定を説明する4つの帰属割り当て手法—GS、GI、LRP、LAT—の信頼性と頑健性を評価すること。
  • 帰属割り当て手法が、感情分析における意味的に類似した下流タスク間で一般化可能な説明を生成するかどうかを調査すること。
  • 微調整されたBERTモデルにおけるランダム重み初期化が帰属スコアに与える感受性を評価すること。
  • 分類タスクにおけるBERTの意思決定プロセスを調査する際の、帰属割り当て手法の選定に関する実証的指針を提供すること。

提案手法

  • 分類ヘッドを備えたBERTモデルに、勾配感受性(GS)、勾配×入力(GI)、レイヤーワイズ関係性伝播(LRP)、および注意付きLRP(LAT)の4つの帰属割り当て手法を適応する。
  • SST-5、SemEval、IMDb、Yelpの4つの感情分類データセットで、入力シーケンスのトークンレベルの関係スコアを計算するためにこれらの手法を適用する。
  • 関係スコアの降順にトークンを順次削除するアブレーションスタディを実施し、モデル精度の低下を測定することで、手法の信頼性を評価する。
  • 異なるランダム重み初期化からの関係スコア間のピアソン相関係数を計算し、頑健性を評価する。
  • 共通語彙を持つ単語の関係スコアのデータセット間相関を測定することで、タスク間での意味的一般化をテストする。
  • 勾配ベース手法ではL2ノルム、LRPでは絶対値の合計を関係スコア計算に用い、実装を公開している。

実験結果

リサーチクエスチョン

  • RQ1GS、GI、LRP、LATは、複数の感情分析データセットにおいて、BERTの分類意思決定に重要なトークンをどれだけ信頼性を持って特定できるか?
  • RQ2BERTの微調整におけるランダム重み初期化が、帰属スコアにどれほど影響を及ぼすか?
  • RQ3帰属割り当て手法は、映画レビューとツイートのような意味的に類似したタスク間で、どの程度一般化されるか?
  • RQ4共通する意味的特徴を持つデータセット間で、異なる帰属割り当て手法の関係スコアはどの程度意味的に相関しているか?

主な発見

  • GS、GI、LRPは、高関係スコアのトークンをアブレーションした際に一貫して顕著な精度低下を示し、モデル意思決定と強い整合性があることを示している。
  • LATはアブレーションスタディで著しく劣る性能を示し、精度低下のパターンがランダムな単語削除と類似しているため、意味のある特徴を特定できていないと示唆される。
  • 4つの帰属割り当て手法すべてが、データセット間の共通語彙における関係スコアで強いピアソン相関(r > 0.7)を示しており、意味的に類似したタスク間での一般化が確認された。
  • ランダム重み初期化は関係スコアに影響を与えるが、その影響は限定的であり、特に短いシーケンスでは一貫性が高くなる。
  • LRPは、GSやGIよりも感情的意味を持つ語をより多様かつ意味的に豊かに強調する関係スコアを生成する。
  • 結果から、BERTの内部表現はタスク固有に限らず、意味的に類似したドメイン間でも一般化されていることが示唆され、一貫した帰属パターンが観察された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。