Skip to main content
QUICK REVIEW

[論文レビュー] Discretized Integrated Gradients for Explaining Language Models

Soumya Sanyal, Xiang Ren|arXiv (Cornell University)|Aug 31, 2021
Explainable Artificial Intelligence (XAI)参考文献 26被引用数 4
ひとこと要約

本稿では、線形補間パスを語彙空間内の非線形的・離散的パスに置き換えることで、NLPにおける帰属割り当ての説明可能性を向上させる、離散化統合勾配(DIG)を提案する。DIGは、実際の語彙に近いアンカー語を選び、補間点が実際のデータを代表するようにする2つの戦略——グリーディーとマックスカウント——を用いる。これにより、より忠実な勾配が得られ、BERT、DistilBERT、RoBERTaモデルにおけるセンチメント分類タスクで優れた性能を発揮する。

ABSTRACT

As a prominent attribution-based explanation algorithm, Integrated Gradients (IG) is widely adopted due to its desirable explanation axioms and the ease of gradient computation. It measures feature importance by averaging the model's output gradient interpolated along a straight-line path in the input data space. However, such straight-line interpolated points are not representative of text data due to the inherent discreteness of the word embedding space. This questions the faithfulness of the gradients computed at the interpolated points and consequently, the quality of the generated explanations. Here we propose Discretized Integrated Gradients (DIG), which allows effective attribution along non-linear interpolation paths. We develop two interpolation strategies for the discrete word embedding space that generates interpolation points that lie close to actual words in the embedding space, yielding more faithful gradient computation. We demonstrate the effectiveness of DIG over IG through experimental and human evaluations on multiple sentiment classification datasets. We provide the source code of DIG to encourage reproducible research.

研究の動機と目的

  • 直線的補間パスに起因する非代表的かつ分布外の補間点の問題により、離散的テキストデータにおける統合勾配(IG)の限界を解消する。
  • 埋め込み空間における補間点が語彙内の実際の語に近くなるようにすることで、勾配ベースの帰属割り当ての忠実性を向上させる。
  • 入力とベースラインの埋め込みの間を実語のアンカーを用いて単調に補間する2つの補間戦略——DIG-GreedyとDIG-MaxCount——を提案する。
  • 複数の事前学習言語モデルおよびセンチメントデータセットにおいて、DIGがIGや他の勾配ベースのベースラインと比較してより現実的かつ正確な説明を提供することを実証する。
  • 人間による評価を通じて、DIGが生成する説明がIGや他のベースラインと比較してより説得力があると認識されることにより、モデル予測に対する人間の信頼を高める。

提案手法

  • 標準の統合勾配で用いられる直線的パスの代わりに、離散的語彙埋め込み空間における非線形補間パスを提案する。
  • DIG-Greedyは、各入力語の単調投影に最も近い実語をアンカーとして選ぶ。これにより、単調パスへの距離が最小化される。
  • DIG-MaxCountは、入力からベースラインへの方向と一致する次元数(すなわち単調次元)が最も多い語をアンカーとして選ぶ。その後、非単調次元を変更して単調性を保証する。
  • 選択されたアンカー語を用いて補間パスを構築し、各点が入力とベースラインの埋め込みの間に単調に位置するようにする。これにより、代表性が向上する。
  • 密度を高めるために、パスに要因fを適用してアップサンプリングを行う。これにより、積分近似誤差が減少するが、計算コストは著しく増加しない。
  • 標準の統合勾配式を用いるが、非線形パスに沿って離散的かつデータに代表される点でのみ勾配を計算する。これにより、勾配の忠実性が向上する。

実験結果

リサーチクエスチョン

  • RQ1語彙埋め込み空間における非線形的・離散的補間パスは、テキストデータにおける線形補間よりも忠実な勾配をもたらすか?
  • RQ2DIG-GreedyとDIG-MaxCountは、センチメント分類タスクにおける標準の統合勾配と比較して、帰属割り当ての質においてどのように異なるか?
  • RQ3DIGが生成する説明は、IGや他のベースラインと比較して、人間のモデル説明の正当性認識をどの程度向上させるか?
  • RQ4ハイパーパrameter m(アンカー数)とf(アップサンプリング要因)が、DIGの近似誤差と性能に与える影響はどの程度か?
  • RQ5DIGにおけるパスのアップサンプリングは、計算コストを著しく増加させることなく、積分近似誤差を効果的に低減するか?

主な発見

  • DIGは、3つの事前学習言語モデル(BERT、DistilBERT、RoBERTa)と3つのセンチメントデータセット(SST2、IMDB、Rotten Tomatoes)を対象とした9つの実験設定のうち8つで、統合勾配や他の勾長ベースのベースラインを上回る性能を示した。
  • DIGのDelta %誤差は、アップサンプリング要因fが増加するにつれて一貫して減少し、積分近似の改善が示された。一方、WAEは安定したままだった。
  • アップサンプリング要因f=0の固定条件下でアンカー数mを増やすと、DIGのDelta %が上昇し、パスが長くなることで近似の難易度が高まることを示した。
  • 人間評価では、DIGが生成する説明がIGや他のベースラインと比較して、より現実的で信頼できると評価された。
  • DIG-MaxCountは、平均的な指標において優れた性能を発揮し、特に近似誤差の低減と忠実性の向上において優位であった。
  • アップサンプリング戦略は、WAEを著しく増加させることなく、近似誤差を効果的に低減した。これにより、mの増加に対するスケーラブルな代替手段としての有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。