Skip to main content
QUICK REVIEW

[論文レビュー] ferret: a Framework for Benchmarking Explainers on Transformers

Giuseppe Attanasio, Eliana Pastor|arXiv (Cornell University)|Aug 2, 2022
Topic Modeling被引用数 8
ひとこと要約

ferret は、Hugging Face の transformers ライブラリと統合することで、トランスフォーマーに基づく NLP モデルの後処理説明手法のベンチマークと比較を簡素化する Python フレームワークです。ユーザーは 4 つの最先端の手法を用いて予測を説明でき、6 つの忠実性および妥当性のメトリクスを用いて説明を評価でき、標準化された解釈可能性データセットでテストが可能で、感情分析および嫌がらせ発言検出タスクにおいて SHAP が最も一貫性のある説明者として浮き彫りになりました。

ABSTRACT

As Transformers are increasingly relied upon to solve complex NLP problems, there is an increased need for their decisions to be humanly interpretable. While several explainable AI (XAI) techniques for interpreting the outputs of transformer-based models have been proposed, there is still a lack of easy access to using and comparing them. We introduce ferret, a Python library to simplify the use and comparisons of XAI methods on transformer-based classifiers. With ferret, users can visualize and compare transformers-based models output explanations using state-of-the-art XAI methods on any free-text or existing XAI corpora. Moreover, users can also evaluate ad-hoc XAI metrics to select the most faithful and plausible explanations. To align with the recently consolidated process of sharing and using transformers-based models from Hugging Face, ferret interfaces directly with its Python library. In this paper, we showcase ferret to benchmark XAI methods used on transformers for sentiment analysis and hate speech detection. We show how specific methods provide consistently better explanations and are preferable in the context of transformer models.

研究の動機と目的

  • トランスフォーマーに基づく NLP モデルにおける説明手法の比較に向けた標準化され、相互運用可能なツールの不足に対処すること。
  • Hugging Face がホスティングする任意のトランスフォーマー モデルに対して、後処理説明技術を適用・評価するための統合的でアクセスしやすいインターフェースを提供すること。
  • 複数のデータセットとタスクにわたる忠実性および妥当性のメトリクスを用いて説明を評価すること。
  • 説明者、評価者、データセットのためのモジュラーや抽象化された API を提供することで、コミュニティの貢献を促進すること。
  • 感情分析や嫌がらせ発言検出などの実世界の NLP 応用における XAI メソッドの比較を簡素化すること。

提案手法

  • ferret は、4 つの最先端の後処理説明手法(勾配、統合勾配、LIME、SHAP)を適用するための統合 API を提供します。
  • Hugging Face の transformers ライブラリとネイティブに統合されており、標準的なモデル名を用いて直接モデルを読み込み、説明を生成できます。
  • 忠実性(例:包括性、必要十分性、1つずつ除外)および妥当性(例:オーバーラップ率、精度再現曲線下の面積)に基づく 6 つの評価メトリクスをサポートしています。
  • HateXplain(嫌がらせ発言)、MovieReviews および SST(感情分析)、Thermostat(汎用テキスト)の 4 つのベンチマークデータセットへのアクセスを提供しています。
  • 新規の説明者、メトリクス、データセットの拡張を可能にする抽象基底クラス(例:BaseExplainer、BaseEvaluator)を公開しています。
  • モデルの読み込み、説明の生成、標準化されたメトリクスを用いた評価を一連のパイプラインで実行するエンドツーエンドのワークフローを可能にしています。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマーに基づくテキスト分類モデルにおいて、どの XAI メソッドが最も忠実で妥当な説明を生成するか?
  • RQ2異なる説明手法は、複数のデータセットと NLP タスクにわたって一貫してどのように性能を発揮するか?
  • RQ3統合されたフレームワークは、NLP における XAI 評価の比較可能性と再現可能性をどの程度向上できるか?
  • RQ4標準化された評価スイートは、定性的な検査では明らかでない説明品質の差を検出できるか?
  • RQ5Hugging Face のエコシステムとの統合は、NLP における XAI ツールのアクセシビリティと相互運用性をどの程度向上させるか?

主な発見

  • SHAP は、単一サンプルおよび複数サンプルの説明シナリオの両方において、他の XAI メソッドよりも忠実性が一貫して優れていました。
  • フレームワークは、忠実性および妥当性の原則に基づく 6 つのメトリクスを用いた、自動的かつ標準化された説明評価を実現しました。
  • ferret は、HateXplain や SST のようなベンチマークデータセットを統合することで、異なる手法間での説明品質の信頼性のある比較が可能であることを示しました。
  • ライブラリのモジュラーデザインにより、抽象基底クラスを介して新しい説明者、評価メトリクス、データセットのシームレスな拡張が可能になっています。
  • Hugging Face の transformers ライブラリとの統合により、複雑なセットアップやモデル変換なしに、事前学習済みモデルを即座に利用可能にしています。
  • 感情分析および嫌がらせ発言検出における事例研究により、SHAP が多様な入力タイプにおいて最も安定的で解釈可能な説明を提供することが確認されました。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。