[論文レビュー] Towards LLM-guided Causal Explainability for Black-box Text Classifiers
本稿では、ブラックボックスなテキスト分類器の因果的対照的説明を生成するために、最先端の大規模言語モデル(LLM)を活用する3段階パイプラインを提案する。潜在的特徴を特定し、それらを入力の語に結びつけ、最小限で意味を保った編集を加えることで、特にGPT-4が、ラベル反転を引き起こす説明において他のLLMを上回る、高品質な対照的説明を達成する。
With the advent of larger and more complex deep learning models, such as in Natural Language Processing (NLP), model qualities like explainability and interpretability, albeit highly desirable, are becoming harder challenges to tackle and solve. For example, state-of-the-art models in text classification are black-box by design. Although standard explanation methods provide some degree of explainability, these are mostly correlation-based methods and do not provide much insight into the model. The alternative of causal explainability is more desirable to achieve but extremely challenging in NLP due to a variety of reasons. Inspired by recent endeavors to utilize Large Language Models (LLMs) as experts, in this work, we aim to leverage the instruction-following and textual understanding capabilities of recent state-of-the-art LLMs to facilitate causal explainability via counterfactual explanation generation for black-box text classifiers. To do this, we propose a three-step pipeline via which, we use an off-the-shelf LLM to: (1) identify the latent or unobserved features in the input text, (2) identify the input features associated with the latent features, and finally (3) use the identified input features to generate a counterfactual explanation. We experiment with our pipeline on multiple NLP text classification datasets, with several recent LLMs, and present interesting and promising findings.
研究の動機と目的
- ブラックボックスなテキスト分類器には因果的説明が不足しており、通常は相関に基づく説明に依存しているという問題に対処すること。
- 最近開発されたインstructチューニング済みLLMが、モデルの予測を駆動する潜在的かつ観測不能な特徴を同定する解釈者として機能できるかどうかを調査すること。
- 予測に影響を与える重要な入力特徴のみを変更することで、高品質で意味を保った対照的説明を体系的に生成するパイプラインを開発すること。
- LLMが因果的特徴を同定し、モデルの予測を確実に反転させる対照的説明を生成する効果性を評価すること。
提案手法
- パイプラインは、まず、入力テキストに内在する潜在的かつ観測不能な特徴を同定するために、市販のLLMを用いる。
- 次に、抽出された潜在的特徴に関連する特定の入力特徴(例:語やフレーズ)を元のテキスト内で特定する。
- LLMに、同定された入力特徴のみを最小限に変更することで、分類器のラベルを反転させる対照的説明を生成するようプロンプトを提示する。
- 編集中に元の入力の全体的な文脈と構造を保つことで、意味的類似性を確保する。
- GPT-4、text-davinci-003、GPT-3.5を含むさまざまなLLMを用いて、複数のNLPテキスト分類データセットでアプローチを評価する。
- 対照的説明がモデルの予測を変更するかどうかを測るため、LFS(ラベル反転スコア)という指標を用いて評価する。
実験結果
リサーチクエスチョン
- RQ1最先端のLLMは、ブラックボックスなテキスト分類器の因果的対照的説明を効果的に生成するために活用可能か?
- RQ2LLMは、テキスト分類におけるモデル予測に因果的に影響を与える潜在的かつ観測不能な特徴を正確に同定できるか?
- RQ3GPT-4とGPT-3.5などの異なるLLMは、意味的保存性が高く、ラベル反転を達成する高品質な対照的説明をどの程度効果的に生成できるか?
- RQ4潜在的特徴抽出ステップが、対照的説明全体の品質に果たす貢献度はどの程度か?
主な発見
- GPT-4はIMDBデータセットで97.2という最高のLFSスコアを記録し、他のLLMを顕著に上回った。これは、効果的な対照的説明の生成能力が非常に高いことを示している。
- アブレーションスタディの結果、潜在的特徴抽出ステップを除外するとLFSが95.78に低下し、因果的入力特徴を同定する上でこのステップの重要性が確認された。
- 推論タスクを含むSNLIデータセットでは、LLM全体の性能が低かった。これは、推論の複雑さが対照的説明の品質に悪影響を及える可能性を示唆している。
- AG Newsデータセットでは、GPT-3.5とtext-davinci-003の性能が低かった。これは、タスクの多クラス性がラベル反転プロンプトの曖昧性を増し、解釈の難易度を高めたためと推察される。
- 定性的分析により、GPT-4は「物語の整合性」や「場所の不一致」など、高品質で意味的に意味のある潜在的特徴を同定しており、これらはモデルの誤りと整合的であることが確認された。
- 完全なパイプラインは、アブレーションバージョンを常に上回り、潜在的特徴と入力特徴の同定ステップが、高品質な対照的説明生成に不可欠であることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。