[論文レビュー] Generating Hierarchical Explanations on Text Classification via Feature Interaction Detection
本稿では、複数の粒度にわたる特徴の相互作用を検出することにより、テキスト分類における階層的説明を生成するモデルに依存しない手法Hedgeを提案する。反復的に相互作用の強さに基づいてテキストスパンを同定および分割することで、Hedgeは忠実で解釈可能な説明を生成し、単語やフレーズがどのように組み合わさってモデルの予測に影響を与えるかを明らかにする。LSTM、CNN、BERTモデルにおける自動評価および人間評価の両面で、ベースラインを上回る性能を発揮した。
Generating explanations for neural networks has become crucial for their applications in real-world with respect to reliability and trustworthiness. In natural language processing, existing methods usually provide important features which are words or phrases selected from an input text as an explanation, but ignore the interactions between them. It poses challenges for humans to interpret an explanation and connect it to model prediction. In this work, we build hierarchical explanations by detecting feature interactions. Such explanations visualize how words and phrases are combined at different levels of the hierarchy, which can help users understand the decision-making of black-box models. The proposed method is evaluated with three neural text classifiers (LSTM, CNN, and BERT) on two benchmark datasets, via both automatic and human evaluations. Experiments show the effectiveness of the proposed method in providing explanations that are both faithful to models and interpretable to humans.
研究の動機と目的
- 既存の説明手法が個々の単語やフレーズにのみ注目しており、意思決定におけるそれらの相互作用を無視するという限界に対処すること。
- モデルに依存しないアプローチを開発し、モデルの予測に影響を与える特徴の階層的構成を明らかにすること。
- 複数の粒度での組み合わせが予測にどのように寄与するかを可視化することで、人間の解釈可能性を向上させること。
- 自動評価指標と人間評価の両方を用いて、説明の忠実性と理解可能性を評価すること。
提案手法
- Hedgeは、特徴の相互作用を検出することで、トップダウンかつ分割型のアプローチでテキストスパンを再帰的に分割する。
- 各テキストスパンがモデルの予測にどの程度寄与しているかを定量化するスコア関数を採用し、摂動と予測の変化に基づく。
- 各ステップで最も弱い相互作用を特定し、それに基づいてスパンを分割することで、特徴の相互作用の階層的ツリーを構築する。
- 階層は、文全体から個々の単語まで、粗い粒度から細かい粒度へと段階的に捉える。
- モデルに依存しないアプローチであり、入力テキストとモデルの予測のみを必要とするため、ブラックボックス分類器に適用可能である。
- 人間評価のための説明長を制限するために、最大5語までの上位特徴を選択することで、使いやすさを向上させる。
実験結果
リサーチクエスチョン
- RQ1特徴の相互作用検出は、テキスト分類における説明の忠実性と解釈可能性を向上させることができるか?
- RQ2階層的説明構造は、平坦で単語レベルの説明と比較して、モデル予測の構成的論理をどの程度明確に示せるか?
- RQ3提案手法は、人間評価において既存のモデルに依存しない説明技術を上回るか?
- RQ4LSTM、CNN、BERTなどの異なるニューラルアーキテクチャにおいて、本手法はどの程度の性能を発揮するか?
- RQ5特にBERTのような高精度なモデルでは、モデルの精度と説明の整合性の間にトレードオフが生じるか?
主な発見
- LSTMモデルを用いたIMDBデータセットにおいて、Hedgeは0.89という最高の整合性スコアを達成し、LIME(0.85)やSampleShapley(0.78)を含むすべてのベースラインを上回った。
- BERTでは、0.97という高い精度を示すにもかかわらず、Hedgeは0.75という強力な性能を維持した。これは、精度と解釈可能性の間に潜在的なトレードオフがある可能性を示唆している。
- 人間評価者は、Hedgeが生成した説明からモデルの予測を正しく推測する確率が、他の手法よりも顕著に高かった。これにより、解釈性の向上が確認された。
- Hedgeは、BERTで「not a bad」のような否定の複雑な相互作用を正しく捉え、LSTMが失敗した場合でも正しい予測を説明できた。
- 階層的構造により、「good」のような単語が「waste of good」といったより強い相互作用に支配されていることが明らかになり、平坦な説明よりもモデルの推論を深く理解できるようになった。
- SSTおよびIMDBデータセットにおける実験から、Hedgeの説明はモデルの挙動に忠実であり、同時に人間にとって理解可能であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。