[論文レビュー] Sparsity-Guided Holistic Explanation for LLMs with Interpretable Inference-Time Intervention
この論文では、トークン、サブネットワーク、コンセプトのレベルで同時にサブネットワークを pruning するスパarsity誘導型フレームワークである SparseCBM を提案する。この手法により、微調整を必要とせず、モデルの解釈可能性と精度を向上させつつ、SOTA の性能を維持したまま、推論時における解釈可能な干渉が可能になる。
Large Language Models (LLMs) have achieved unprecedented breakthroughs in various natural language processing domains. However, the enigmatic ``black-box'' nature of LLMs remains a significant challenge for interpretability, hampering transparent and accountable applications. While past approaches, such as attention visualization, pivotal subnetwork extraction, and concept-based analyses, offer some insight, they often focus on either local or global explanations within a single dimension, occasionally falling short in providing comprehensive clarity. In response, we propose a novel methodology anchored in sparsity-guided techniques, aiming to provide a holistic interpretation of LLMs. Our framework, termed SparseCBM, innovatively integrates sparsity to elucidate three intertwined layers of interpretation: input, subnetwork, and concept levels. In addition, the newly introduced dimension of interpretable inference-time intervention facilitates dynamic adjustments to the model during deployment. Through rigorous empirical evaluations on real-world datasets, we demonstrate that SparseCBM delivers a profound understanding of LLM behaviors, setting it apart in both interpreting and ameliorating model inaccuracies. Codes are provided in supplements.
研究の動機と目的
- 大規模言語モデル(LLMs)における解釈可能性のギャップを、局所的およびグローバルな説明手法を統合することで解消すること。
- トークン、サブネットワーク、コンセプトの各レベルで解釈可能なマルチレベルの説明を提供するフレームワークを開発すること。
- 微調整なしに、推論時に動的かつ解釈可能なモデル調整を可能にすること。
- 解釈可能性と信頼性を高めつつ、高いモデル性能を維持すること。
- コストの高い微調整への依存を減らすために、効率的な推論時干渉を導入すること。
提案手法
- SparseCBM は、コンセプトラベルとタスクラベルの両方の最適化を目的関数として用いた、2次の pruning を用いて、LLM バックボーンを段階的に pruning する。
- 定義済みの、人間が解釈可能なコンセプトに対応するコンセプト固有のスパースサブネットワークを構築する。
- モデルアーキテクチャ全体にスパarsityを強制することで、入力トークンから最終予測に至るまで、コンactな意思決定経路を抽出する。
- スパース構造のおかげで、入力コンテキストに基づいて内部パラメータをリアルタイムで調整可能な、解釈可能な推論時干渉が可能になる。
- 性能を維持しつつ解釈可能性を向上させるために、非構造的 pruning と Concept Bottleneck Models (CBMs) を統合する。
- スパarsity は、pruning 中にコンセプトレベルとタスクレベルの予測精度の両方をバランスさせる共同最適化目的関数によって誘導される。
実験結果
リサーチクエスチョン
- RQ1スパarsity誘導型 pruning は、LLMs におけるトークン、サブネットワーク、コンセプトの各レベルで包括的かつマルチレベルの解釈可能性を実現できるか?
- RQ2解釈可能な推論時干渉の統合は、デプロイ時におけるモデルの頑健性と精度をどのように向上させるか?
- RQ3スパースサブネットワークは、解釈性を著しく向上させつつ、どの程度の性能を維持できるか?
- RQ4異なる LLM バックボーンおよびスパarsityレベルにおいて、このフレームワークはどの程度の性能を示すか?
- RQ5動的かつコンテキストに適応したモデル調整を可能にしつつ、微調整への依存をどの程度減らせるか?
主な発見
- SparseCBM は、コンセプトラベルとタスクラベルの両方の予測ベンチマークで SOTA の性能を達成し、完全な LLM と同等の精度を示した。
- このフレームワークにより、微調整を要せず、予測精度を向上させる解釈可能な推論時干渉が可能になった。
- 大規模な LLM バックボーンで、高いスパarsityレベルでも高い性能を維持しており、スケーラビリティと頑健性を示している。
- 過剰な pruning はすべてのモデルで性能を低下させ、最適なスパarsity閾値が存在することを確認した。
- 局所的(トークン/サブネットワーク)およびグローバル(コンセプト)な説明を効果的に統合する、相乗的な解釈パスを提供した。
- スパース構造により、推論時に動的かつコンテキストに適応したパラメータ調整が可能になり、モデルの適応性と解釈可能性が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。