[논문 리뷰] Sparsity-Guided Holistic Explanation for LLMs with Interpretable Inference-Time Intervention
이 논문은 토큰, 하위망, 개념 수준에서 하위망을 동시로 제거하는 스파arsity 유도 프레임워크인 SparseCBM을 제안한다. 이는 피인퍼런스 시 간섭이 가능한 통합적이고 해석 가능한 설명을 제공함으로써, 피인퍼런스 후 조정 없이도 모델의 해석 가능성과 정확성을 향상시키며, 벤치마크 작업에서 최신 기술 수준의 성능을 유지한다.
Large Language Models (LLMs) have achieved unprecedented breakthroughs in various natural language processing domains. However, the enigmatic ``black-box'' nature of LLMs remains a significant challenge for interpretability, hampering transparent and accountable applications. While past approaches, such as attention visualization, pivotal subnetwork extraction, and concept-based analyses, offer some insight, they often focus on either local or global explanations within a single dimension, occasionally falling short in providing comprehensive clarity. In response, we propose a novel methodology anchored in sparsity-guided techniques, aiming to provide a holistic interpretation of LLMs. Our framework, termed SparseCBM, innovatively integrates sparsity to elucidate three intertwined layers of interpretation: input, subnetwork, and concept levels. In addition, the newly introduced dimension of interpretable inference-time intervention facilitates dynamic adjustments to the model during deployment. Through rigorous empirical evaluations on real-world datasets, we demonstrate that SparseCBM delivers a profound understanding of LLM behaviors, setting it apart in both interpreting and ameliorating model inaccuracies. Codes are provided in supplements.
연구 동기 및 목표
- 로컬 및 글로벌 설명 방법을 통합함으로써 대규모 언어 모델(LLM)의 해석 가능성 격차를 해소하기 위해.
- 토큰, 하위망, 개념 수준에서 다중 수준의 해석 가능한 설명을 제공하는 프레임워크를 개발하기 위해.
- 재학습 없이도 인퍼런스 중 동적이고 해석 가능한 모델 조정을 가능하게 하기 위해.
- 해석 가능성과 신뢰도를 향상시키면서도 높은 모델 성능을 유지하기 위해.
- 비용이 많이 드는 피인퍼런스를 줄이기 위해 효율적인 인퍼런스 시 간섭을 도입하기 위해.
제안 방법
- SparseCBM는 개념 레이블과 작업 레이블을 동시에 최적화하는 공동 목표를 기반으로 하위망을 이차적 제거를 통해 반복적으로 제거한다.
- 사전 정의된 인간이 이해할 수 있는 개념에 대응하는 개념별로 특화된 스파arsity 하위망을 구성한다.
- 입력 토큰에서 최종 예측에 이르는 간결하고 해석 가능한 결정 경로를 추출하기 위해 모델 아키텍처 전반에 걸쳐 스파arsity를 강제한다.
- 스파arsity 구조 덕분에 인퍼런스 시 해석 가능한 간섭이 가능해져 입력 컨텍스트에 기반한 내부 파라미터의 실시간 조정이 가능하다.
- 비구조적 제거와 함께 개념 복 bottleneck 모델(CBMs)을 통합하여 성능 유지를 유지하면서도 해석 가능성을 향상시킨다.
- 스파arsity는 제거 과정 중 개념 수준과 작업 수준의 예측 정확도를 균형 잡는 공동 최적화 목표에 의해 유도된다.
실험 결과
연구 질문
- RQ1스파arsity 유도 제거가 LLM에서 토큰, 하위망, 개념 수준에서 통합적이고 다중 수준의 해석 가능성을 가능하게 하는가?
- RQ2해석 가능한 인퍼런스 시 간섭의 통합이 배포 중 모델의 강건성과 정확도를 어떻게 향상시키는가?
- RQ3스파arsity 하위망은 얼마나 높은 수준의 해석 가능성을 확보하면서도 성능을 유지할 수 있는가?
- RQ4다양한 LLM 백본과 스파arsity 수준에서 이 프레임워크는 어떻게 성능을 발휘하는가?
- RQ5동적이고 컨텍스트 기반의 모델 조정을 가능하게 하면서도 피인퍼런스에 대한 의존도를 줄일 수 있는가?
주요 결과
- SparseCBM는 개념 레이블과 작업 레이블 예측 벤치마크에서 최신 기술 수준의 성능를 달성하며, 전체 LLM과 동일한 정확도를 유지한다.
- 이 프레임워크는 피인퍼런스 후 조정 없이도 예측 정확도를 향상시키는 해석 가능한 인퍼런스 시 간섭을 가능하게 한다.
- 큰 LLM 백본은 높은 스파arsity 수준에서도 높은 성능를 유지하여 확장성과 강건성을 보여준다.
- 과도한 제거는 모든 모델에서 성능을 떨어뜨리며, 최적의 스파arsity 임계값이 존재한다는 것을 확인한다.
- 이 방법은 국소(토큰/하위망) 및 글로벌(개념) 설명을 효과적으로 통합하는 상호보완적인 해석 경로를 제공한다.
- 스파arsity 구조 덕분에 인퍼런스 중 동적이고 컨텍스트 기반의 파라미터 조정이 가능해져 모델의 적응성과 해석 가능성이 향상된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.