[논문 리뷰] The Struggles of Feature-Based Explanations: Shapley Values vs. Minimal Sufficient Subsets
이 논문은 단순한 모델조차도 기능 기반 설명이 본질적으로 모호할 수 있음을 보여주며, 동일한 예측에 대해 여러 개의 참값 설명이 존재할 수 있음을 밝힌다. Shapley 값과 최소 충분한 부분집합(MSS) 설명기는 본질적으로 다른 종류의 설명을 추구한다—Shapley 값은 기능 기여도를 가산적 중요도로 측정하는 반면, MSS는 예측을 위해 필요한 최소 기능 집합을 식별한다. 이는 어느 하나만으로는 모델 행동을 완전히 파악할 수 없음을 시사한다.
For neural models to garner widespread public trust and ensure fairness, we must have human-intelligible explanations for their predictions. Recently, an increasing number of works focus on explaining the predictions of neural models in terms of the relevance of the input features. In this work, we show that feature-based explanations pose problems even for explaining trivial models. We show that, in certain cases, there exist at least two ground-truth feature-based explanations, and that, sometimes, neither of them is enough to provide a complete view of the decision-making process of the model. Moreover, we show that two popular classes of explainers, Shapley explainers and minimal sufficient subsets explainers, target fundamentally different types of ground-truth explanations, despite the apparently implicit assumption that explainers should look for one specific feature-based explanation. These findings bring an additional dimension to consider in both developing and choosing explainers.
연구 동기 및 목표
- 간단한 모델조차도 기능 기반 설명이 여러 개 존재할 수 있는지 조사하기 위해.
- Shapley 값과 최소 충분한 부분집합(MSS)이라는 두 주요 설명기법 간의 근본적 차이를 분석하기 위해.
- 모델 예측에 대해 유일하고 유일한 참값 설명이 존재한다는 암묵적 가정을 도전하기 위해.
- 각 설명기법이 모델의 의사결정 과정을 완전히 반영하지 못하는 한계를 부각하기 위해.
- 사용자 요구와 맥락에 따라 설명의 유형을 더 명확히 밝혀내는 것이 중요하다고 주장하기 위해.
제안 방법
- 기본 결정 논리를 명시적으로 제공하는 규칙 기반 모델을 사용하여 기능 기반 설명을 분석함으로써, 모델 행동의 완전한 제어와 검증이 가능하도록 함.
- 협동 게임 이론에서 표준적으로 사용하는 공식을 사용해 Shapley 값을 계산함—각 기능이 모든 부분집합을 통해 얻는 마진널 기여도에 기반해 기여도를 할당함.
- 최소 충분한 부분집합(MSS)을 정의함—모델의 예측을 그대로 유지하는 최소 기능 집합을 의미함.
- 동일한 모델 인스턴스에 대해 Shapley 설명과 MSS 설명을 비교함으로써, 기능 중요도와 필수성에 대한 해석의 차이를 대비함.
- 특성 제거 및 기본값 대체를 활용해 부분집합에 대한 모델 출력을 계산함으로써 MSS 평가의 일관성을 확보함.
- 여러 개의 MSS가 존재하는 경우(예: 같은 입력에서 {"good", "very"}과 {"nice"})를 분석함—이 경우 설명기는 이러한 대안을 놓칠 수 있거나 잘못 표현할 수 있음.
실험 결과
연구 질문
- RQ1간단하고 투명한 모델이라도 동일한 모델 예측에 대해 여러 개의 참값 기능 기반 설명이 동시에 존재할 수 있는가?
- RQ2Shapley 값과 최소 충분한 부분집합(MSS)은 각각 어떤 종류의 설명을 추구하는가?
- RQ3Shapley 값과 MSS 설명기법이 모델의 의사결정 과정을 얼마나 완전히 반영하지 못하는가?
- RQ4두 설명 기법을 결합하면 각각 단독으로 사용할 때보다 더 완전한 모델 행동 이해를 가능하게 하는가?
- RQ5여러 개의 유효하고 서로 다른 설명이 동시에 존재할 수 있음에도 불구하고, 단 하나의 참값 설명이 존재한다는 가정이 왜 문제인지?
주요 결과
- 동일한 모델 예측에 대해 여러 개의 참값 기능 기반 설명이 존재할 수 있으며, 예를 들어 입력에서 {"nice"}과 {"good", "very"}는 모두 최소 충분한 부분집합이 될 수 있음.
- Shapley 값은 "good"과 "nice"와 같은 기능에 비영이 아닌 중요도를 할당함으로써 마진널 기여도를 반영하지만, 기능이 개별적으로 충분한지 여부는 밝히지 않음.
- 최소 충분한 부분집합 설명기법은 여러 개의 유효한 부분집합이 존재함에도 불구하고 오직 하나의 부분집합(예: {"nice"})만 반환할 수 있어, 설명이 불완전하거나 편향될 수 있음.
- 중복되거나 상충되는 기능이 존재하는 경우(예: 감성 모델에서 "amazing"과 "bad"), MSS 설명기법은 진정한 의사결정 논리를 왜곡하는 아티팩트를 생성할 수 있음.
- Shapley 값은 기능이 개별적으로 충분한지 여부와 중복 여부를 구분할 수 있음—예를 들어 "nice"가 충분할 때 "good"이 여전히 정보를 제공한다는 것을 보여줄 수 있음.
- Shapley 값과 MSS 설명을 결합하면 더 완전한 이해가 가능해짐—예를 들어 "nice"가 존재할 경우 "good"이 중복되지만, "nice"가 없을 경우 "good"은 여전히 정보를 제공한다는 점을 식별할 수 있음.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.