[논문 리뷰] ELUDE: Generating interpretable explanations via a decomposition into labelled and unlabelled features
ELUDE는 딥러닝 모델 예측을 해석 가능한 의미적 속성과 레이블이 없는 저차원 특성으로 분해하는 새로운 설명 프레임워크로, 전역적이고 국소적인 설명을 모두 가능하게 한다. 이는 오직 8~16개의 추가 레이블이 없는 특성만으로도 모델 예측의 80% 이상을 설명할 수 있음을 보여주며, 'bowling alleys'와 'castle-like buildings'와 같은 새로운 시각적 개념을 드러내어 모델 결정에 핵심적인 영향을 미친다.
Deep learning models have achieved remarkable success in different areas of machine learning over the past decade; however, the size and complexity of these models make them difficult to understand. In an effort to make them more interpretable, several recent works focus on explaining parts of a deep neural network through human-interpretable, semantic attributes. However, it may be impossible to completely explain complex models using only semantic attributes. In this work, we propose to augment these attributes with a small set of uninterpretable features. Specifically, we develop a novel explanation framework ELUDE (Explanation via Labelled and Unlabelled DEcomposition) that decomposes a model's prediction into two parts: one that is explainable through a linear combination of the semantic attributes, and another that is dependent on the set of uninterpretable features. By identifying the latter, we are able to analyze the "unexplained" portion of the model, obtaining insights into the information used by the model. We show that the set of unlabelled features can generalize to multiple models trained with the same feature space and compare our work to two popular attribute-oriented methods, Interpretable Basis Decomposition and Concept Bottleneck, and discuss the additional insights ELUDE provides.
연구 동기 및 목표
- 복잡한 딥러닝 모델을 완전히 포괄하지 못하는 속성 기반 설명의 한계를 해결한다.
- 사용 가능한 의미적 속성 외부의 모델 예측에서 설명되지 않은 구성 요소를 식별하고 분석한다.
- 모델 행동을 해석 가능한 부분과 해석할 수 없는 부분으로 분해함으로써 전역적 설명을 가능하게 하는 방법을 개발한다.
- 적은 수의 레이블이 없는 특성이 속성 중심 접근법을 초월해 모델 설명을 크게 향상시킬 수 있음을 입증한다.
- 레이블이 없는 특성 공간이 동일한 특성 공간에서 학습된 모델 간에 일반화되는가를 보여준다.
제안 방법
- 블랙박스 모델의 행동을 시뮬레이션하기 위해 알려진 의미적 속성에 기반한 선형 분류기를 훈련한다.
- 블랙박스 모델의 특성 공간에서 랭크가 낮은 부분공간을 투영하여 설명되지 않은 구성 요소를 포착한다.
- 속성 기반 설명과 랭크가 낮은 특성 표현을 결합하여 전체 예측을 재구성한다.
- 시각화와 활성도 분석을 통해 레이블이 없는 특성 공간 내 각 차원의 의미를 해석한다.
- 표준 ResNet18과 CUB 및 Places365 데이터셋에서의 개념 버블넥 모델에 프레임워크를 적용한다.
- 동일한 데이터 분포에서 학습된 다수의 모델 간에 공통의 낮은 랭크 부분공간을 학습함으로써 일반화 성능을 평가한다.
실험 결과
연구 질문
- RQ1의미적 속성만으로 복잡한 딥러닝 모델의 예측을 어느 정도 설명할 수 있는가?
- RQ2기존에 알려진 속성을 고려한 후에도 남은 모델 행동을 설명하기 위해 몇 개의 레이블이 없는 특성이 필요한가?
- RQ3레이블이 없는 특성 공간에서 도출된 시각적 개념은 무엇이며, 그것들은 의미적으로 유의미한가?
- RQ4한 모델에서 학습된 낮은 랭크의 레이블이 없는 특성 공간이 동일한 데이터에서 학습된 다른 모델의 설명에 일반화되는가?
- RQ5표준 모델과 개념 버블넥과 같은 설계 시부터 해석 가능한 모델 간에 속성 기반 설명의 성능는 어떻게 비교되는가?
주요 결과
- Places365의 365-way 스코어 분류 모델에서, 레이블이 없는 특성 공간의 8개 차원만으로도 예측의 80% 이상을 설명할 수 있다.
- CUB 데이터셋에서, 개념 버블넥 모델의 예측 중 80% 이상을 설명하기 위해 16차원의 레이블이 없는 특성 공간이 충분하다.
- ELUDE가 식별한 10개의 핵심 속성 중 평균적으로 10개의 클래스당 2개만 원래 개념 버블넥 모델의 결과와 겹친다.
- 레이블이 없는 특성 공간에서 높은 활성도를 보이는 이미지를 시각화하면 'bowling alleys'와 'castle-like buildings'와 같은 의미 있는 개념이 드러난다.
- 레이블이 없는 특성 공간은 모델 간에 일반화된다: 동일한 특성 공간에서 학습된 새로운 모델을 설명하기 위해 공통의 낮은 랭크 부분공간을 학습하고 활용할 수 있다.
- 표준 ResNet18 모델은 개념 버블넥 모델보다 속성에 의존도가 낮으며, 속성만으로는 예측의 26.6%만 설명 가능하고, 설명의 상한선에 도달하기 위해 최대 랭크 32가 필요하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.