[논문 리뷰] Can I trust you more? Model-Agnostic Hierarchical Explanations
Mahé는 딥 뉴럴 네트워크와 같은 블랙박스 모델의 상호작용에 대해 계층적이고 맥락에 의존하는, 그리고 맥락에 무관한 설명을 생성하는 모델에 종속되지 않는 프레임워크를 제안한다. 국소적 편향과 신경망 피팅을 조합하여 상호작용을 탐지하고, 일관된 국소적 상호작용을 일반화하여 전역적이고 맥락에 무관한 행동을 식별함으로써, Mahé는 국소적 상호작용 해석에서 최신 기법들을 능가하며, 성능 저하 없이 맥락에 무관한 상호작용을 식별하고 편집하는 데 있어 최초로 이를 실현한다.
Interactions such as double negation in sentences and scene interactions in images are common forms of complex dependencies captured by state-of-the-art machine learning models. We propose Mahé, a novel approach to provide Model-agnostic hierarchical éxplanations of how powerful machine learning models, such as deep neural networks, capture these interactions as either dependent on or free of the context of data instances. Specifically, Mahé provides context-dependent explanations by a novel local interpretation algorithm that effectively captures any-order interactions, and obtains context-free explanations through generalizing context-dependent interactions to explain global behaviors. Experimental results show that Mahé obtains improved local interaction interpretations over state-of-the-art methods and successfully explains interactions that are context-free.
연구 동기 및 목표
- 최신 기술인 딥 뉴럴 네트워크와 같은 모델이 포착한 복잡한 종속성—특히 상호작용—에 대한 설명이 부족한 문제를 해결하기 위해.
- 특정 인스턴스에 종속되는 표현(인스턴스별)과 전역적이고 인스턴스 간 불변인 표현(맥락에 무관)을 구분하기 위해.
- 편향과 비선형 피팅을 사용하여 특성 상호작용의 정확하고 계층적인 국소적 설명을 제공하는 방법을 개발하기 위해.
- 국소적 상호작용을 전역적이고 맥락에 무관한 설명으로 일반화하여 모델 내에서 불변 행동 패턴을 드러내기 위해.
- 특정 상호작용 위치에서 모델 행동를 수정할 수 있도록 하여 성능 저하를 최소화하는 모델 편집을 가능하게 하기 위해.
제안 방법
- Mahé는 데이터 인스턴스 주변의 국소적 편향을 사용하여 서rogate 예측을 생성하고, 이를 비선형 결정 경계를 포착하기 위해 신경망으로 피팅하여 상호작용을 탐지한다.
- 다중 수준에서 그룹 기반 특성 상호작용을 표현하기 위해 계층적 해석 형식을 사용하며, 상호작용별 할당 점수를 시각화한다.
- 맥락에 무관한 설명을 위해, 여러 데이터 인스턴스를 통해 일관된 상호작용 패턴을 일반화하여 국소적 상호작용이 전역적으로 어떻게 행동하는지 식별한다.
- 특정 상호작용 위치에서 모델 행동를 수정하기 위한 미분 가능한 목적함수를 사용하여, 성능 저하를 최소화하면서 타겟된 편집을 가능하게 한다.
- 특징 공간 내 고차원 상호작용을 식별하기 위해 수정된 NID(비선형 상호작용 탐지) 알고리즘을 적용한다.
- 피팅된 서rogate 모델의 할당 점수를 활용하여 상호작용의 극성과 크기를 계층적 형식으로 순위 매기고 시각화한다.
실험 결과
연구 질문
- RQ1선형 근사 대비 비선형 서rogate 모델을 사용함으로써 복잡한 모델에서 국소적 상호작용 해석의 정확도를 향상시킬 수 있는가?
- RQ2모든 데이터 인스턴스에 걸쳐 일관되게 나타나는, 즉 맥락에 무관한 상호작용을 식별할 수 있으며, 그 행동 일관성은 어떠한가?
- RQ3딥 러닝 모델에서 맥락에 무관한 상호작용을 성능 저하 없이 편집할 수 있는가?
- RQ4다양한 데이터 모odalities에서 맥락에 의존하는 상호작용과 맥락에 무관한 상호작용은 모델 예측에 기여하는 방식에서 어떻게 다를까?
- RQ5계층적 설명은 자연어 처리, 비전, 유전체학 작업에서 복잡한 다중 수준 종속성을 얼마나 잘 드러낼 수 있는가?
주요 결과
- Mahé는 선형 LIME보다 더 높은 R² 피팅 스코어(최대 0.926)를 달성하여 비선형 상호작용을 더 잘 모델링함을 입증했다. 반면 LIME의 최대 R²는 0.621이었다.
- 감성 분류 작업에서 Mahé는 'not bad'라는 맥락에 무관한 상호작용이 일관되게 긍정적임을 정확히 식별했으며, 인스턴스 간 할당 극성이 유지되었다.
- Transformer 모델에서 맥락에 무관한 'cet' 상호작용의 극성을 뒤집기 위해 편집한 후 BLEU 점수는 오직 -2.7% 감소하여 성능 저하가 최소화됨을 보였다.
- DNA-CNN의 경우, 6방향 CACGTG 모티프 상호작용의 94개 검출 결과 모두 DNA-단백질 친화도에 대해 양의 할당 점수를 보였고, 코사인 거리 σ = 0.35 및 σ′ = 0.408로 편집 후 극성이 성공적으로 반전되었다.
- ResNet152에서는 코사인 거리 σ = 0.4 및 σ′ = 0.663로 맥락에 무관한 상호작용이 탐지되었지만, 슈퍼픽셀 세분화에서 발생한 아티팩트로 인해 설명의 해석성이 저하되었다.
- 프레임워크는 자연어 처리(Sentiment-LSTM) 및 비전(ResNet152) 작업 모두에서 계층적 상호작용 할당을 성공적으로 시각화했으며, 색상 코딩된 극성으로 긍정적( cyan) 또는 부정적(빨강) 기여를 나타냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.