[논문 리뷰] Explaining Deep Neural Networks using Unsupervised Clustering
이 논문은 중간 활성화를 비지도 군집화하는 방식으로 원본 DNN에 대한 후행 해석 방법을 제안한다. 여러 층의 표현을 군집화함으로써 유사한 학습 샘플과 학습된 개념을 식별함으로써, 사용자 연구를 통해 모델 신뢰도를 향상시키면서도 원본 DNN의 정밀도를 유지한다.
We propose a novel method to explain trained deep neural networks (DNNs), by distilling them into surrogate models using unsupervised clustering. Our method can be applied flexibly to any subset of layers of a DNN architecture and can incorporate low-level and high-level information. On image datasets given pre-trained DNNs, we demonstrate the strength of our method in finding similar training samples, and shedding light on the concepts the DNNs base their decisions on. Via user studies, we show that our model can improve the user trust in model's prediction.
연구 동기 및 목표
- 층을 가로질러 저수준 및 고수준 표현을 체계적으로 분석함으로써 블랙박스 DNN를 설명하는 데 도전하는 것.
- 아키텍처 수정이나 레이블이 부여된 개념이 필요 없는 후행 설명 프레임워크를 개발하는 것.
- 유사한 학습 샘플을 지원 근거로 제시함으로써 인간의 DNN 예측에 대한 신뢰도를 향상시키는 것.
- 인간이 제공한 개념이나 히وري스틱 유사도 메트릭스에 의존하지 않는 개념 기반 및 샘플 기반 설명 가능성을 제공하는 것.
제안 방법
- 사전 학습된 DNN의 여러 층으로부터 중간 활성화를 추출하고, 레이블 없이도 유사한 표현을 군집화하는 비지도 군집화를 적용한다.
- 군집화된 표현에서 학습함으로써 원본 DNN의 출력을 모방하는 서rogate 모델을 훈련시켜 정밀도를 유지하면서도 해석 가능성을 향상시킨다.
- 군집화 과정은 층을 가로질러 저수준(예: 색상, 질감) 및 고수준(예: 객체 조합, 의미적 내용) 패턴을 모두 포착한다.
- 테스트 샘플과 학습 샘플 간의 유사도는 군집 중심점의 임베딩 공간 내 거리에 의해 결정되며, 이는 샘플 기반 설명을 가능하게 한다.
- 에ncoder-디코더 아키텍처를 사용하여 활성화로부터 군집 할당을 재구성하고 개선함으로써 군집 품질을 향상시킨다.
- 훈련 후 적용되기 때문에 어떤 DNN 아키텍처나 특정 층의 부분집합에도 유연하고 호환된다.
실험 결과
연구 질문
- RQ1중간 DNN 활성화의 비지도 군집화가 의미적 및 시각적으로 유사한 학습 샘플을 효과적으로 식별할 수 있는가?
- RQ2군집 기반 서rogate 모델이 DNN이 학습한 저수준 및 고수준 개념을 어느 정도 포괄할 수 있는가?
- RQ3군집 기반 유사 예시를 제공할 경우, 기준 방법에 비해 인간의 DNN 예측에 대한 신뢰도가 향상되는가?
- RQ4DNN이 완벽하게 정확하지 않은 경우에도, 레이블 기반 필터링(예: 동일한 거시 레이블 또는 세부 레이블)에 비해 이 방법이 사용자 인식 유사도와 신뢰도에서 뛰어난가?
- RQ5군집 기반 분산을 사용할 경우, 서rogate 모델의 정밀도가 원본 DNN와 비교해 어떻게 되는가?
주요 결과
- CIFAR-100에서 제안된 방법은 서rogate 모델 정확도 0.51과 정밀도 0.61을 달성하여 원본 DNN와 강한 일치를 보였다.
- 18명의 참가자가 참여한 사용자 연구에서, 이 방법은 316次 시험 중 130회에서 가장 유사한 학습 이미지를 선택하여, 최근접 이웃 및 레이블 기반 필터링을 뛰어넘었다.
- 자석 타일 결함 데이터셋에서, 같은 예측된 거시 레이블 내 유사 예시를 제공함으로써 사용자 신뢰도를 향상시켰다(평균 점수 3.91 ± 0.24), 기준 방법을 초월했다.
- 테스트 이미지의 세부 레이블에 접근할 수 없는 상황에서도(훈련 시 사용되지 않음), 이 방법은 신뢰도 점수에서 레이블 기반 필터링을 뛰어넘었으며, 이는 강건성과 일반화 능력을 보여준다.
- 군집된 개념은 저수준 특징(예: 색상 팔레트)과 고수준 의미 패턴(예: 거시 레이블보다 더 세밀한 결함 유형)을 모두 드러내어 다층적 해석 가능성을 입증했다.
- 원본 DNN가 테스트 이미지를 잘못 분류한 경우에도 관련 학습 샘플을 성공적으로 식별함으로써, 실제 환경에서의 신뢰성과 타당성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.