Skip to main content
QUICK REVIEW

[논문 리뷰] Interactive Naming for Explaining Deep Neural Networks: A Formative Study

Mandana Hamidi‐Haines, Zhongang Qi|arXiv (Cornell University)|2018. 12. 18.
Explainable Artificial Intelligence (XAI)인용 수 8
한 줄 요약

이 논문은 깊이 신경망의 활성화 맵에서 주목할 만한 활성화를 식별하기 위해 경량 설명 네트워크(xNN)를 사용하는 인간-중심의 상호작용적 이름 지정 방법을 제안한다. 이를 통해 인간 분석자가 이러한 특징을 군집화하고 이해할 수 있는 시각적 개념으로 이름 지을 수 있으며, 이는 이미지 분류 작업에서 모델의 해석 가능성 향상에 기여한다. 연구 결과, 분석자 간 높은 일致도와 강한 의미적 커버리지가 입증되었으며, 대부분의 활성화가 인식 가능한 시각적 개념과 관련되어 있음을 보여주었다.

ABSTRACT

We consider the problem of explaining the decisions of deep neural networks for image recognition in terms of human-recognizable visual concepts. In particular, given a test set of images, we aim to explain each classification in terms of a small number of image regions, or activation maps, which have been associated with semantic concepts by a human annotator. This allows for generating summary views of the typical reasons for classifications, which can help build trust in a classifier and/or identify example types for which the classifier may not be trusted. For this purpose, we developed a user interface for "interactive naming," which allows a human annotator to manually cluster significant activation maps in a test set into meaningful groups called "visual concepts". The main contribution of this paper is a systematic study of the visual concepts produced by five human annotators using the interactive naming interface. In particular, we consider the adequacy of the concepts for explaining the classification of test-set images, correspondence of the concepts to activations of individual neurons, and the inter-annotator agreement of visual concepts. We find that a large fraction of the activation maps have recognizable visual concepts, and that there is significant agreement between the different annotators about their denotations. Our work is an exploratory study of the interplay between machine learning and human recognition mediated by visualizations of the results of learning.

연구 동기 및 목표

  • 이미지 인식에서 깊이 신경망의 결정을 해석 가능하게 하기 위해 모델의 활성화를 인간이 이해할 수 있는 시각적 개념과 연결하는 것.
  • 인간 분석자가 DNN의 핵심 뉴런 활성화 맵으로부터 의미 있는 시각적 개념을 일관되게 식별하고 이름 지을 수 있는지 조사하는 것.
  • 상호작용적 군집화를 통한 활성화 맵에서 유도된 의미적 설명의 질과 분석자 간 일致도를 평가하는 것.
  • 인간이 생성한 시각적 개념을 기반으로 테스트 세트 전반의 모델 행동을 요약하는 데의 가능성을 탐색하는 것.
  • 향후 DNN 설명 분야에서의 주도적 학습 및 상호작용적 개념 학습에 기초를 마련하는 것.

제안 방법

  • 원래 DNN에 'X-특징'으로 구성된 훨씬 작은 마지막 전 단계 레이어를 가진 희박한 설명 네트워크(xNN)를 추가하여 DNN의 예측을 모방하도록 한다.
  • 각 테스트 이미지에 대해 xNN의 가장 영향력이 큰 뉴런이 있는 마지막 전 단계 레이어에서 주목할 만한 활성화 맵을 추출한다.
  • 특정 카테고리의 테스트 이미지 전반에 걸쳐 모든 X-특징의 활성화 맵을 표시하는 상호작용형 사용자 인터페이스를 설계하여, 군집화와 이름 지정이 자유롭게 가능하도록 한다.
  • 분석자가 시각적 유사성과 의미적 일관성에 따라 활성화 맵을 그룹화, 이름 변경, 병합, 삭제 또는 미군집 상태로 유지할 수 있도록 한다.
  • 결과적으로 생성된 이름이 부여된 군집(시각적 개념)을 사용하여 테스트 세트 예측에 대한 인간이 읽을 수 있는 설명을 생성한다.
  • 분석자 간 일치도, 커버리지, 언어적 이름과의 자동 매칭을 통해 이름 지정의 질을 평가한다.

실험 결과

연구 질문

  • RQ1RQ1: 주목할 만한 활성화 맵 중 얼마나 많은 비율이 인간 분석자에 의해 의미 있게 이름 지어질 수 있는가?
  • RQ2RQ2: 서로 다른 분석자가 시각적 개념을 식별하고 군집화하는 데 있어 이름 지정이 얼마나 일관된가?
  • RQ3RQ3: 분석자가 식별한 시각적 개념이 네트워크 내 실제 뉴런 활성화와 어느 정도 일치하는가?
  • RQ4RQ4: 자동 매칭 시스템이 서로 다른 분석자가 지정한 이름 간의 매칭을 얼마나 잘 수행하는가?
  • RQ5RQ5: 도출된 시각적 개념을 사용하여 테스트 세트에서 모델 행동에 대한 의미 있는 고수준 요약을 만들 수 있는가?

주요 결과

  • 카테고리 'a'의 테스트 세트 예측 중 56% 이상이 시각적 개념 쌍('eye', 'close wing')에 의해 설명되었으며, 이는 해당 영역에 대한 강한 집중을 시사한다.
  • 카테고리 'l'의 경우, 예측의 88% 이상이 단일 개념 'eye'에 의해 설명되었으며, 이는 모델이 분류에 있어 이 요소에 크게 의존하고 있음을 나타낸다.
  • 활동을 이름 지을 것인지에 대한 분석자 간 일치도가 높았으며, 전반적인 평균 F1 스코어가 0.57로 나타나 의미 있는 군집화에 대해 강한 공감대가 있음을 보여준다.
  • 자동으로 생성된 매칭과 인간 분석자가 지정한 이름 간 평균 일치도가 전반적인 평균에서 F1 스코어 0.978로 매우 높게 나타나 인간의 의미 체계와 강한 일치를 보였다.
  • 의미 있는 이름이 할당된 활성화 맵의 비율이 상당히 높았으며(평균 50% 이상), 대부분의 테스트 이미지에 대해 부분적인 의미적 설명이 가능했다.
  • 일부 불일치가 있었음에도 불구하고 대부분의 시각적 개념이 분석자 간에 일관되게 식별되었으며, 이는 상호작용적 이름 지정 과정의 강건성과 신뢰성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.