Skip to main content
QUICK REVIEW

[논문 리뷰] Explaining in Style: Training a GAN to explain a classifier in StyleSpace

Oran Lang, Yossi Gandelsman|arXiv (Cornell University)|2021. 04. 27.
Generative Adversarial Networks and Image Synthesis참고 문헌 37인용 수 10
한 줄 요약

StylEx는 이미지 분류기의 결정을 설명하기 위해, 분류기 특화의, 분리된 특성들을 스타일스페이스에서 생성하는 스타일GAN을 훈련시킨다. 이 특성들은 제어 가능한, 인간이 이해할 수 있는 가상의 반대 사례를 제공한다. 분류기 기울기 정보를 기반으로 GAN 훈련을 조건화함으로써, 눈 모양, 귀 자세 등 의미 있는 특성들을 발견하며, 이는 상위 10개 특성으로 연령 및 성별 분류기에서 최대 93.9%의 전환률을 달성한다.

ABSTRACT

Image classification models can depend on multiple different semantic attributes of the image. An explanation of the decision of the classifier needs to both discover and visualize these properties. Here we present StylEx, a method for doing this, by training a generative model to specifically explain multiple attributes that underlie classifier decisions. A natural source for such attributes is the StyleSpace of StyleGAN, which is known to generate semantically meaningful dimensions in the image. However, because standard GAN training is not dependent on the classifier, it may not represent these attributes which are important for the classifier decision, and the dimensions of StyleSpace may represent irrelevant attributes. To overcome this, we propose a training procedure for a StyleGAN, which incorporates the classifier model, in order to learn a classifier-specific StyleSpace. Explanatory attributes are then selected from this space. These can be used to visualize the effect of changing multiple attributes per image, thus providing image-specific explanations. We apply StylEx to multiple domains, including animals, leaves, faces and retinal images. For these, we show how an image can be modified in different ways to change its classifier output. Our results show that the method finds attributes that align well with semantic ones, generate meaningful image-specific explanations, and are human-interpretable as measured in user-studies.

연구 동기 및 목표

  • 딥 뷰 이미지 분류기의 인간이 이해할 수 있는, 다중 특성의 가상 반대 사례 설명이 부족한 문제를 해결하기 위해.
  • 생성 모델의 잠재공간에서 분류기 결정에 직접적인 영향을 미치는 분리된, 의미 있는 특성을 발견하기 위해.
  • 하나의 특성만 수정하는 방식으로 이미지 기반의 설명을 가능하게 하기 위해.
  • 의료 영상 및 자율주행 시스템과 같은 고위험 분야에서 분리된, 분류기 인지 기반의 생성을 통해 모델의 해석 가능성을 향상시키기 위해.

제안 방법

  • 사전 훈련된 분류기의 기울기를 통합한 조건부 손실을 사용하여, 생성기의 스타일스페이스가 분류기 관련 특성과 일치하도록 스타일GAN을 훈련시킨다.
  • 기울기 기반의 시각화를 통해 특정 입력 이미지의 분류기 출력에 영향을 미치는 가장 영향력 있는 스타일스페이스 좌표를 식별한다.
  • 다른 좌표는 그대로 두고 개별 스타일스페이스 좌표를 변형하여, 특성 효과를 제어적으로 시각화할 수 있는 가상의 반대 이미지를 생성한다.
  • 두 부분으로 나누어진 사용자 연구를 통해 특성의 독립성과 일관성을 평가한다: (1) 이미지 쌍에서 특성 식별, (2) 애니메이션된 특성 변화 기술.
  • 상위-k 특성을 수정했을 때 분류기 예측이 얼마나 자주 뒤바뀌는지 측정함으로써 특성의 충분성을 측정한다.
  • 모드 붕괴를 방지하고, 특히 망막 영상과 같은 미세한 도메인에서 특성이 분류기와 관련성이 있도록 분류기 특화 훈련 구성요소(CST)를 도입한다.

실험 결과

연구 질문

  • RQ1생성 모델의 잠재공간에서 분류기 결정에 직접적인 영향을 미치는 분리된, 의미 있는 특성을 발견하기 위해, 이를 훈련시킬 수 있는가?
  • RQ2이러한 특성들을 사용하여, 시각적으로 일관되고 인간이 이해할 수 있는 가상의 반대 사례를 생성할 수 있는가?
  • RQ3분류기 특화 훈련 구성요소는 저해상도 도메인에서 특성의 관련성과 모델 성능을 어떻게 향상시키는가?
  • RQ4발견된 특성들이 의료 및 세밀한 시각 분류 카테고리 포함 다양한 이미지 도메인에서 분류기 결정을 어느 정도 설명할 수 있는가?

주요 결과

  • StylEx는 매우 일관되고 독립적인 특성을 발견한다: 사용자들이 인식된 성별에 대해 상위 6개 특성을 96%의 정확도로 식별했고, 인식된 연령에 대해선 98.3%의 정확도를 기록했다.
  • Wu 등과 같은 기준 기법보다 특성의 일관성에서 뚜렷한 우월성을 보였다. 고양이/개 도메인에선 93.3%, 인식된 연령에선 98.3%의 정확도를 기록했다.
  • StylEx는 상위 10개 특성만으로도 인식된 연령 분류기에서 93.9%의 전환률을 달성했고, Wu 등은 16.9%에 그쳤다. 이는 특성의 충분성에서 뚜렷한 슈퍼리오리티를 보여준다.
  • 망막 도메인에서는 StylEx가 상위 10개 특성으로 100%의 전환률을 기록했고, 분류기 특화 훈련(CST)이 없는 기준 기법은 완전히 실패(0% 전환률)했다. 이는 CST의 필수성을 입증한다.
  • 식물 도메인에서는 StylEx가 91.2%의 전환률을 기록했고, Wu 등은 14.6%에 그쳤으며, 사용자 연구 결과 StylEx의 특성은 더 일관되고 시각적으로 뚜렷하게 인식됨을 확인했다.
  • 사용자 연구 결과 StylEx의 특성은 단지 독립적이기만 한 것이 아니라, 시각적으로도 두드러진다: 고양이/개 도메인에선 상위 특성을 93.3%의 정확도로 식별했고, 인식된 연령에 대해선 상위 좌표를 설명할 때 100%의 사용자가 '안경'을 언급했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.