Skip to main content
QUICK REVIEW

[논문 리뷰] Bayes-TrEx: Model Transparency by Example

Serena Booth, Yilun Zhou|arXiv (Cornell University)|2020. 02. 19.
Adversarial Robustness in Machine Learning참고 문헌 63인용 수 4
한 줄 요약

Bayes-TrEx는 신경망의 해석 가능성 향상을 위해 분포에 맞는 예시를 생성하는 모델에 종속되지 않는 방법이다. 이는 클래스 경계를 시각화하고, 분포 내 적대적 예시를 식별하며, 모델의 과신을暴露한다. 분류기와 데이터 생성기를 결합하여 알려진 신뢰도 수준에서 대표적인 입력을 생성하며, CLEVR, MNIST 및 Fashion-MNIST에서 효과를 입증했다.

ABSTRACT

Post-hoc explanation methods are gaining popularity as tools for interpreting, understanding, and debugging neural networks. Most post-hoc methods explain decisions in response to individual inputs. These individual inputs are typically drawn from the test set; however, the test set may be biased or may only sparsely invoke some model behaviours. To address these challenges, we introduce Bayes-TrEx, a model-agnostic method for generating distribution-conforming examples of known prediction confidence. Using a classifier prediction and a data generator, Bayes-TrEx can be used to visualize class boundaries; to find in-distribution adversarial examples; to understand novel-class extrapolation; and to expose neural network overconfidence. We demonstrate Bayes-TrEx with rendered data (CLEVR) and organic data (MNIST, Fashion-MNIST). Code: this http URL.

연구 동기 및 목표

  • 희소하거나 편향된 테스트 세트 입력에 의존하는 사후 설명 방법의 한계를 해결한다.
  • 개별 테스트 샘플이 아닌 전체 입력 분포에 걸쳐 모델 행동을 시각화할 수 있도록 한다.
  • 알려진 예측 신뢰도 수준에서 생성된 예시를 통해 신경망의 과신을 드러낸다.
  • 분포 내 적대적 예시와 신규 클래스 외삽에 대한 이해를 지원한다.
  • 다양한 데이터 모odal리티(합성 및 실제 세계 데이터 포함)에 적용 가능한 모델에 종속되지 않는 프레임워크를 제공한다.

제안 방법

  • 학습된 분류기와 미분 가능한 데이터 생성기를 활용하여 데이터 분포에 맞는 입력을 합성한다.
  • 베이지안 추론을 사용하여 데이터 생성기를 목표 예측 신뢰도 수준에 조건화하여 생성된 예시가 대표성을 갖도록 보장한다.
  • 변분 추론 프레임워크를 활용해 생성기를 최적화하여 생성된 데이터가 원하는 신뢰도 점수를 확보하도록 한다.
  • 일반화성을 검증하기 위해 합성 데이터(CLEVR)와 실제 세계 데이터(MNIST, Fashion-MNIST)에 모두 이 방법을 적용한다.
  • 다양한 신뢰도 수준에서 예시를 생성함으로써 결정 경계를 시각화하여 모델의 불확실성과 과신을 드러낸다.
  • 결정 경계 근처에서 높은 신뢰도 예측을 하는 입력을 탐색함으로써 분포 내 적대적 예시를 발견할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1알려진 모델 신뢰도 수준을 반영하는 대표성 있는, 분포에 맞는 예시를 생성할 수 있는가?
  • RQ2합성 예시를 사용하여 전체 입력 분포에 걸쳐 결정 경계와 모델 행동을 어떻게 시각화할 수 있는가?
  • RQ3Bayes-TrEx는 높은 신뢰도로 잘못 분류되는 분포 내 적대적 예시를 어느 정도 탐지할 수 있는가?
  • RQ4이 방법은 제어되고 해석 가능한 방식으로 신경망의 과신을 어떻게 드러내는가?
  • RQ5이 접근법은 합성 및 실제 세계 이미지 데이터셋을 포함한 다양한 데이터 모달리티로 일반화 가능한가?

주요 결과

  • Bayes-TrEx는 특정 예측 신뢰도 수준을 달성하면서도 기저 데이터 분포에 맞는 데이터 예시를 성공적으로 생성한다.
  • 다양한 신뢰도 점수 범위에서 입력을 생성함으로써 결정 경계를 명확히 시각화할 수 있다.
  • 높은 신뢰도로 잘못 분류되는 분포 내 적대적 예시를 식별하여 모델의 취약성을 드러낸다.
  • 높은 예측 확률을 갖지만 실제로 잘못된 예시를 생성함으로써 모델의 과신을 효과적으로 드러낸다.
  • 이 방법은 데이터 유형 간에 일반화되며, 합성(CLEVR) 및 실제 세계(MNIST, Fashion-MNIST) 데이터셋 모두에서 유용성을 입증한다.
  • 생성된 예시는 신규 클래스 외삽과 실패 모드를 포함해 모델 행동에 대한 해석 가능한 통찰을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.