Skip to main content
QUICK REVIEW

[논문 리뷰] Diversity inducing Information Bottleneck in Model Ensembles

Samarth Sinha, Homanga Bharadhwaj|arXiv (Cornell University)|2020. 03. 10.
Adversarial Robustness in Machine Learning참고 문헌 46인용 수 12
한 줄 요약

이 논문은 DIBS(Diversity-Inducing Information Bottleneck in Model Ensembles)를 제안하며, 예측 가능성 확률, 정보 볼트저스트 규제, 그리고 스토하스틱 잠재 변수에서의 적대적 다양성에 대해 공동 최적화함으로써 딥 앙상블 성능을 향상시킵니다. 공유 인코더와 K개의 스토하스틱 디코더 헤드에 적대적 다양성 손실을 적용함으로써 DIBS는 MNIST, CIFAR100, TinyImageNet, Places2에서 10퍼센트 이상의 상대적 정확도 향상, 데이터셋 이동 상황에서 5퍼센트 이상의 일반화 향상, 그리고 우수한 OOD 탐지 성능을 달성합니다.

ABSTRACT

Although deep learning models have achieved state-of-the-art performance on a number of vision tasks, generalization over high dimensional multi-modal data, and reliable predictive uncertainty estimation are still active areas of research. Bayesian approaches including Bayesian Neural Nets (BNNs) do not scale well to modern computer vision tasks, as they are difficult to train, and have poor generalization under dataset-shift. This motivates the need for effective ensembles which can generalize and give reliable uncertainty estimates. In this paper, we target the problem of generating effective ensembles of neural networks by encouraging diversity in prediction. We explicitly optimize a diversity inducing adversarial loss for learning the stochastic latent variables and thereby obtain diversity in the output predictions necessary for modeling multi-modal data. We evaluate our method on benchmark datasets: MNIST, CIFAR100, TinyImageNet and MIT Places 2, and compared to the most competitive baselines show significant improvements in classification accuracy, under a shift in the data distribution and in out-of-distribution detection. Code will be released in this url https://github.com/rvl-lab-utoronto/dibs

연구 동기 및 목표

  • 데이터셋 이동 상황에서 베이지안 신경망과 무작위 앙상블의 일반화 능력에 한계가 있음을 해결하기 위해.
  • 앙상블 예측에서 다양하고 타당한 가설을 명시적으로 장려함으로써 예측 불확실성 추정을 향상시키기 위해.
  • 랜덤 가중치 초기화나 사전 분포 가정에 의존하지 않고도 높은 가능성과 다양성을 균형 잡는 스케일러블하고 원리에 기반한 앙상블 방법을 개발하기 위해.
  • 통제된 정보 흐름과 다양성 강화를 통해 고차원 입력(예: 이미지)에서 다중 모드 데이터 분포를 효과적으로 모델링할 수 있도록 하기 위해.

제안 방법

  • 공유 결정론적 인코더가 입력 X를 공유 잠재 변수 Z로 매핑하여 앙상블 구성원 간의 공유 표현 학습을 가능하게 합니다.
  • K개의 스토하스틱 디코더 헤드가 Z를 K개의 별개의 출력 Yi로 매핑하며, 각각은 고유한 예측을 가지는 별개의 앙상블 모델을 나타냅니다.
  • 다른 디코더 헤드의 예측 간 이질성을 극대화하기 위해 적대적 다양성 손실이 적용되어, 서로 다른 가설을 촉진합니다.
  • 각 잠재 디코더 변수 Z̃i와 입력 X 간의 상호정보량을 최소화함으로써 정보 볼트저스트 제약 조건이 적용되어 관련 통계만 유지됩니다.
  • 학습 목표는 데이터 가능성 최대화, 적대적 손실에 의한 다양성 최대화, 정보 볼트저스트 규제를 공동으로 최적화합니다.
  • 이 방법은 임의의 잠재 변수 모델에 일반적으로 적용 가능하며, 다양성 확보에 랜덤 초기화에 의존하지 않습니다.

실험 결과

연구 질문

  • RQ1앙상블 모델에서 명시적인 다양성 유도가 데이터셋 이동 상황에서의 일반화 및 OOD 탐지 향상에 기여할 수 있는가?
  • RQ2정보 볼트저스트 규제와 적대적 다양성 손실을 조합하면 랜덤 초기화나 베이지안 방법보다 더 나은 예측 불확실성 추정을 이끌 수 있는가?
  • RQ3공유 인코더와 다수의 스토하스틱 디코더를 갖춘 방법이 표준 앙상블보다 정확도와 다양성 측면에서 뛰어나면서도 스케일러블한가?
  • RQ4제안된 방법이 다중 모드 데이터 분포를 모델링하는 데 있어 MC-dropout 및 베이지안 신경망과 비교해 어떻게 성능을 냅니다?

주요 결과

  • DIBS는 MNIST, CIFAR100, TinyImageNet, MIT Places 2에서 최신 기준 모델 대비 10퍼센트 이상의 상대적 정확도 향상을 달성합니다.
  • 데이터셋 이동 상황에서 5퍼센트 이상의 상대적 일반화 향상이 나타나 분포 이동에 대한 강건성을 보여줍니다.
  • DIBS는 OOD 탐지 성능을 향상시켜 AUROC 및 AUPR 측정 기준으로 5퍼센트 이상의 예측 불확실성 추정 향상을 보입니다.
  • 적대적 다양성 손실은 예측 가능성 확률이나 일반화 능력을 떨어뜨리지 않으면서도 의미 있는 예측 다양성을 효과적으로 촉진합니다.
  • 정보 볼트저스트 제약 조건은 예측 간 과도한 분산을 방지하여 다양성이 예측 정밀도와 균형을 이루도록 보장합니다.
  • 모든 벤치마크 데이터셋에서 AUROC 및 AUPR 지표에서 DIBS는 무작위 앙상블과 NCP 기준 모델을 모두 압도합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.