Skip to main content
QUICK REVIEW

[논문 리뷰] On Dropout, Overfitting, and Interaction Effects in Deep Neural Networks

Ben Lengerich, Eric P. Xing|arXiv (Cornell University)|2021. 05. 04.
Adversarial Robustness in Machine Learning참고 문헌 3인용 수 12
한 줄 요약

이 논문은 드롭아웃이 드롭아웃 하에서의 생존 확률을 지수적으로 감소시킴으로써 고차 상호작용을 내재적으로 정규화함을 밝혀내며, 이는 복잡한 상호작용에 대한 선택적 정규화를 이끈다. 입력 드롭아웃에 대해 이는 해석적으로 증명되었고, 활성화 드롭아웃에 대해선 경험적으로 확인되었으며, 허위 고차 상호작용을 억제하기 위해 더 높은 드롭아웃 비율이 필요하며, 무한한 데이터가 있더라도 드롭아웃 기반의 기여도 측정 방법은 편향이 있음을 보여준다.

ABSTRACT

We examine Dropout through the perspective of interactions. Given N variables, there are O(N2) possible pairwise interactions, O(N3) possible 3-way interactions, i.e. O(Nk) possible interactions of k variables. Conversely, the probability of an interaction of k variables surviving Dropout at rate p is O((1−p)k). In this paper, we show that these rates cancel, and as a result, Dropout selectively regularizes against learning higher-order interactions. We prove this new perspective analytically for Input Dropout and empirically for Activation Dropout. This perspective on Dropout has several practical implications: (1) higher Dropout rates should be used when we need stronger regularization against spurious high-order interactions, (2) caution must be used when interpreting Dropout-based feature saliency measures, and (3) networks trained with Input Dropout are biased estimators, even with infinite data. We also compare Dropout to regularization via weight decay and early stopping and find that it is difficult to obtain the same regularization against high-order interactions with these methods.

연구 동기 및 목표

  • 특징 상호작용 정규화의 관점에서 드롭아웃의 인덕티브 바이어스를 이해하기 위해.
  • 드롭아웃 비율이 k차 상호작용의 생존 확률에 미치는 영향을 분석하기 위해.
  • 이 상호작용 바이어스가 모델의 해석 가능성과 훈련에 미치는 실용적 영향을 평가하기 위해.
  • 드롭아웃의 고차 상호작용 정규화 효과를 가중치 감소와 조기 정지와 비교하기 위해.

제안 방법

  • 조합 확률를 사용한 입력 드롭아웃 하에서의 상호작용 생존 확률 이론적 분석.
  • 드롭아웃 하에서 k차 상호작용의 O((1−p)^k) 생존율 유도.
  • 통제된 실험을 통한 활성화 드롭아웃에서의 상호작용 정규화 효과 경험적 검증.
  • 상호작용 복잡성에 따라 드롭아웃, 가중치 감소, 조기 정지의 정규화 효과 비교.
  • 특징 기여도 분석을 통한 드롭아웃 기반 할당 방법의 편향 평가.
  • 입력 드롭아웃이 무한한 데이터가 있더라도 편향된 추정기로 이어진다는 수학적 증명.

실험 결과

연구 질문

  • RQ1딥 네트워크에서 드롭아웃이 k차 상호작용의 생존 확률에 어떻게 영향을 미치는가?
  • RQ2드롭아웃이 저차 상호작용에 비해 고차 상호작용을 얼마나 선택적으로 정규화하는가?
  • RQ3가중치 감소나 조기 정지는 드롭아웃만큼 고차 상호작용에 대해 동일한 수준의 정규화를 달성할 수 있는가?
  • RQ4드롭아웃이 유도하는 상호작용 바이어스는 특징 기여도 해석의 신뢰성에 어떻게 영향을 미치는가?
  • RQ5무한한 데이터 하에서 입력 드롭아웃으로 훈련된 모델은 일致 추정기인가?

주요 결과

  • 드롭아웃 하에서 k차 상호작용의 생존 확률은 O((1−p)^k)이며, 이는 고차 상호작용의 지수적 억제를 이끈다.
  • 허위 고차 상호작용을 억제하기 위해 더 높은 드롭아웃 비율이 필요하다.
  • 무한한 훈련 데이터가 있더라도 드롭아웃 기반의 특징 기여도 측정 방법은 편향된 추정기이다.
  • 입력 드롭아웃으로 훈련된 네트워크는 상호작용 억제 효과로 인해 편향된 추정기이다.
  • 가중치 감소와 조기 정지는 드롭아웃만큼 고차 상호작용에 대해 동일한 수준의 정규화를 달성하지 못한다.
  • 드롭아웃의 상호작용 정규화 효과는 입력 드롭아웃에 대해 해석적으로 증명 가능하며, 활성화 드롭아웃에선 경험적으로 관찰 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.