Skip to main content
QUICK REVIEW

[논문 리뷰] Pushing the bounds of dropout

Gábor Melis, Charles Blundell|arXiv (Cornell University)|2018. 05. 23.
Topic Modeling참고 문헌 23인용 수 12
한 줄 요약

이 논문은 드롭아웃 훈련을 동일한 하한값을 가진 조건부 모델의 가족에 대한 MAP 추정으로 재해석한다. 이는 결정론적 드롭아웃—일반적으로 근사치로 여겨지는 것—이 실제로 진짜 목표 함수에 대한 가장 날카롭고 정확한 근사치임을 보여주며, 최적의 소프트맥스 온도 조정과 결합할 경우 언어 모델링에서 최고 성능을 낸다.

ABSTRACT

We show that dropout training is best understood as performing MAP estimation concurrently for a family of conditional models whose objectives are themselves lower bounded by the original dropout objective. This discovery allows us to pick any model from this family after training, which leads to a substantial improvement on regularisation-heavy language modelling. The family includes models that compute a power mean over the sampled dropout masks, and their less stochastic subvariants with tighter and higher lower bounds than the fully stochastic dropout objective. We argue that since the deterministic subvariant's bound is equal to its objective, and the highest amongst these models, the predominant view of it as a good approximation to MC averaging is misleading. Rather, deterministic dropout is the best available approximation to the true objective.

연구 동기 및 목표

  • 드롭아웃의 해석과 평가에 대한 모호함을 해결하는 이론적 기반을 제공하는 것.
  • 드롭아웃 훈련에서 유도된 모델 가족 내에서 가장 높은 성능을 보이는 모델을 식별하는 것.
  • 훈련 후 최적의 추론 방법을 선택하여 언어 모델링의 일반화 성능을 향상시키는 것.
  • 편의적 평가 방법을 대체할 수 있는 원리적이고 조정 가능한 소프트맥스 온도 기반 접근법을 도입하는 것.

제안 방법

  • 각기 다른 드롭아웃 마스크를 통해 예측를 집계하는 방식에 대응하는 조건부 모델의 가족에 대한 MAP 추정으로 드롭아웃을 재구성한다.
  • 표준 드롭아웃 목표 함수가 이 가족 내 모든 모델에 대해 공통의 하한값임을 도출하며, 결정론적 변형이 가장 날카로운 하한값을 가짐을 보여준다.
  • 모델 평가에 힘의 평균(예: 산술 평균, 기하 평균, 결정론적 평균)을 사용하고 추론 시 가장 높은 성능을 보이는 것을 선택한다.
  • 최적 모델의 편향을 근사하기 위해 테스트 시 온도 조정이 적용된 소프트맥스를 도입하여 효율적인 하이퍼파rameter 튜닝을 가능하게 한다.
  • 비용이 많이 드는 MC 드롭아웃 평가를 피하기 위해 소규모 검증 세트에서 선형 탐색을 사용해 최적의 소프트맥스 온도를 찾는다.
  • RNN 기반 언어 모델에 이 방법을 적용하고, 퍼플렉서티 향상을 위해 평가 파rameter를 재조정한다.

실험 결과

연구 질문

  • RQ1드롭아웃 훈련 중에 최적화되고 있는 진짜 목표 함수는 무엇이며, 다양한 추론 방법과는 어떤 관계가 있는가?
  • RQ2왜 결정론적 드롭아웃은 일반적으로 좋은 근사로 여겨지는가? 실제로 이 가족 내에서 가장 좋은 모델인가?
  • RQ3훈련 후 가족 내에서 가장 좋은 모델을 선택함으로써 언어 모델링의 일반화 성능을 향상시킬 수 있는가?
  • RQ4추론 시 소프트맥스 온도를 조정하면 성능 향상이 이루어지는가? 이는 비용이 많이 드는 MC 드롭아웃의 대체 수단이 될 수 있는가?

주요 결과

  • 결정론적 드롭아웃 변형은 가장 날카로운 하한값을 가지며, 따라서 일반적으로 근사치로 여겨지는 것과는 달리 진짜 목표 함수에 대한 가장 좋은 근사치임이 입증되었다.
  • 펜 트리백 데이터셋에서, 최적의 온도로 평가 파rameter를 재조정함으로써 테스트 퍼플렉서티가 58.3에서 55.3으로 향상되었다.
  • 위키텍스트-2에서, 단지 검증 세트의 파rameter 조정만으로도 퍼플렉서티가 65.9에서 63.7로 감소하였다.
  • 결정론적 모델의 최적 소프트맥스 온도는 1보다 略적으로 낮았으며, 이는 스무딩이 아닌 샤프닝을 의미하며, 소규모 검증 세트에서의 선형 탐색을 통해 효율적으로 도출되었다.
  • 최적의 온도로 조정함으로써 결과가 약 0.5 퍼플렉서티 포인트 향상되었으며, 이는 결정론적 추론에 온도 조정을 적용한 것이 최고의 평가 방법에 대한 강력한 대체 수단임을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.