Skip to main content
QUICK REVIEW

[논문 리뷰] Maxout Networks

Ian Goodfellow, David Warde-Farley|arXiv (Cornell University)|2013. 02. 18.
Opportunistic and Delay-Tolerant Networks인용 수 7
한 줄 요약

이 논문은 드롭아웃 훈련을 향상시키기 위해 모델 평균화와 최적화를 개선하는 데 목적이 있는 새로운 활성화 함수인 맥스아웃(maxout)을 사용하는 딥러닝 아키텍처인 맥스아웃 네트워크를 소개한다. 맥스아웃 유닛은 여러 개의 선형 변환 중 최댓값을 계산하여 더 나은 기울기 흐름과 파라미터의 효과적인 사용을 가능하게 하며, 이로 인해 MNIST, CIFAR-10, CIFAR-100, SVHN에서 최신 기준 성능을 달성한다.

ABSTRACT

We consider the problem of designing models to leverage a recently introduced approximate model averaging technique called dropout. We define a simple new model called maxout (so named because its output is the max of a set of inputs, and because it is a natural companion to dropout) designed to both facilitate optimization by dropout and improve the accuracy of dropout's fast approximate model averaging technique. We empirically verify that the model successfully accomplishes both of these tasks. We use maxout and dropout to demonstrate state of the art classification performance on four benchmark datasets: MNIST, CIFAR-10, CIFAR-100, and SVHN.

연구 동기 및 목표

  • 드롭아웃을 모델 평균화 기법으로서 더 잘 활용할 수 있도록 설계된 신경망 아키텍처를 개발하는 것.
  • 드롭아웃 하에서 ReLU 유닛의 한계, 예를 들어 죽은 뉴런과 열악한 기울기 흐름 문제를 해결하는 것.
  • 모든 유닛을 통해 일관된 기울기 흐름을 보장하여 딥 네트워크의 최적화 역학을 향상시키는 것.
  • 맥스아웃이 드롭아웃 하에서 앙상블 평균화의 더 나은 근사치를 가능하게 함을 경험적으로 검증하는 것.
  • 맥스아웃과 드롭아웃을 사용하여 여러 벤치마크 데이터셋에서 최신 기준 분류 정확도를 달성하는 것.

제안 방법

  • 맥스아웃은 입력에 대한 k개의 선형 변환 중 최댓값을 계산하는 새로운 활성화 함수를 도입한다: $ h_i(x) = \max_{j \in [1,k]} (x^T W_{ij} + b_{ij}) $.
  • 모델은 뉴런당 여러 개의 선형 유닛 간에 파라미터 공유를 사용하여 훈련 중에 가중치와 활성화 함수를 동시에 학습할 수 있도록 한다.
  • 드롭아웃 훈련 중에 드롭아웃 마스크는 맥스 연산 이전에 적용되어, 맥스아웃 유닛이 항상 입력을 받고 기울기가 흐르도록 보장한다.
  • 이 아키텍처는 완전히 연결된 네트워크와 컨볼루션 네트워크 모두와 호환되며, 맥스아웃은 특징 맵(채널 기반 풀링)에 대해 적용된다.
  • 이 방법은 기하 평균 모델 평균화의 더 정확한 근사치를 가능하게 하며, 반만 무게를 가진 전체 모델의 출력이 앙상블 평균을 근사한다.
  • 설계 덕분에 모든 필터가 훈련 중에 적극적으로 사용되어, 드롭아웃 하에서 흔히 발생하는 포화 및 정규화 문제를 피할 수 있다.

실험 결과

연구 질문

  • RQ1드롭아웃의 모델 평균화 성질을 더 잘 활용할 수 있도록 설계된 신경망 아키텍처를 개발할 수 있는가?
  • RQ2ReLU나 tanh 유닛과 비교해 맥스아웃이 드롭아웃 하에서 최적화 역학을 어떻게 향상시키는가?
  • RQ3맥스아웃이 드롭아웃 하에서 딥 네트워크의 사용되지 않는 필터 수를 어느 정도 줄이는가?
  • RQ4특히 저층에서 맥스아웃과 ReLU 네트워크 간의 드롭아웃 마스크에 따른 기울기 분산은 어떻게 다른가?
  • RQ5맥스아웃은 더 깊은 네트워크를 훈련시켜 표준 활성화 함수보다 더 우수한 일반화 성능을 달성할 수 있는가?

주요 결과

  • 맥스아웃 네트워크는 MNIST, CIFAR-10, CIFAR-100, SVHN에서 이전의 ReLU 및 tanh 방법을 뛰어넘는 최신 기준 성능을 달성했다.
  • 맥스아웃은 두 번째 은닉층에서 99.9%의 필터를 사용했으며(2400개 중 2개만 사용되지 않음), 같은 훈련 조건에서 ReLU 네트워크는 39.2%의 필터가 사용되지 않았다.
  • 드롭아웃 하에서 SGD에서 5% 미만이었던 포화된 단위 비율이 ReLU 네트워크에서는 60%로 증가했지만, 맥스아웃 유닛은 훈련 전반에 걸쳐 활성화되어 있고 훈련 가능했다.
  • 맥스아웃은 첫 번째 레이어 가중치의 기울기 분산이 ReLU보다 3.4배 더 높았으며, 이는 마스크에 의존하는 기울기 신호의 더 나은 전파를 의미한다.
  • 출력 가중치의 기울기 분산은 맥스아웃이 ReLU보다 1.4배 더 높았으며, 이는 더 효과적인 모델 평균화 행동을 의미한다.
  • 맥스아웃 유닛은 양수와 음수 활성화로의 전환 빈도가 거의 동일했지만, ReLU 유닛은 비활성화되어 거의 회복되지 않아 최적화를 저해했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.