Skip to main content
QUICK REVIEW

[논문 리뷰] Learned-Norm Pooling for Deep Feedforward and Recurrent Neural Networks

Çaǧlar Gülçehre, Kyunghyun Cho|arXiv (Cornell University)|2013. 11. 07.
Domain Adaptation and Few-Shot Learning참고 문헌 33인용 수 4
한 줄 요약

이 논문은 뉴런 투영에 대한 정규화된 $L_p$ 노름을 계산함으로써 최댓값, 평균, RMS 풀링과 같은 풀링 연산을 일반화하는 학습 가능한 비선형 활성 함수인 $L_p$ 유닛을 소개한다. 각 유닛에서 최적의 $p$ 값을 학습함으로써 모델은 복잡한 곡선 형태의 결정 경계를 효율적으로 포착하며, MNIST, 얼굴 인식, 다성분 음악 예측을 포함한 여러 벤치마크 데이터셋에서 피드포워드 및 순환 신경망에서 최신 기술 성능을 달성한다.

ABSTRACT

In this paper we propose and investigate a novel nonlinear unit, called $L_p$ unit, for deep neural networks. The proposed $L_p$ unit receives signals from several projections of a subset of units in the layer below and computes a normalized $L_p$ norm. We notice two interesting interpretations of the $L_p$ unit. First, the proposed unit can be understood as a generalization of a number of conventional pooling operators such as average, root-mean-square and max pooling widely used in, for instance, convolutional neural networks (CNN), HMAX models and neocognitrons. Furthermore, the $L_p$ unit is, to a certain degree, similar to the recently proposed maxout unit (Goodfellow et al., 2013) which achieved the state-of-the-art object recognition results on a number of benchmark datasets. Secondly, we provide a geometrical interpretation of the activation function based on which we argue that the $L_p$ unit is more efficient at representing complex, nonlinear separating boundaries. Each $L_p$ unit defines a superelliptic boundary, with its exact shape defined by the order $p$. We claim that this makes it possible to model arbitrarily shaped, curved boundaries more efficiently by combining a few $L_p$ units of different orders. This insight justifies the need for learning different orders for each unit in the model. We empirically evaluate the proposed $L_p$ units on a number of datasets and show that multilayer perceptrons (MLP) consisting of the $L_p$ units achieve the state-of-the-art results on a number of benchmark datasets. Furthermore, we evaluate the proposed $L_p$ unit on the recently proposed deep recurrent neural networks (RNN).

연구 동기 및 목표

  • 딥 신경망에서 고정된 풀링 연산의 한계를 해결하기 위해, 비선형 활성 함수로서 풀링의 학습 가능한 일반화를 제안한다.
  • 학습을 통해 $L_p$ 노름의 순서 $p$를 조정하면 고정된 $p$-풀링 방법에 비해 모델의 표현력과 일반화 능력이 향상되는지 조사한다.
  • $L_p$ 유닛의 기하학적 성질과 조각별 선형 대체 방법에 비해 비선형 곡선 형태의 결정 경계를 더 효율적으로 모델링할 수 있는 능력을 탐구한다.
  • 다양한 벤치마크 작업에서 피드포워드 네트워크(MLP)와 순환 네트워크(RNN)에 대한 $L_p$ 유닛의 성능을 평가한다.
  • 최적의 $p$ 값이 데이터셋과 유닛에 따라 달라지므로, $p$를 엔드 투 엔드로 학습할 필요성이 있음을 정당화한다.

제안 방법

  • 하위층 활성값의 다수의 투영에 대한 정규화된 $L_p$ 노름을 계산하는 비선형 활성 함수로 $L_p$ 유닛을 제안한다: $u_j = \left( \frac{1}{K} \sum_{k=1}^K |z_k|^p \right)^{1/p}$, 여기서 $z_k$는 입력 신호의 투영이다.
  • 최댓값, 평균, RMS 풀링이 각각 $p = \infty$, $p = 1$, $p = 2$일 때 $L_p$ 유닛의 특수한 경우로 간주된다.
  • 역전파와 엔드 투 엔드 학습이 가능하도록 $L_p$ 유닛의 미분 가능 형태를 도입한다.
  • 학습률, 스케줄링 등의 랜덤 하이퍼파rameter 서치를 포함한 확률적 경량 최적화 방법을 사용하여 검증 세트에서 모델 성능을 최적화한다.
  • 다층 퍼셉트론(MLP)과 심층 순환 네트워크(DOT-RNN)에 모두 $L_p$ 유닛을 적용하며, 출력층에는 마크스아웃을 사용하고 전이층에는 $L_p$ 유닛을 사용한다.
  • 학습은 Pylearn2 라이브러리를 사용하고, MNIST, 토리onto 얼굴 데이터베이스, 펜토미노, 포레스트 커버타입, 음악 예측 작업에서 모델을 평가한다.

실험 결과

연구 질문

  • RQ1풀링 유사 활성 함수에서 $L_p$ 노름의 순서 $p$를 학습시키면 고정된 $p$ 값에 비해 딥 신경망의 일반화 성능이 향상되는가?
  • RQ2$L_p$ 유닛의 기하학적 구조—초타원형 경계를 정의함으로써—복잡한 비선형 결정 경계를 어떻게 더 효율적으로 모델링하는가?
  • RQ3$L_p$ 유닛은 피드포워드 및 순환 아키텍처에서 기존의 활성 함수인 ReLU와 시그모이드보다 우월한가?
  • RQ4최적의 $p$ 값은 데이터셋 및 레이어에 따라 특수화되어 있는가, 아니면 모든 유닛에서 동일한 값으로 수렴하는가?
  • RQ5$L_p$ 유닛은 순환 네트워크에 효과적으로 통합되어 시계열 모델링 성능을 향상시킬 수 있는가?

주요 결과

  • $L_p$ 유닛은 각각 $p = \infty$, $p = 1$, $p = 2$일 때 최댓값, 평균, RMS 풀링을 특수한 경우로 일반화하며, 비음수 입력 조건 하에서 마크스아웃 유닛과도 밀접한 관련이 있다.
  • 실험 결과, $L_p$ 유닛은 피드포워드 네트워크에서 MNIST, 토리onto 얼굴 데이터베이스, 펜토미노, 포레스트 커버타입 데이터셋에서 최신 기술 성능을 달성한다.
  • 다성분 음악 예측 작업에서는 $L_p$ 기반 DOT-RNN이 음악 데이터셋인 Nottingham, JSB, MuseData에서 각각 음수 로그확률 점수 2.95, 7.92, 6.59를 기록하여 시그모이드 기반 RNN과 이전 최고 기록을 모두 초월했다.
  • 하이퍼파ram터 서치 결과, 추정된 $p$ 값은 데이터셋과 레이어에 따라 유의미하게 다름을 확인하였으며, 평균은 2.00에서 2.02 사이, 표준편차는 약 $0.24 \times 10^{-4}$에서 $1.50 \times 10^{-4}$ 수준으로 나타나, $p$의 비트리비어스 학습 분포가 존재함을 시사한다.
  • 조각별 선형 대체 방법(예: ReLU)에 비해 $L_p$ 유닛은 더 적은 수의 유닛으로도 비정상적인 곡률을 효과적으로 포착할 수 있어, 곡선 형태의 결정 경계를 더 효율적으로 모델링할 수 있음을 입증했다.
  • RNN에서 $L_p$ 유닛이 시그모이드 유닛보다 테스트 로그확률이 낮게 나타나 시퀀스 모델링 작업에서의 효과성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.