[논문 리뷰] PLU: The Piecewise Linear Unit Activation Function
이 논문은 tanh의 부드러운 비선형성과 ReLU의 기울기 안정성의 장점을 결합한 새로운 활성화 함수인 조각별 선형 유닛(PLU)을 제안한다. PLU는 학습 가능한 매개변수를 가진 세 개의 선형 세그먼트를 사용하여 ReLU보다 더 복잡한 비선형 함수를 보다 잘 근사한다. 기울기 소멸 문제를 피하면서도 얕은 네트워크와 비선형 함수 근사 작업에서 tanh에 가까운 성능을 달성한다.
Successive linear transforms followed by nonlinear "activation" functions can approximate nonlinear functions to arbitrary precision given sufficient layers. The number of necessary layers is dependent on, in part, by the nature of the activation function. The hyperbolic tangent (tanh) has been a favorable choice as an activation until the networks grew deeper and the vanishing gradients posed a hindrance during training. For this reason the Rectified Linear Unit (ReLU) defined by max(0, x) has become the prevailing activation function in deep neural networks. Unlike the tanh function which is smooth, the ReLU yields networks that are piecewise linear functions with a limited number of facets. This paper presents a new activation function, the Piecewise Linear Unit (PLU) that is a hybrid of tanh and ReLU and shown to outperform the ReLU on a variety of tasks while avoiding the vanishing gradients issue of the tanh.
연구 동기 및 목표
- ReLU의 조각별 선형 성질로 인해 기울기가 0이 되는 문제로 인해 부드럽고 높은 비선형성을 띤 함수를 근사하는 데 한계가 있다는 점을 해결하기 위해.
- tanh의 기울기 소멸 문제를 극복하면서도 더 높은 비선형성을 유지하여 보다 우수한 함수 근사 성능을 확보하기 위해.
- 계산 효율성이 높고, 역함수 가능하며, ReLU의 '사망한 뉴런' 문제를 피하는 활성화 함수를 설계하기 위해.
- 다양한 함수 근사 작업과 실제 분류 벤치마크에서 PLU의 성능을 평가하기 위해.
제안 방법
- PLU는 세 개의 선형 세그먼트로 구성된 조각별 선형 함수로 정의된다: $\text{PLU}(x) = \max(\alpha(x+c)-c, \min(\alpha(x-c)+c, x))$, 여기서 $\alpha$와 $c$는 학습 가능한 또는 고정된 초매개변수이다.
- 함수는 유한 범위 내에서 tanh 함수의 형태를 근사하도록 구성되며, 기울기 포화를 방지하기 위해 무한대까지 확장된다.
- PLU는 전 영역에서 역함수 가능하며, 역함수는 $\text{PLU}^{-1}(x) = \min\left(\frac{x+c}{\alpha}-c, \max\left(\frac{x-c}{\alpha}+c\right)\right)$ 로 주어지며, 이는 역함수 가능 네트워크에서의 활용을 가능하게 한다.
- 방법론은 얕은 네트워크와 깊은 전방향 신경망, CIFAR-10에서의 합성곱 신경망, 그리고 매개변수화된 곡선 및 3D 표면 근사 작업에서 PLU를 평가한다.
- 모든 실험에서 표준 초매개변수를 사용한 Adam 옵timizer를 사용하여 학습을 수행하며, PLU를 ReLU, tanh, 항등 활성화 함수와 비교한다.
- 함수 근사 작업은 평균 제곱 오차(MSE) 손실을 사용하고, 이미지 분류 작업은 교차 엔트로피 손실과 정확도 지표를 사용한다.
실험 결과
연구 질문
- RQ1조각별 선형 활성화 함수가 sin(x)와 매개변수 곡선과 같이 부드럽고 높은 비선형성을 띤 함수를 근사하는 데 ReLU를 능가할 수 있는가?
- RQ2PLU는 기울기 소멸 문제를 피하면서도 tanh와 유사한 성능을 유지하는가?
- RQ3실제 이미지 분류 작업에서 깊은 합성곱 신경망에서 PLU는 ReLU와 tanh보다 어떻게 성능을 내는가?
- RQ4PLU는 역함수 가능한가? 그리고 역함수 가능 활성화 함수가 필요한 아키텍처에서 사용될 수 있는가?
- RQ5PLU의 선형 세그먼트 수가 증가함에 따라 얕은 네트워크에서 더 나은 함수 근사 성능을 달성하는가?
주요 결과
- sin(x) 근사에서 PLU는 ReLU보다 평균 제곱 오차(MSE) 손실을 두 배수 낮게 달성했으며, tanh의 성능과 동일한 결과를 보였다.
- 매개변수 곡선 근사에서 PLU는 ReLU보다 훨씬 더 많은 선형 세그먼트를 생성하여 목표 곡선에 더 가까운 근사치를 제공했다.
- 쌍곡 포물면 $x^2 - y^2$ 의 3D 표면 근사에서 PLU는 빌드된 시각적 근사와 학습 손실 모두에서 ReLU를 능가했으며, tanh 수준의 성능에 근접했다.
- CIFAR-10에서 ReLU는 데이터의 거의 선형성 덕분에 잘 작동했지만, PLU와 tanh 역시 ReLU보다 더 빠르게 학습을 진행시켰다. 이는 기울기 안정성을 의미한다.
- PLU는 전체 실수 영역에서 역함수 가능했으며, tanh(정의역이 $(-1,1)$ 에서만 정의됨)와 달리, ReLU와 달리 기울기가 0이 되는 영역이 없었다.
- PLU는 ReLU의 '사망한 뉴런' 문제를 피하고 모든 영역에서 비영인 기울기를 유지하여 안정적인 학습을 지원했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.