[논문 리뷰] AReLU: Attention-based Rectified Linear Unit
이 논문은 각 레이어당 두 개의 가속화 가능한 파rameter를 사용하여 양의 특징을 적극적으로 증폭하고 음의 특징을 억제하는 요소별로 부호 기반의 주의 메커니즘을 ReLU와 통합한 학습 가능한 활성화 함수인 AReLU를 제안한다. AReLU는 학습 안정성을 향상시키고, 작은 학습률 하에서도 수렴 속도를 가속화하며, 다양한 아키텍처에서 전이 학습 및 메타학습 벤치마크에서 성능을 크게 향상시킨다.
Element-wise activation functions play a critical role in deep neural networks via affecting the expressivity power and the learning dynamics. Learning-based activation functions have recently gained increasing attention and success. We propose a new perspective of learnable activation function through formulating them with element-wise attention mechanism. In each network layer, we devise an attention module which learns an element-wise, sign-based attention map for the pre-activation feature map. The attention map scales an element based on its sign. Adding the attention module with a rectified linear unit (ReLU) results in an amplification of positive elements and a suppression of negative ones, both with learned, data-adaptive parameters. We coin the resulting activation function Attention-based Rectified Linear Unit (AReLU). The attention module essentially learns an element-wise residue of the activated part of the input, as ReLU can be viewed as an identity transformation. This makes the network training more resistant to gradient vanishing. The learned attentive activation leads to well-focused activation of relevant regions of a feature map. Through extensive evaluations, we show that AReLU significantly boosts the performance of most mainstream network architectures with only two extra learnable parameters per layer introduced. Notably, AReLU facilitates fast network training under small learning rates, which makes it especially suited in the case of transfer learning and meta learning. Our source code has been released (see https://github.com/densechen/AReLU).
연구 동기 및 목표
- 고정된 활성화 함수의 한계, 특히 기울기 소실 문제와 최적화되지 않은 특징 집중 문제를 해결하기 위해.
- 데이터 적응형 학습 가능한 활성화 메커니즘을 도입하여 학습 역학과 모델 표현력을 향상시키기 위해.
- 특히 전이 학습 및 메타학습에 유리한 작은 학습률 하에서도 수렴 속도를 빠르게 하기 위해.
- 주요 주의 기반 공식화를 통해 기존의 학습 가능한 활성화 함수보다 더 해석 가능하고 효과적인 대안을 제공하기 위해.
제안 방법
- 각 요소의 부호에 따라 스케일링을 학습하는 요소별로 부호 기반의 주의 모듈을 도입한다.
- 학습된 주의 맵을 ReLU와 조합하여, 미분 가능하고 데이터 적응형 활성화 함수인 AReLU를 구성한다.
- 주의 모듈은 ReLU의 항등 변환에 대한 요소별 잔여치를 학습함으로써 기울기 흐름을 향상시킨다.
- 레이어당 추가로 오직 두 개의 가속화 가능한 파rameter만 사용하여 계산 오버헤드를 최소화한다.
- 표준 CNN에서 여러 레이어에 AReLU를 적용하고, 이미지 분류, 전이 학습, 메타학습 작업에서 성능을 평가한다.
- SGD와 학습률 스케줄링을 사용한 표준 학습 프rotocol을 적용하여, AReLU를 비학습 가능한 활성화 함수 및 다른 학습 가능한 활성화 함수와 비교한다.
실험 결과
연구 질문
- RQ1주의 기반 메커니즘이 깊이 신경망에서 ReLU의 표현력과 학습 역학을 향상시킬 수 있는가?
- RQ2학습 가능한 부호 기반 주의 메커니즘이 작은 학습률 하에서도 수렴 속도를 빠르게 하는가?
- RQ3전이 학습 및 메타학습 환경에서 AReLU는 기존의 학습 가능한 활성화 함수와 비교해 어떻게 성능을 냈는가?
- RQ4최소한의 파ram터 오버헤드와 향상된 기울기 흐름을 바탕으로 AReLU는 더 뛰어난 성능을 낼 수 있는가?
주요 결과
- 20 에포크의 피니튜닝 후 SVHN에서 AReLU는 테스트 정확도 78.48%를 기록하여 전이 학습 설정에서 모든 다른 활성화 함수를 능가한다.
- 5-ways-1-shot 메타학습 작업에서 AReLU는 92.50%의 정확도를 달성하여 PReLU(88.13%)와 PAU(43.13%)를 크게 앞서며 뛰어난 적응 속도를 보여준다.
- 5-ways-5-shots 메타학습 환경에서 AReLU는 94.30%의 정확도를 기록하여 SELU(93.50%)와 GELU(69.37%)를 포함한 모든 베이스라인을 초월한다.
- AReLU는 작은 학습률(1e-5) 하에서도 빠른 수렴을 가능하게 하여, 피니튜닝 및 메타학습에 매우 효과적이다.
- 특징 시각화 결과 AReLU는 잘 집중된, 작업 중심의 활성화를 생성함을 확인하였으며, 특징 맵에서 관련 영역을 명확히 부각시킨다.
- 레이어당 단 두 개의 가속화 가능한 파rameter만 추가함으로써 다양한 아키텍처와 벤치마크에서 일관되고 뚜렷한 성능 향상이 이루어졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.