Skip to main content
QUICK REVIEW

[논문 리뷰] NAM: Normalization-based Attention Module

Yichao Liu, Zongru Shao|arXiv (Cornell University)|2021. 11. 24.
Advanced Neural Network Applications참고 문헌 10인용 수 7
한 줄 요약

이 논문은 배치 정규화 스케일링 인자들을 활용하여 덜 유의미한 특징을 억제함으로써 모델 효율성을 향상시키는 경량화된 주의 메커니즘인 NAM (Normalization-based Attention Module)을 제안한다. 이러한 스케일링 인자들에 $l_1$ 정규화를 적용함으로써 NAM은 FLOPs와 파라미터 수가 유사한 조건에서 ResNet 및 MobileNet에서 SE, BAM, CBAM, TAM보다 높은 정확도를 달성한다.

ABSTRACT

Recognizing less salient features is the key for model compression. However, it has not been investigated in the revolutionary attention mechanisms. In this work, we propose a novel normalization-based attention module (NAM), which suppresses less salient weights. It applies a weight sparsity penalty to the attention modules, thus, making them more computational efficient while retaining similar performance. A comparison with three other attention mechanisms on both Resnet and Mobilenet indicates that our method results in higher accuracy. Code for this paper can be publicly accessed at https://github.com/Christian-lyc/NAM.

연구 동기 및 목표

  • 기존 주의 메커니즘에서 가중치 기여 요인을 고려하지 않은 점을 해결하기 위해.
  • 추가적인 레이어 없이 덜 유의미한 채널과 공간적 특징을 억제함으로써 모델 효율성을 향상시키기 위해.
  • 최소한의 계산 오버헤드로 높은 성능을 유지하는 경량 주의 모듈을 개발하기 위해.
  • 주의 메커니즘에서 배치 정규화 통계를 특징 중요도의 대체 지표로 사용하는 방법을 탐색하기 위해.

제안 방법

  • NAM은 SE 및 CBAM에서 사용하는 다층 퍼셉트론 대신 배치 정규화의 스케일링 인자 $\gamma$를 채널 중요도의 척도로 사용한다.
  • 채널 주의 서브모듈은 채널 간 정규화된 $W_{\gamma} = \gamma_i / \sum_j \gamma_j$를 통해 주의 가중치를 계산한다.
  • 공간 주의 서브모듈은 공간적 배치 정규화를 사용하여 $\lambda$를 통해 픽셀 수준의 중요도를 평가하는 동일한 원리를 적용한다.
  • 손실 함수에 $\gamma$ 및 $\lambda$에 대한 $l_1$ 노름 정규화를 적용하여 덜 유의미한 가중치를 억제하고 흐린 상태를 유도한다.
  • 모듈은 잔차 블록에 통합되며, CBAM의 순차적 설계를 따르므로 채널 및 공간 주의를 순차적으로 적용할 수 있다.
  • 기존의 SE 및 CBAM 대비 추가적인 완전 연결 또는 컨볼루션 레이어를 피함으로써 파라미터 수와 FLOPs를 감소시킨다.

실험 결과

연구 질문

  • RQ1배치 정규화 스케일링 인자들이 주의 메커니즘에서 덜 유의미한 특징을 효과적으로 식별하고 억제하는 데 사용될 수 있는가?
  • RQ2SE, BAM, CBAM, TAM과 같은 기존 주의 모듈과 비교해 NAM의 정확도와 효율성은 어떠한가?
  • RQ3$\gamma$ 및 $\lambda$의 스케일링 인자에 $l_1$ 정규화를 적용했을 때, 모델의 흐린 상태 및 성능 향상에 미치는 영향은 무엇인가?
  • RQ4NAM은 ResNet 및 MobileNet과 같은 깊이 있는 네트워크와 경량 네트워크에서 모델 복잡도를 줄이면서도 높은 성능을 유지하는가?
  • RQ5채널 전용, 공간 전용, 또는 병합된 통합 전략의 차이가 NAM의 최종 정확도와 효율성에 어떤 영향을 미치는가?

주요 결과

  • CIFAR-100에서 채널 주의만 적용한 NAM(ch*)는 상위-1 오차율 19.09%를 기록하여 SE(20.29%), BAM(19.97%), CBAM(19.44%), TAM(20.15%)를 모두 앞섰다.
  • CIFAR-100에서 공간 주의만 적용한 NAM(sp*)는 상위-1 오차율 19.38%를 기록하여 SE, BAM, TAM를 능가했지만, 채널 전용 변종보다는 약간 낮았다.
  • ImageNet에서 NAM을 MobileNet V2와 결합한 결과 상위-1 오차율 29.34%를 기록하여 FLOPs와 파라미터 수가 거의 동일한 조건에서 SE(29.77%), BAM(29.91%), CBAM(29.74%)를 모두 능가했다.
  • NAM은 파라미터 수 증가 폭이 미미했음(3.51M 대비 CBAM의 3.54M)에도 불구하고 더 높은 정확도를 제공함으로써 효율성을 입증했다.
  • $\gamma$ 및 $\lambda$에 대한 $l_1$ 정규화는 덜 유의미한 가중치의 흐린 상태를 성공적으로 유도하여 일반화 능력 향상과 효율성 향상에 기여했다.
  • 제거 실험을 통해 배치 정규화 스케일링 인자를 주의 가중치로 사용하는 것이 효과적이며 계산적으로도 효율적임을 확인했으며, 추가적인 다층 퍼셉트론 또는 컨볼루션 레이어가 필요로 하지 않는다는 점이 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.