Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Attention Network: Accelerate Attention by Searching Where to Plug

Zhongzhan Huang, Senwei Liang|arXiv (Cornell University)|2020. 11. 28.
Advanced Neural Network Applications참고 문헌 31인용 수 8
한 줄 요약

이 논문은 공유된 어텐션 모듈과 CNN 백본 간 최적의 희박한 연결을 탐색하기 위한 강화학습 기반 방법인 효율적 어텐션 네트워크(EAN)를 제안한다. 이는 추론 속도 향상, 파라미터 증가 감소 및 정확도 유지로 이어지며, 이미지 분류, 군중 수세기, 의미적 세그멘테이션 작업 전반에서 성능을 유지하면서 어텐션 네트워크의 속도를 높인다.

ABSTRACT

Recently, many plug-and-play self-attention modules are proposed to enhance the model generalization by exploiting the internal information of deep convolutional neural networks (CNNs). Previous works lay an emphasis on the design of attention module for specific functionality, e.g., light-weighted or task-oriented attention. However, they ignore the importance of where to plug in the attention module since they connect the modules individually with each block of the entire CNN backbone for granted, leading to incremental computational cost and number of parameters with the growth of network depth. Thus, we propose a framework called Efficient Attention Network (EAN) to improve the efficiency for the existing attention modules. In EAN, we leverage the sharing mechanism (Huang et al. 2020) to share the attention module within the backbone and search where to connect the shared attention module via reinforcement learning. Finally, we obtain the attention network with sparse connections between the backbone and modules, while (1) maintaining accuracy (2) reducing extra parameter increment and (3) accelerating inference. Extensive experiments on widely-used benchmarks and popular attention networks show the effectiveness of EAN. Furthermore, we empirically illustrate that our EAN has the capacity of transferring to other tasks and capturing the informative features. The code is available at https://github.com/gbup-group/EAN-efficient-attention-network.

연구 동기 및 목표

  • 기존 플러그 앤 플레이 어텐션 모듈이 네트워크 깊이에 따라 계산 비용과 파라미터를 증가시키는 비효율성 문제를 해결하기 위해.
  • 정확도를 희생시키지 않고 어텐션 강화 CNN의 추론 시간과 파라미터 증가를 줄이기 위해.
  • 공유된 어텐션 모듈 내에서 CNN 백본 내에 희박하고 최적의 연결 포인트를 지능적으로 선택하는 방법을 개발하기 위해.
  • 학습된 어テン션 연결 체계가 군중 수세기 및 의미적 세그멘테이션과 같은 후행 작업으로의 이식 가능성 평가하기 위해.
  • 희박하고 학습된 어텐션 연결이 밀도 높은 또는 고정된 연결 패턴보다 더 분류 능력 있는 특징을 포착할 수 있음을 입증하기 위해.

제안 방법

  • CNN 스테이지의 모든 블록에 걸쳐 공유 어텐션 모듈을 사용하여 파라미터 증가를 최소화한다.
  • 강화학습 에이전트가 백본과 공유 어텐션 모듈 간 최적의 희박한 연결 패턴을 탐색한다.
  • 검증 정확도와 추론 시간을 기반으로 한 프록시 보상 함수를 사용하여 검색 정책을 훈련시켜 효율적인 아키텍처 탐색을 가능하게 한다.
  • 이산적 탐색 공간의 미분 가능 근사화를 사용하여 학습 중 기울기 기반 최적화를 허용한다.
  • 최종 아키텍처는 희박한 연결 패턴으로 정규화되어 FLOPs와 추론 시간을 감소시키지만 성능을 유지한다.
  • 이 방법은 ImageNet, 상하이 테크, Pascal VOC 2012에서 평가되어 이식 가능성과 강건성을 입증했다.

실험 결과

연구 질문

  • RQ1강화학습 기반 방법이 공유 어텐션 모듈과 CNN 백본 간 희박하고 최적의 연결 패턴을 효과적으로 탐색할 수 있는가?
  • RQ2제안된 EAN 방법이 희박한 연결 패턴을 통해 추론 시간과 파라미터 증가를 줄이면서도 정확도를 유지하거나 향상시키는가?
  • RQ3ImageNet에서 학습된 어텐션 연결 체계가 군중 수세기 및 의미적 세그멘테이션과 같은 다른 비전 작업으로 성공적으로 이식될 수 있는가?
  • RQ4학습된 희박한 연결이 Grad-CAM 시각화 결과를 통해 특징의 분류 능력을 향상시키는가?
  • RQ5다양한 벤치마크에서 기존 어텐션 모듈과 비교해 EAN의 효율성-정확도 트레이드오프는 어떠한가?

주요 결과

  • 상하이 테크 군중 수세기 데이터셋에서 EAN은 기준 풀-연결 어텐션 네트워크 대비 상대적 추론 시간 증가율을 40% 이상 감소시켰다.
  • Pascal VOC 2012에서 EAN-SE는 단지 16.43%의 시간 증가율로 73.68%의 mIoU를 기록했으며, Share-full-SE 대비 48.16%의 시간 증가율을 기록하여 지연 시간을 31.73% 포인트 감소시켰다.
  • Grad-CAM 시각화에서 EAN-SE는 바닐라 ResNet 및 Share-full-SE보다 더 분류 능력 있고 정확한 어텐션 영역을 강조하여 뛰어난 성능을 보였다.
  • EAN-SE 모델은 풀-연결 및 공유 기반 모델과 비교해 유사하거나 더 높은 정확도를 유지하면서도 계산 비용과 파라미터 증가를 크게 줄였다.
  • EAN을 통해 학습된 연결 체계는 후행 작업으로의 일반화 능력이 뛰어나 군중 수세기 및 의미적 세그멘테이션 작업으로의 이식 가능성과 강력한 이식성능을 입증했다.
  • RL 기반 탐색은 100회 이내에 수렴하여 기존의 수백 또는 수천 회의 반복이 필요한 전통적 NAS 방법보다 훨씬 빠른 속도를 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.