Skip to main content
QUICK REVIEW

[논문 리뷰] Evolving Attention with Residual Convolutions

Yujing Wang, Yaming Yang|arXiv (Cornell University)|2021. 02. 20.
Topic Modeling참고 문헌 29인용 수 10
한 줄 요약

이 논문은 잔차 연결과 2차원 컨볼루션 모듈을 사용하여 레이어 간에 주의 맵을 진화시키는 새로운 메커니즘인 Evolving Attention (EA-Transformer)을 제안한다. 주의 맵을 다중 채널 특징 맵으로 간주하고 컨볼루션을 통해 정제함으로써, 비전 및 NLP 작업 전반에서 일관된 정확도 향상을 달성하며, ImageNet, GLUE 및 IWSLT 벤치마크에서 최신 기술 수준의 성능을 기록한다.

ABSTRACT

Transformer is a ubiquitous model for natural language processing and has attracted wide attentions in computer vision. The attention maps are indispensable for a transformer model to encode the dependencies among input tokens. However, they are learned independently in each layer and sometimes fail to capture precise patterns. In this paper, we propose a novel and generic mechanism based on evolving attention to improve the performance of transformers. On one hand, the attention maps in different layers share common knowledge, thus the ones in preceding layers can instruct the attention in succeeding layers through residual connections. On the other hand, low-level and high-level attentions vary in the level of abstraction, so we adopt convolutional layers to model the evolutionary process of attention maps. The proposed evolving attention mechanism achieves significant performance improvement over various state-of-the-art models for multiple tasks, including image classification, natural language understanding and machine translation.

연구 동기 및 목표

  • 각 레이어에서 독립적으로 학습되는 주의 맵이 정밀한 변화하는 의존성을 포착하지 못하는 기존 트랜스포머의 한계를 해결한다.
  • 레이어 간 주의 패턴의 진화를 모델링하는 인덕티브 바이어스를 도입하여 주의 맵 품질을 향상시킨다.
  • 잔차 연결과 컨볼루션 특징 진화를 통해 레이어 간 지식 공유를 강화함으로써 모델의 해석 가능성과 성능을 향상시킨다.
  • 비전 트랜스포머, BERT, 어텐션을 갖춘 ResNets를 포함한 다양한 어텐션 기반 아키텍처에 적용 가능한 일반적이고 플러그인 방식의 메커니즘을 개발한다.
  • 진화하는 주의 맵이 입력 데이터의 구조적 및 의미적 의존성을 더 정확하게 반영하는 더 선명하고 신뢰할 수 있는 주의 패턴을 생성함을 입증한다.

제안 방법

  • 각 트랜스포머 블록의 멀티헤드 어텐션 맵을 다중 채널 특징 맵(H × W × C)으로 간주하며, 여기서 C는 어텐션 헤드의 수이다.
  • 이러한 주의 맵을 2차원 컨볼루션 모듈에 입력하여 다음 블록을 위한 정제된 주의 맵으로 진화시킨다.
  • 원본 주의 맵과 진화된 맵 사이에 잔차 연결을 사용하여 상호 토큰 의존성 지식을 유지하고 전파한다.
  • 블록 간에 다수의 컨볼루션 모듈을 연결하여 계차적 진화 과정을 형성하며, 깊은 네트워크의 계층적 추상화를 모방한다.
  • 기존의 트랜스포머 및 자기 어텐션 아키텍처(예: BERT, 비전 트랜스포머, AA-ResNet)에 진화 주의 모듈을 플러그인 방식으로 통합한다.
  • 전체 모델을 엔드 투 엔드로 훈련하며, 컨볼루션 헤드가 국소적 맥락과 전역적 구조적 사전 지식 기반으로 주의 패턴을 정교화하도록 학습한다.

실험 결과

연구 질문

  • RQ1주어진 레이어에서 독립적으로 학습하는 대신 주의 맵의 진화를 모델링함으로써 트랜스포머 레이어 전반에 걸쳐 주의 맵을 체계적으로 향상시킬 수 있는가?
  • RQ2주의 맵에 컨볼루션 인덕티브 바이어스를 도입하면 정밀도와 구조적 충실도가 향상되는가?
  • RQ3주의 맵 간의 잔차 연결이 레이어 간 지식 전이와 성능 향상에 어느 정도 기여하는가?
  • RQ4진화 주의 메커니즘이 컴퓨터 비전 및 자연어 처리 분야의 다양한 아키텍처와 작업에 일반화되는가?
  • RQ5향상된 주의 품질이 모델의 해석 가능성과 예측 근거의 충실도 향상에 기여하는가?

주요 결과

  • ImageNet 분류 작업에서 Evolving Attention는 일관되게 상위-1 정확도를 향상시키며, EA-AA-ResNet-34를 통해 31.93%의 정확도를 기록하여 AA-ResNet-34 대비 0.5% 향상되었다.
  • GLUE 벤치마크에서 EA-BERT는 BERT-Base 성능을 2.4점 향상시키며, RoBERTa-Large는 0.8점, T5-Base는 1.1점 향상시켰다.
  • ERASER 해석 가능성 벤치마크에서 EA-BERT는 보통 BERT보다 더 포괄적인(↑0.013) 그러나 덜 충분한(↓0.01) 근거를 생성하여 충실도 향상을 입증했다.
  • ImageNet에서 주의 맵 분류 정확도는 EA-AA-ResNet-34에서 크게 향상되었으며, 16번째, 17번째, 18번째 레이어의 주의 맵이 AA-ResNet-34보다 더 높은 정확도를 기록하여 더 뛰어난 구조적 충실도를 보였다.
  • IWSLT’14 De-En 학습 곡선에서 EA-Transformer-Lite는 1회 반복당 3% 더 많은 FLOPs를 사용함에도 불구하고, 기존 Transformer-Lite보다 더 빠르게 수렴하고 더 낮은 훈련 손실 및 더 높은 BLEU 점수를 기록했다.
  • 시각화 결과는 명확한 진화 경향을 확인했다: EA-Transformer에서는 레이어 간 주의 맵이 점점 더 선명하고 객체 중심이 되는 반면, 기존 트랜스포머는 흐릿하고 넓은 패턴을 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.