Skip to main content
QUICK REVIEW

[논문 리뷰] Attention is Not Only a Weight: Analyzing Transformers with Vector Norms

Goro Kobayashi, Tatsuki Kuribayashi|arXiv (Cornell University)|2020. 04. 21.
Topic Modeling참고 문헌 36인용 수 17
한 줄 요약

이 논문은 전통적인 가중치 기반 주의 분석을 보완하기 위해 변환된 입력 벡터의 L2 노름을 통합함으로써 노름 기반 분석을 제안한다. 이는 주의 출력이 주의 가중치와 벡터 크기의 두 가지 요소에 의존한다는 것을 드러낸다. 이 방법은 BERT가 특수 토큰에 대해 가중치만으로는 보이지 않는 방식으로 주의를 기울이지 않음을 밝혀내며, 빈도가 높은 단어의 기여도를 노름 조절을 통해 제어한다는 점을 규명한다. 또한, 단순히 가중치 기반 방법에 비해 더 정확한 단어 정렬을 신경망 기반 번역 시스템에서 추출할 수 있음을 보여준다.

ABSTRACT

Attention is a key component of Transformers, which have recently achieved considerable success in natural language processing. Hence, attention is being extensively studied to investigate various linguistic capabilities of Transformers, focusing on analyzing the parallels between attention weights and specific linguistic phenomena. This paper shows that attention weights alone are only one of the two factors that determine the output of attention and proposes a norm-based analysis that incorporates the second factor, the norm of the transformed input vectors. The findings of our norm-based analyses of BERT and a Transformer-based neural machine translation system include the following: (i) contrary to previous studies, BERT pays poor attention to special tokens, and (ii) reasonable word alignment can be extracted from attention mechanisms of Transformer. These findings provide insights into the inner workings of Transformers.

연구 동기 및 목표

  • 가중치 기반 주의 분석의 한계를 해결하기 위해, 변환된 입력 벡터의 크기를 忽시하는 문제를 해결한다.
  • 주의 가중치와 벡터 노름을 모두 고려한 주의 메커니즘 출력에서의 기여도를 분석하는 노름 기반 분석 방법을 제안한다.
  • 특수 토큰과 빈도가 높은 단어와 같은 언어적 요소를 처리하는 방식에 대해 더 깊은 통찰을 제공한다.
  • 벡터 노름을 고려함으로써 트랜스포머 기반 NMT 시스템의 소스-타겟 주의에서 더 정확한 단어 정렬을 추출할 수 있음을 입증한다.

제안 방법

  • 주의 메커니즘의 투영 행렬에 의해 변환된 값 벡터의 L2 노름을 평가하는 노름 기반 분석 프레임워크를 제안한다.
  • 각 입력 벡터의 노름을 $\boldsymbol{v}(\boldsymbol{x}_j) = \boldsymbol{x}_j \boldsymbol{W}^V + \boldsymbol{b}^V$ 를 적용한 후 측정하여 그 기여도 크기를 평가한다.
  • 벡터 노름과 주의 가중치를 통합하여 통합 기여도 지표를 계산하며, 이는 높은 가중치가 항상 높은 효과적 기여도를 의미하지는 않음을 드러낸다.
  • BERT와 트랜스포머 기반 NMT 시스템에 이 방법을 적용하여 토큰 수준의 주의 역학과 단어 정렬 품질을 분석한다.
  • 기존의 가중치 기반 분석과 비교하여 주의 행동에 대한 인식의 괴리점을 규명한다.
  • 공개된 코드를 사용하여 여러 모델과 작업에서 결과를 재현하고 검증한다.

실험 결과

연구 질문

  • RQ1변환된 입력 벡터의 노름이 트랜스포머의 주의 메커니즘 최종 출력에 어떻게 영향을 미치는가?
  • RQ2기존의 가중치 기반 분석이 왜 BERT의 특수 토큰 [SEP]의 진정한 기여도를 정확히 표현하지 못하는가?
  • RQ3노름 기반 분석이 트랜스포머 기반 신경망 기반 번역 시스템에서 단어 정렬 추출 품질을 향상시킬 수 있는가?
  • RQ4빈도가 높고 정보량이 적은 단어들이 주의 출력에 미치는 영향은 어느 정도이며, 이는 어떻게 제어되는가?
  • RQ5주의 가중치와 변환된 벡터의 크기를 함께 고려함으로써 주의 메커니즘을 더 잘 해석할 수 있는가?

주요 결과

  • BERT의 주의 메커니즘은 주의 가중치만으로는 보이지 않게, 특수 토큰 [SEP]에 대해 변환된 벡터의 노름이 낮아 효과적인 주의를 크게 기울이지 않는다.
  • 빈도가 높고 정보량이 적은 단어의 기여도는 주의 가중치 외에도 모델이 노름 조절을 통해 능동적으로 억제하고 있다.
  • 노름 기반 분석은 주의 가중치만으로는 부족하며, 높은 가중치가 작은 벡터 노름으로 인해 상쇄될 수 있음을 드러내어 주의 역학을 이해하는 데 있어 더 정교한 분석이 필요함을 보여준다.
  • 트랜스포머 기반 NMT 시스템에서는 노름 기반 주의를 사용해 추출한 단어 정렬이 단순히 주의 가중치만으로 추출한 것보다 더 정확하다.
  • 제안된 노름 기반 방법은 특히 진정한 정보 기여자를 식별하는 데 있어 가중치 기반 분석보다 더 세밀하고 정확한 주의 행동 해석을 제공한다.
  • 이 방법은 다양한 입력 길이에 대해 강건하며, 이전 방법들이 주의 가중치의 이진적 상쇄만을 고려하는 데서 비롯된 한계를 겪지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.