Skip to main content
QUICK REVIEW

[논문 리뷰] Transformer Dissection: A Unified Understanding of Transformer's Attention via the Lens of Kernel

Yao-Hung Hubert Tsai, Shaojie Bai|arXiv (Cornell University)|2019. 08. 30.
Natural Language Processing Techniques인용 수 5
한 줄 요약

이 논문은 트랜스포머의 어텐션 메커니즘을 커널 기반 재구성으로 제안하며, 이를 입력 간 유사도 점수를 활용하는 커널 스무딩기로 프레임워크화한다. 대칭 커널 곱을 통한 어텐션 모델링을 통해 어텐션 구성 요소를 통합적으로 이해할 수 있게 하고, 파rameter 수를 줄이며 신경 기계 번역 및 시퀀스 예측 작업에서 경쟁력 있는 성능을 달성한다. 이는 해석 가능성과 설계 유연성이 향상된다.

ABSTRACT

Transformer is a powerful architecture that achieves superior performance on various sequence learning tasks, including neural machine translation, language understanding, and sequence prediction. At the core of the Transformer is the attention mechanism, which concurrently processes all inputs in the streams. In this paper, we present a new formulation of attention via the lens of the kernel. To be more precise, we realize that the attention can be seen as applying kernel smoother over the inputs with the kernel scores being the similarities between inputs. This new formulation gives us a better way to understand individual components of the Transformer's attention, such as the better way to integrate the positional embedding. Another important advantage of our kernel-based formulation is that it paves the way to a larger space of composing Transformer's attention. As an example, we propose a new variant of Transformer's attention which models the input as a product of symmetric kernels. This approach achieves competitive performance to the current state of the art model with less computation. In our experiments, we empirically study different kernel construction strategies on two widely used tasks: neural machine translation and sequence prediction.

연구 동기 및 목표

  • 트랜스포머 내 어텐션 메커니즘을 이해하기 위한 통합적이고 커널 기반의 이론적 프레임워크 제공.
  • 어텐션 메커니즘에 가장 효과적인 커널 형태와 위치 임베딩 통합 전략 식별.
  • 낮은 계산 비용으로도 높은 성능을 유지하는 새로운 어텐션 변종 개발.
  • 커널 학습의 관점에서 어텐션 메커니즘의 체계적 분류 및 설계 가능화.

제안 방법

  • 입력 토큰 간 유사도(커널) 점수로부터 어텐션 가중치를 도출하는 커널 스무딩기로 자기 어텐션 메커니즘 재구성.
  • 대칭 커널 곱을 모델링하는 새로운 어텐션 변종 제안으로, 성능을 유지하면서도 파arameter 수를 감소.
  • 비위치 기반 커널 함수와 위치 기반 커널 함수의 곱을 이용해 위치 임베딩을 커널 구축을 통해 통합.
  • 무한 차원의 특징 맵을 지닌 것으로 알려진 지수 및 RBF 커널을 주요 커널 형태로 사용해 성능 평가.
  • 기존 어텐션 변종(예: Vaswani 등, 2017; Shaw 등, 2018; Dai 등, 2019)을 분석하고 분류하기 위해 커널 공식을 적용.
  • 위치 임베딩 통합 위치(쿼리, 키, 밸류 또는 커널)에 대한 아블레이션 스터디를 수행해 최적의 통합 방법 도출.

실험 결과

연구 질문

  • RQ1트랜스포머 어텐션 메커니즘은 커널 방법의 관점에서 어떻게 재해석될 수 있는가?
  • RQ2어떤 커널 형태(예: RBF, 지수)가 어텐션 메커니즘에서 최고의 성능을 내는가?
  • RQ3커널 기반 어텐션 메커니즘에서 위치 임베딩은 어디에 통합되어야 최적의 성능을 낼 수 있는가?
  • RQ4대칭 커널 기반 어텐션 변종은 기존 모델보다 더 적은 파arameter로 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ5커널 기반 공식화는 기존 어텐션 변종들을 통합적인 분류 프레임워크로 가능하게 하는가?

주요 결과

  • 대칭 커널의 곱을 사용한 어텐션은 파arameter 수를 줄이며 경쟁적인 성능을 달성하며, 최고 수준의 모델을 능가하거나 그에 맞추어 성능을 낼 수 있다.
  • 무한 차원의 특징 맵을 지닌 RBF 및 지수 커널은 신경 기계 번역 및 시퀀스 예측 작업 전반에서 최고의 성능을 보였다.
  • 비위치 기반 커널과의 곱을 통해 커널 함수에 위치 임베딩을 통합하는 것이 가장 높은 성능을 내었으며, 쿼리, 키 또는 밸류 헤드에 통합하는 것보다 뛰어났다.
  • 밸류 함수에 위치 임베딩을 통합하는 것은 성능 향상에 유의미한 기여가 없었으며, 어텐션 출력 계산에 필수적이지 않다는 것을 시사한다.
  • 디코더의 자기 어텐션에서 위치 임베딩을 제거하면 NMT에서 성능이 약간 떨어지며(34.71에서 34.49 BLEU), 그러나 전역적으로 제거하면 성능이 극적으로 악화된다(14.47 BLEU), 이는 위치 임베딩이 전체 모델링에서 핵심적인 역할을 한다는 것을 보여준다.
  • 커널 기반 공식화는 이전 어텐션 변종들을 체계적으로 이해하고 분류할 수 있게 하며, 통합된 프레임워크 하에서 공통적인 구조적 구성 요소를 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.