Skip to main content
QUICK REVIEW

[논문 리뷰] Sentiment analysis with adaptive multi-head attention in Transformer

Fanfei Meng, Wang, Chen-Ao|arXiv (Cornell University)|2023. 10. 23.
Sentiment Analysis and Opinion Mining인용 수 7
한 줄 요약

이 논문은 입력 문장 길이에 따라 주의 헤드 수를 동적으로 조정하는 새로운 적응형 다중 헤드 주의 메커니즘인 AdaptAttn을 제안한다. 짧은 문장에는 두 개, 중간 길이의 문장에는 네 개, 긴 문장에는 여덟 개의 주의 헤드를 사용한다. 스탠포드 대규모 영화 리뷰 데이터셋에서 평가한 결과, AdaptAttn는 기준 모델과 유사한 F1 스코어를 달성하면서도 동적 헤드 할당 덕분에 계산 오버헤드를 감소시켰다.

ABSTRACT

We propose a novel framework based on the attention mechanism to identify the sentiment of a movie review document. Previous efforts on deep neural networks with attention mechanisms focus on encoder and decoder with fixed numbers of multi-head attention. Therefore, we need a mechanism to stop the attention process automatically if no more useful information can be read from the memory.In this paper, we propose an adaptive multi-head attention architecture (AdaptAttn) which varies the number of attention heads based on length of sentences. AdaptAttn has a data preprocessing step where each document is classified into any one of the three bins small, medium or large based on length of the sentence. The document classified as small goes through two heads in each layer, the medium group passes four heads and the large group is processed by eight heads. We examine the merit of our model on the Stanford large movie review dataset. The experimental results show that the F1 score from our model is on par with the baseline model.

연구 동기 및 목표

  • 감성 분석에 적합하지 않은 고정된 다중 헤드 주의의 비효율성을 해결하기 위해, 입력 길이에 따라 주의 헤드 수를 조정한다.
  • 감성 분류 작업의 성능을 훼손하지 않으면서 주의 메커니즘의 계산 비용을 줄인다.
  • 리뷰를 소, 중, 대 사이즈로 나누는 데이터 기반의 길이 기반 그룹화 전략을 도입하여, 각각에 맞는 주의 헤드 할당을 가능하게 한다.
  • 적응형 주의의 효과성을 평가하여 모델의 효율성을 향상시키고, 벤치마크 감성 데이터셋에서 경쟁 가능한 F1 스코어를 유지할 수 있는지 확인한다.

제안 방법

  • 모델은 사전 처리 단계에서 입력 문장을 세 가지 길이 기반 그룹으로 분류한다: 소(짧음), 중(중간), 대(긴).
  • 각 그룹은 고정된 주의 헤드 수를 할당받는다: 소문장에는 두 개, 중문장에는 네 개, 대문장에는 여덟 개의 주의 헤드를 모든 트랜스포머 레이어에 적용한다.
  • 적응형 메커니즘은 입력 길이에 따라 주의 헤드 수를 동적으로 조정하여, 모든 입력에 대해 고정된 헤드 수가 필요로 하지 않도록 한다.
  • 표준 트랜스포머 인코더 레이어를 유지하지만, 입력 길이에 따라 헤드 수를 조절하는 다중 헤드 주의 메커니즘을 수정한다.
  • 주의 계산은 표준 스케일된 도트곱 주의를 따르지만, 헤드 수는 하이퍼파라미터가 아니라 입력 길이 그룹에 따라 결정된다.
  • 모델는 표준 교차 엔트로피 손실을 사용하여 스탠포드 대규모 영화 리뷰 데이터셋에서 이진 감성 분류를 위한 미세조정을 수행한다.

실험 결과

연구 질문

  • RQ1입력 길이에 따라 주의 헤드 수를 동적으로 조정하면 감성 분석 성능을 향상시키면서도 계산 비용을 줄일 수 있는가?
  • RQ2감성 분류 벤치마크에서 적응형 다중 헤드 주의 메커니즘의 성능는 고정 헤드 트랜스포머와 비교해 어떻게 되는가?
  • RQ3문장 길이에 기반한 그룹화 전략이 입력 길이와 최적의 주의 헤드 수 간의 관계를 효과적으로 포착하는가?
  • RQ4제안된 방법은 표준 트랜스포머와 비교해 파라미터 수와 FLOPs를 줄이면서도 경쟁 가능한 F1 스코어를 유지할 수 있는가?

주요 결과

  • 제안된 AdaptAttn 모델은 스탠포드 대규모 영화 리뷰 데이터셋에서 기준 모델과 유사한 F1 스코어를 달성한다.
  • 짧은 문장에 대해 주의 헤드 수를 줄여 계산 효율성을 높였으며, 이로 인해 FLOPs와 추론 비용이 감소한다.
  • 문장 길이 그룹 기반의 적응형 헤드 할당 전략 덕분에 다양한 입력 길이에서 성능이 안정적으로 유지된다.
  • 결과적으로 고정된 다중 헤드 구성은 최적의 성능을 내지 못할 수 있으며, 입력 길이에 기반한 적응형 헤드 수 조정이 자원 사용을 줄이면서도 동일한 성능을 달성할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.