Skip to main content
QUICK REVIEW

[논문 리뷰] Pay Better Attention to Attention: Head Selection in Multilingual and Multi-Domain Sequence Modeling

Hongyu Gong, Yun Tang|arXiv (Cornell University)|2021. 06. 21.
Topic Modeling참고 문헌 35인용 수 5
한 줄 요약

이 논문은 다국어 및 다영역 시퀀스 모델링을 향상시키기 위해 다중 헤드 어텐션에서 선택적 파rameter 공유를 가능하게 하는 적응형 어텐션 헤드 선택 전략—서브셋 전략과 그룹 전략—을 제안한다. 언어나 도메인 간에 어떤 헤드를 공유할지 학습함으로써 간섭을 줄이고 전문화를 유지하며, 음성 인식, 텍스트 간 번역, 음성 간 번역 작업 전반에서 일관된 성능 향상을 이룬다. 특히 다국어 음성 간 번역에서 최대 +2.0 BLEU 향상이 달성되었다.

ABSTRACT

Multi-head attention has each of the attention heads collect salient information from different parts of an input sequence, making it a powerful mechanism for sequence modeling. Multilingual and multi-domain learning are common scenarios for sequence modeling, where the key challenge is to maximize positive transfer and mitigate negative transfer across languages and domains. In this paper, we find that non-selective attention sharing is sub-optimal for achieving good generalization across all languages and domains. We further propose attention sharing strategies to facilitate parameter sharing and specialization in multilingual and multi-domain sequence modeling. Our approach automatically learns shared and specialized attention heads for different languages and domains to mitigate their interference. Evaluated in various tasks including speech recognition, text-to-text and speech-to-text translation, the proposed attention sharing strategies consistently bring gains to sequence models built upon multi-head attention. For speech-to-text translation, our approach yields an average of $+2.0$ BLEU over $13$ language directions in multilingual setting and $+2.0$ BLEU over $3$ domains in multi-domain setting.

연구 동기 및 목표

  • 다중 헤드 어텐션에서 비선택적 파rameter 공유로 인한 간섭 문제를 해결하기 위해 다국어 및 다영역 시퀀스 모델링에서 발생하는 간섭을 해결한다.
  • 데이터 기반 동적 선택을 통해 공유되는 어텐션 헤드를 유연하게 설정함으로써 다양한 언어와 영역 간 일반화 및 지식 전이를 향상시킨다.
  • 경량적이고 효율적인 어텐션 헤드 공유 전략을 통해 부정적 전이를 완화하면서도 언어 및 영역 특이성을 유지한다.
  • 음성 인식, 텍스트 간 번역, 음성 간 번역을 포함한 다양한 시퀀스 모델링 작업에서 제안된 방법을 평가한다.
  • 계산 비용을 증가시키지 않으면서도 저자원 및 고자원 환경에서 일관된 성능 향상을 입증한다.

제안 방법

  • 언어나 도메인 간에 공유할 어텐션 헤드를 제어하기 위해 서브셋 전략과 그룹 전략이라는 두 가지 어텐션 헤드 선택 전략을 도입한다.
  • Transformer 기반 모델의 인코더 및 디코더 레이어 수준에서 전략을 적용하여 각 레이어에서 공유 또는 전문화된 헤드를 선택할 수 있도록 한다.
  • 각 언어나 도메인에 대해 활성화될 헤드를 결정하기 위해 학습 가능한 게이팅 메커니즘을 사용하여 훈련 중 동적 적응을 가능하게 한다.
  • 선택 과정을 가볍게 설계하여 의미 있는 계산 오버헤드 없이 표준 다중 헤드 어텐션과의 호환성을 유지한다.
  • 표준 역전파를 사용하여 공유 및 전문화된 헤드를 가진 모델을 훈련하며, 어텐션 헤드 선택을 엔드 투 엔드로 학습한다.
  • 공유 패턴과 레이어 간 균형을 분석하기 위해 어텐션 헤드 로드 분포를 시각화한다.

실험 결과

연구 질문

  • RQ1선택적 어텐션 헤드 공유 전략은 다국어 및 다영역 시퀀스 모델링에서 성능에 어떤 영향을 미치는가?
  • RQ2어텐션 헤드 선택 전략은 유사성이 낮은 언어나 도메인 간의 간섭을 줄이면서도 지식 전이를 유지할 수 있는가?
  • RQ3어떤 성능 향상이 인코더 또는 디코더에만 적용할 경우와 비교해 볼 때 어떻게 달라지는가?
  • RQ4고자원 및 저자원 언어 간에 공유되는 헤드의 수 등 공유 패턴은 어떻게 변화하는가?
  • RQ5다양한 선택 전략 하에서 어텐션 헤드 간 로드 분포는 얼마나 균형을 이루는가?

주요 결과

  • 제안된 어텐션 헤드 선택 전략은 다국어 음성 인식 및 음성 간 번역을 포함한 다양한 시퀀스 모델링 작업에서 일관된 성능 향상을 이룬다.
  • 다국어 음성 간 번역 작업에서 13개 언어 방향 전반에 걸쳐 평균 +2.0 BLEU 향상이 달성되어 강력한 긍정적 전이 효과를 입증한다.
  • 다영역 음성 간 번역 작업에서는 3개 도메인에서 +2.0 BLEU 향상으로 도메인 일반화 능력이 확인된다.
  • 인코더와 디코더 양쪽에 모두 어텐션 선택을 적용할 경우 한쪽에만 적용하는 것보다 성능이 뛰어나며, 다국어 음성 인식에서는 인코더 전용 선택이 디코더 전용 선택보다 뛰어난 성능을 보였다.
  • 고자원 유럽 언어(예: 이탈리아어, 프랑스어)는 충분한 데이터 덕분에 어텐션 헤드를 덜 공유하여 간섭을 줄이고, 저자원 언어는 고자원 언어와의 공유를 통해 유의미한 이점을 얻는다.
  • 특히 인코더 및 디코더의 중간 레이어에서 서브셋 전략에 비해 그룹 전략이 더 균형 잡힌 어텐션 헤드 로드 분포를 만들어낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.