Skip to main content
QUICK REVIEW

[논문 리뷰] RRA: Recurrent Residual Attention for Sequence Learning

Cheng Wang|arXiv (Cornell University)|2017. 09. 12.
Natural Language Processing Techniques참고 문헌 28인용 수 12
한 줄 요약

이 논문은 RNN의 여러 타임스텝에 걸쳐 잔차 연결을 통한 어텐션을 도입함으로써 장거리 시퀀스 모델링을 향상시키는 RRA, 즉 순환 잔차 어텐션 메커니즘을 제안한다. 이러한 잔차 경로를 통해 직접 오차 역전파를 수행하고 과거의 은닉 상태들에 대해 동적 어텐션 가중치를 학습함으로써, RRA는 표준 LSTMs보다 더 빠른 수렴 속도, 더 안정적인 훈련, 그리고 MNIST와 IMDB 감성 분석과 같은 시퀀스 작업에서 뛰어난 성능을 달성한다.

ABSTRACT

In this paper, we propose a recurrent neural network (RNN) with residual attention (RRA) to learn long-range dependencies from sequential data. We propose to add residual connections across timesteps to RNN, which explicitly enhances the interaction between current state and hidden states that are several timesteps apart. This also allows training errors to be directly back-propagated through residual connections and effectively alleviates gradient vanishing problem. We further reformulate an attention mechanism over residual connections. An attention gate is defined to summarize the individual contribution from multiple previous hidden states in computing the current state. We evaluate RRA on three tasks: the adding problem, pixel-by-pixel MNIST classification and sentiment analysis on the IMDB dataset. Our experiments demonstrate that RRA yields better performance, faster convergence and more stable training compared to a standard LSTM network. Furthermore, RRA shows highly competitive performance to the state-of-the-art methods.

연구 동기 및 목표

  • 장거리 의존성을 타임스텝 간에 학습할 때 RNN에서 기울기 소실 문제를 해결한다.
  • 표준 RNN과 LSTMs가 비연속적인 시퀀스 요소 간의 의미 관계를 명시적으로 포착하는 데 한계를 가진다는 점을 극복한다.
  • 여러 타임스텝에 걸친 잔차 연결을 통한 새로운 어텐션 메커니즘을 도입하여 오차 역전파 및 컨텍스트 모델링을 향상시킨다.
  • RRA가 표준 LSTMs를 능가하고, 시퀀스 학습 벤치마크에서 최신 기법들과 경쟁 가능한 성능을 보임을 입증한다.
  • 기존의 고차원 순환 또는 전역 어텐션을 사용하는 방법들보다 더 유연하고 파라미터 효율적인 대안을 제공한다.

제안 방법

  • RNN에 타임스텝 간 잔차 연결을 도입하여 현재 은닉 상태에서 먼 은닉 상태로까지 직접 오차 역전파 신호를 전달할 수 있도록 한다.
  • 잔차 함수를 다수의 과거 은닉 상태에 대한 어텐션을 포함하도록 재구성한다: $\mathbf{h}_t = \mathcal{M}(\mathbf{x}_t, \mathbf{h}_{t-1}) + \mathcal{F}(\mathbf{h}_{t-2}, \mathbf{h}_{t-3}, \dots, \mathbf{h}_{t-K-1}; \mathbf{W}_a)$, 여기서 $\mathcal{F}$ 는 학습된 어テン션 가중치 $\mathbf{W}_a$ 를 적용한다.
  • 각 과거 은닉 상태가 현재 상태에 미치는 기여도를 동적으로 제어하는 어텐션 게이트를 정의하여 의미적으로 관련된 장거리 의존성에 집중할 수 있도록 한다.
  • 잔차 연결을 통한 미분 가능한 어텐션 메커니즘을 사용하여 백프로파게이션을 통한 엔드 투 엔드 훈련이 가능하도록 한다.
  • 표준 RNN 셀을 $\mathcal{M}(\mathbf{x}_t, \mathbf{h}_{t-1})$ 로 유지하면서 어텐션 가중치가 적용된 잔차 성분을 추가한다.
  • 어텐션 가중치를 시각화하여 모델이 관련된 과거 타임스텝을 어떻게 학습하는지 분석한다. 예를 들어 문장 내 비연속적인 단어들 간의 의존성, 예를 들어 'girl'과 그 대명사 'her' 간의 관계를 포착하는 방식이다.

실험 결과

연구 질문

  • RQ1타임스텝 간 잔차 연결은 RNN에서 기울기 흐름을 향상시키고 기울기 소실 문제를 완화시킬 수 있는가?
  • RQ2여러 과거 은닉 상태에 대한 어텐션은 순차적 데이터에서 장거리 의존성을 향상시킬 수 있는가?
  • RQ3제안된 RRA 메커니즘은 표준 LSTMs에 비해 더 빠른 수렴과 더 안정적인 훈련을 이끌 수 있는가?
  • RQ4사전 훈련이나 단어 임베딩 없이 RRA는 시퀀스 학습 작업에서 최신 기법들과 비교해 어떻게 성능을 내는가?
  • RQ5RRA는 비연속적인 요소들 간의 의미적 의존성, 예를 들어 대명사와 그 전건어 간의 관계를 어느 정도 포착할 수 있는가?

주요 결과

  • RRA는 추가 문제, 픽셀 단위 MNIST, 그리고 IMDB 감성 분석에서 표준 LSTM 네트워크보다 더 빠른 수렴 속도와 더 안정적인 훈련을 달성한다.
  • 추가 문제에서 RRA는 표준 LSTMs가 어려워하는 장거리 의존성을 성공적으로 학습한다. 특히 관련 입력 간 거리가 클 경우 두드러진다.
  • 픽셀 단위 MNIST에서 RRA는 LSTM보다 더 높은 테스트 정확도를 달성하여 일반화 및 시퀀스 모델링 능력 향상을 보여준다.
  • IMDB 감성 분석 작업에서 RRA는 word2vec 임베딩이나 사전 훈련 없이도 최신 기법들과 경쟁 가능한 성능을 보였다.
  • 어텐션 가중치의 시각화 결과 RRA가 의미적으로 관련된 과거 타임스텝에 더 높은 중요도를 할당하는 방식으로 학습하는 것으로 나타났다. 예를 들어 문장에서 'her'를 예측할 때 'girl'에 주목하는 방식이다.
  • K=5일 때 순열 MNIST에서 약 760초의 훈련 속도가 약간 느리지만, 조기 정지 기법을 적용했을 때 RRA는 LSTM보다 더 일찍 수렴함으로써 더 뛰어난 샘플 효율성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.