Skip to main content
QUICK REVIEW

[논문 리뷰] LARNN: Linear Attention Recurrent Neural Network

Guillaume Chevalier|arXiv (Cornell University)|2018. 08. 16.
Advanced Neural Network Applications참고 문헌 7인용 수 8
한 줄 요약

LARNN는 기존의 LSTM 유사 셀에 다중 헤드 자기주의를 통합한 새로운 순환 신경망 아키텍처를 제안한다. 과거 셀 상태의 고정 크기 윈도우를 사용하여 효율적이고 주목사용 메모리 검색을 가능하게 한다. 센서 기반 인간 활동 인식 작업에서 91.924%의 테스트 정확도를 기록하며, 기존 LSTM보다 0.271% 높은 성능을 보였으며, 주목사용 메커니즘의 선형 레이어 내부에 배치 정규화된 ELU 활성화 함수를 적용할 경우 성능 향상이 더 뚜렷하게 나타났다.

ABSTRACT

The Linear Attention Recurrent Neural Network (LARNN) is a recurrent attention module derived from the Long Short-Term Memory (LSTM) cell and ideas from the consciousness Recurrent Neural Network (RNN). Yes, it LARNNs. The LARNN uses attention on its past cell state values for a limited window size $k$. The formulas are also derived from the Batch Normalized LSTM (BN-LSTM) cell and the Transformer Network for its Multi-Head Attention Mechanism. The Multi-Head Attention Mechanism is used inside the cell such that it can query its own $k$ past values with the attention window. This has the effect of augmenting the rank of the tensor with the attention mechanism, such that the cell can perform complex queries to question its previous inner memories, which should augment the long short-term effect of the memory. With a clever trick, the LARNN cell with attention can be easily used inside a loop on the cell state, just like how any other Recurrent Neural Network (RNN) cell can be looped linearly through time series. This is due to the fact that its state, which is looped upon throughout time steps within time series, stores the inner states in a "first in, first out" queue which contains the $k$ most recent states and on which it is easily possible to add static positional encoding when the queue is represented as a tensor. This neural architecture yields better results than the vanilla LSTM cells. It can obtain results of 91.92% for the test accuracy, compared to the previously attained 91.65% using vanilla LSTM cells. Note that this is not to compare to other research, where up to 93.35% is obtained, but costly using 18 LSTM cells rather than with 2 to 3 cells as analyzed here. Finally, an interesting discovery is made, such that adding activation within the multi-head attention mechanism's linear layers can yield better results in the context researched hereto.

연구 동기 및 목표

  • 표준 RNN이 장거리 의존성을 효율적으로 포착하는 데에 한계가 있음을 해결하기 위해.
  • 계산 복잡도를 과도하게 증가시키지 않으면서도 기억 회상 능력을 향상시키기 위해 주목사용 메커니즘을 순환 아키텍처에 통합하기 위해.
  • 과거 은닉 상태에 대한 주목사용이 순차 모델링 작업의 성능 향상에 기여하는지 탐색하기 위해.
  • 위치 인코딩 및 잔차 연결과 같은 아키텍처 선택 사항이 모델 성능에 미치는 영향을 평가하기 위해.
  • 주목사용 메커니즘의 선형 투영에서 활성화 함수가 학습에 기여하는지 조사하기 위해.

제안 방법

  • LARNN 셀은 k개의 최근 셀 상태를 담는 고정 크기의 선형 순서 큐를 유지하여 메모리 접근을 제한한다.
  • k개의 과거 셀 상태에 대해 다중 헤드 자기주의를 적용하여 관련된 이전 정보를 다이나믹하게 가중 평균화한다.
  • 현재 입력에서 파생된 쿼리와 과거 상태에서 온 키 및 밸류를 사용하여 셀 내부에서 주목사용을 적용하며, 도트-프로덕트 주목사용과 스케일드 도트-프로덕트 계산을 수행한다.
  • 다중 헤드 주목사용 메커니즘 내 선형 투영에 배치 정규화와 ELU 활성화 함수를 적용하여 학습 안정성과 성능을 향상시킨다.
  • 표준 RNN 루프에 따라 모델을 훈련하며, 각 시간 단계에서 주목사용 강화된 셀 상태를 사용해 은닉 상태를 갱신한다.
  • 스택된 LARNN 레이어 간에 잔차 연결을 적용하여 특징 융합과 개선된 기울기 흐름을 가능하게 한다.

실험 결과

연구 질문

  • RQ1과거 셀 상태에 국한된 지역 주목사용 메커니즘을 통합함으로써 RNN의 표현 능력을 향상시킬 수 있을까? 이때 복잡도가 제곱형태로 증가하지는 않을까?
  • RQ2다중 헤드 주목사용 메커니즘의 선형 레이어 내부에 배치 정규화된 활성화 함수를 적용할 경우, 순차 모델링 작업에서 일반화 성능이 향상될까?
  • RQ3고정 윈도우 주목사용 메커니즘 내에서 RNN에 위치 인코딩을 적용할 경우 성능에 어떤 영향을 미칠까?
  • RQ4RNN 내의 경량 주목사용 메커니즘이 순차 분류 벤치마크에서 표준 LSTM을 능가할 수 있을까?
  • RQ5창문 크기 k, 주목사용 헤드 수, 잔차 스태킹 수와 같은 하이퍼파라미터의 최적 설정은 무엇일까? 최대 성능을 내기 위해.

주요 결과

  • LARNN는 센서 기반 인간 활동 인식 데이터셋에서 91.924%의 테스트 정확도를 기록했으며, 기존 LSTM 기준선인 91.653%를 초월했다.
  • 다중 헤드 주목사용 메커니즘의 선형 투영에 배치 정규화된 ELU 활성화 함수를 적용할 경우 성능 향상이 나타났으며, 이는 이 아키텍처에 유리한 인덕티브 바이어스가 있음을 시사한다.
  • 밀도적으로 적용된 위치 인코딩은 성능 향상에 기여하지 않았으며, 이 특정 설정에서는 기능이 제한됨을 나타낸다.
  • LARNN 셀을 잔차 방식으로 스택할 경우 단순 순차적(레이어 기반) 스택 구성보다 더 뛰어난 성능을 기록했다.
  • 고정된 k에 대해 선형 복잡도 O(nk²)를 유지하면서도, 최근 메모리에 대한 주목사용을 통해 장거리 의존성을 효과적으로 포착할 수 있어, 전체 자기주의에 비해 확장 가능한 대안이 된다.
  • 주목사용 메커니즘이 RNN 내부에 효과적으로 통합되어 기억 회상 능력이 향상됨을 입증하였으며, 이는 RNN이 순차 모델링 분야에서 계속해서 관련성이 있음을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.