Skip to main content
QUICK REVIEW

[논문 리뷰] Nested LSTMs.

Joel Ruben Antony Moniz, David Krueger|arXiv (Cornell University)|2018. 01. 31.
Natural Language Processing Techniques참고 문헌 25인용 수 12
한 줄 요약

이 논문은 내부 LSTM 셀이 서로 중첩되는 방식으로 구성된 딥 순환 아키텍처인 네스티드 LSTM(NLSTM)을 소개한다. 외부 메모리 셀의 값은 내부 LSTM의 은닉 상태에서 유도된다. 파arameter 수가 유사한 조건에서, NLSTM는 단일층 및 스타킹된 LSTMs보다 문자 수준의 언어 모델링에서 더 뛰어난 성능을 보이며, 내부 메모리 셀이 더 장기적인 의존성을 더 효과적으로 포착한다.

ABSTRACT

We propose Nested LSTMs (NLSTM), a novel RNN architecture with multiple levels of memory. Nested LSTMs add depth to LSTMs via nesting as opposed to stacking. The value of a memory cell in an NLSTM is computed by an LSTM cell, which has its own inner memory cell. Specifically, instead of computing the value of the (outer) memory cell as $c^{outer}_t = f_t \odot c_{t-1} + i_t \odot g_t$, NLSTM memory cells use the concatenation $(f_t \odot c_{t-1}, i_t \odot g_t)$ as input to an inner LSTM (or NLSTM) memory cell, and set $c^{outer}_t$ = $h^{inner}_t$. Nested LSTMs outperform both stacked and single-layer LSTMs with similar numbers of parameters in our experiments on various character-level language modeling tasks, and the inner memories of an LSTM learn longer term dependencies compared with the higher-level units of a stacked LSTM.

연구 동기 및 목표

  • 스택드 LSTMs가 장기 의존성을 포착하는 데 한계가 있음을 해결하기 위해 더 깊은 메모리 계층을 도입하기 위해.
  • 모델 복잡도를 크게 증가시키지 않고도 순환 네트워크의 시퀀스 모델링 성능을 향상시키기 위해.
  • LSTM 스택킹의 대안으로 계층적이고 중첩된 메모리 구조를 도입하기 위해.

제안 방법

  • 외부 메모리 셀의 값은 입력 게이트와 무시 게이트의 출력을 연결한 후, 내부 LSTM 셀에 입력하여 계산된다.
  • 내부 LSTM은 벡터 (f_t ⊙ c_{t-1}, i_t ⊙ g_t)를 처리하고 은닉 상태 h^{inner}_t를 생성한다.
  • 외부 메모리 셀 c^{outer}_t는 h^{inner}_t와 동일하게 설정되며, 이는 외부 셀의 메모리가 내부 LSTM의 은닉 상태에 의존함을 의미한다.
  • 이 중첩 구조는 내부 셀이 외부 층과 독립적으로 장기 의존성을 학습할 수 있도록 더 깊은 메모리 추상화를 가능하게 한다.
  • 이 아키텍처는 표준 LSTMs 및 스타킹된 LSTMs와 유사한 파라미터 수를 유지하므로 공정한 비교가 가능하다.
  • 메모리 계층의 효과를 평가하기 위해 모델은 엔드 투 엔드로 문자 수준의 언어 모델링 작업에서 훈련된다.

실험 결과

연구 질문

  • RQ1스택드 LSTMs나 단일층 LSTMs와 비교해 네스티드 LSTM 아키텍처가 장기 의존성 학습을 향상시킬 수 있는가?
  • RQ2NLSTM의 계층적 메모리 구조는 시퀀스 모델링 작업 성능에 어떤 영향을 미치는가?
  • RQ3NLSTM의 내부 메모리 셀은 스타킹된 LSTMs의 고수준 단위보다 더 장기적인 의존성을 더 효과적으로 학습하는가?
  • RQ4유사한 파라미터 수를 가진 표준 LSTMs 및 스타킹된 LSTMs에 비해 NLSTM의 성능 향상은 어느 정도인가?
  • RQ5중첩 아키텍처는 순환 네트워크에서 더 효과적인 메모리 활용을 이끌어내는가?

주요 결과

  • 유사한 파라미터 수를 가진 조건에서, 네스티드 LSTMs는 문자 수준의 언어 모델링 작업에서 단일층 및 스타킹된 LSTMs를 모두 능가한다.
  • NLSTM의 내부 메모리 셀은 스타킹된 LSTMs의 고수준 단위보다 더 효과적으로 장기 의존성을 학습한다.
  • 중첩 아키텍처는 모델 복잡도를 증가시키지 않으면서도 더 깊은 메모리 추상화를 가능하게 한다.
  • 성능 향상은 내부 LSTM 셀을 통한 메모리 상태의 계층적 처리 덕분이다.
  • 개선된 메모리 계층과 장기 메모리 유지 덕분에 더 나은 언어 모델링 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.