Skip to main content
QUICK REVIEW

[논문 리뷰] Slower is Better: Revisiting the Forgetting Mechanism in LSTM for Slower Information Decay

Hsiang-Yun Sherry Chien, Javier S. Turek|arXiv (Cornell University)|2021. 05. 12.
Ferroelectric and Negative Capacitance Devices참고 문헌 28인용 수 10
한 줄 요약

이 논문은 표준 LSTM의 지수 감쇠를 더 느리고 학습 가능한 거듭제곱 법칙 감쇠로 대체하는 거듭제곱 법칙 잊기 게이트(pLSTM)를 제안한다. 이는 장기 시퀀스 모델링을 향상시키기 위한 것으로, 사전 지식 없이도 수백 개의 타임스텝 동안 정보를 유지할 수 있도록 하며, 복사, 이미지 분류, 언어 모델링 작업에서 표준 LSTM 및 크로노 초기화된 LSTM보다 뛰어난 성능을 보인다. 이는 감쇠 인자 $p$를 민첩하게 조정함으로써 가능하다.

ABSTRACT

Sequential information contains short- to long-range dependencies; however, learning long-timescale information has been a challenge for recurrent neural networks. Despite improvements in long short-term memory networks (LSTMs), the forgetting mechanism results in the exponential decay of information, limiting their capacity to capture long-timescale information. Here, we propose a power law forget gate, which instead learns to forget information along a slower power law decay function. Specifically, the new gate learns to control the power law decay factor, p, allowing the network to adjust the information decay rate according to task demands. Our experiments show that an LSTM with power law forget gates (pLSTM) can effectively capture long-range dependencies beyond hundreds of elements on image classification, language modeling, and categorization tasks, improving performance over the vanilla LSTM. We also inspected the revised forget gate by varying the initialization of p, setting p to a fixed value, and ablating cells in the pLSTM network. The results show that the information decay can be controlled by the learnable decay factor p, which allows pLSTM to achieve its superior performance. Altogether, we found that LSTM with the proposed forget gate can learn long-term dependencies, outperforming other recurrent networks in multiple domains; such gating mechanism can be integrated into other architectures for improving the learning of long timescale information in recurrent neural networks.

연구 동기 및 목표

  • 표준 LSTM에서의 지수 감쇠로 인한 정보 손실 문제를 해결하여 장기적 의존성을 학습하는 데 어려움을 겪는 문제를 해결한다.
  • 더 생물학적으로 타당하고 민감한 잊기 메커니즘을 개발하여 자연적인 인지 과정에서 관찰되는 더 느린 거듭제곱 법칙 감쇠를 모방한다.
  • 시퀀스 길이에 대한 사전 지식 없이도 장기적 의존성을 학습할 수 있도록 하며, 수동으로 초기화된 바이어스를 필요로 하지 않는다.
  • 작은 일부 유닛이 느린 감쇠 인자로 정보를 유지함으로써 모델의 강건성과 해석 가능성 향상을 도모한다.

제안 방법

  • 표준 LSTM의 시그모이드 잊기 게이트를 학습 가능한 지수 $p$로 제어하는 거듭제곱 법칙 잊기 게이트로 대체한다.
  • 셀 상태 업데이트를 거듭제곱 법칙 감쇠 함수 $1/t^p$를 사용하여 수식화하며, 여기서 $p$는 학습 중에 학습 가능한 미분 가능한 파라미터이다.
  • 거듭제곱 법칙 잊기 게이트를 LSTM 셀 업데이트 규칙에 통합하여, 은닉 상태 및 셀 상태 전이를 적절히 수정한다.
  • 학습 중에 $p$를 초기화하거나 고정하여 감쇠 인자 영향을 분석한다.
  • 단위 활성도 분석과 추론 실험을 통해 낮은 감쇠 단위가 장기 정보 유지에 기여하는 방식을 조사한다.
  • 복사 작업, 이미지 분류, 언어 모델링, 다양한 시간 간격을 가진 주파수 식별과 같은 장기 의존성이 요구되는 작업에서 모델을 테스트한다.

실험 결과

연구 질문

  • RQ1학습 가능한 거듭제곱 법칙 잊기 게이트는 지수 감쇠의 한계를 넘어서 장기 정보 유지에 효과적인가?
  • RQ2pLSTM 모델은 표준 LSTM 및 크로노 초기화된 LSTM보다 수백 개 타임스텝에 이르는 기억이 필요한 작업에서 더 뛰어난 성능을 보이는가?
  • RQ3시퀀스 길이를 사전에 알지 못해도 학습 중에 감쇠 인자 $p$를 효과적으로 학습하여 다양한 작업 요구에 적응할 수 있는가?
  • RQ4pLSTM 모델은 표준 LSTM보다 단위 제거에 더 강건한가? 이는 장기 정보의 더 효율적 또는 국소화된 표현 방식을 시사하는가?
  • RQ5명시적인 시간 입력 없이도 pLSTM가 시간 정밀도를 유지할 수 있는가? 이는 내부적으로 시간 동적 특성을 학습하고 있음을 시사하는가?

주요 결과

  • 시간 입력이 있는 조건에서 주파수 식별 작업에서 pLSTM는 99.49%의 정확도를 기록했고, 비동기 조건에서는 92.57%를 기록했다. 이는 시간 입력이 없는 표준 LSTM(68.59%) 및 LSTM-chrono(69.64%)보다 뛰어난 성능을 보였다.
  • T=500인 복사 작업에서 pLSTM는 99.29%의 정확도를 기록했으며, 표준 LSTM(시간 입력 유무에 관계없이 각각 99.37% 및 99.29%)를 뛰어넘었고, 단위 제거에 대한 강건성도 입증했다.
  • 추론 실험 결과 pLSTM는 표준 LSTM 및 LSTM-chrono보다 랜덤 단위 제거에 더 강건하며, 특히 장기간 시퀀스 조건에서 두드러진다.
  • 모델는 느린 감쇠 인자($p$)를 가진 소수의 유닛을 사용하여 장기 스케일에서 정보를 유지하는 방식으로 학습했으며, 이는 국소화된 표현 전략을 시사한다.
  • 명시적인 시간 입력 없이도 pLSTM는 높은 성능 유지를 유지했으며, 이는 거듭제곱 법칙 게이트가 시간 정보를 내부적으로 통합하여 다양한 시간 간격에 일반화할 수 있음을 시사한다.
  • $p$의 초기화 방식을 변화시키고 후기 리셋 유닛을 추론한 결과, 감쇠 인자 $p$가 성능에 결정적인 영향을 미치며, 고$-p$ 유닛의 제거가 가장 큰 정확도 하락을 유발하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.