[논문 리뷰] SwinLSTM:Improving Spatiotemporal Prediction Accuracy using Swin Transformer and LSTM
이 논문은 시계열 데이터에서 더 나은 전역적 공간적 상관관계를 포착하기 위해 ConvLSTM의 컨볼루션 연산을 Swin Transformer 블록으로 대체하는 새로운 순환 셀인 SwinLSTM을 제안한다. Swin Transformer의 자기주의 메커니즘을 단순화된 LSTM과 융합함으로써, 특수한 트레이닝 기법을 사용하지 않고도 Moving MNIST, TaxiBJ, Human3.6m 및 KTH 데이터셋에서 최신 기술(SOTA) 성능을 달성한다. 이는 예측 정확도에서 ConvLSTM를 크게 능가한다.
Integrating CNNs and RNNs to capture spatiotemporal dependencies is a prevalent strategy for spatiotemporal prediction tasks. However, the property of CNNs to learn local spatial information decreases their efficiency in capturing spatiotemporal dependencies, thereby limiting their prediction accuracy. In this paper, we propose a new recurrent cell, SwinLSTM, which integrates Swin Transformer blocks and the simplified LSTM, an extension that replaces the convolutional structure in ConvLSTM with the self-attention mechanism. Furthermore, we construct a network with SwinLSTM cell as the core for spatiotemporal prediction. Without using unique tricks, SwinLSTM outperforms state-of-the-art methods on Moving MNIST, Human3.6m, TaxiBJ, and KTH datasets. In particular, it exhibits a significant improvement in prediction accuracy compared to ConvLSTM. Our competitive experimental results demonstrate that learning global spatial dependencies is more advantageous for models to capture spatiotemporal dependencies. We hope that SwinLSTM can serve as a solid baseline to promote the advancement of spatiotemporal prediction accuracy. The codes are publicly available at https://github.com/SongTang-x/SwinLSTM.
연구 동기 및 목표
- 자신의 국소적 수신장으로 인해 CNN 기반 모델이 장거리 공간적 상관관계를 포착하는 데 한계가 있음을 해결하기 위해.
- LSTM 내의 컨볼루션 연산을 자기주의 메커니즘으로 대체하여 시공간 예측 정확도를 향상시키기 위해.
- 순차적 데이터에서 공간적 및 시간적 동적 특성을 효과적으로 모델링할 수 있는 새로운 순환 셀인 SwinLSTM을 개발하기 위해.
- 향후 시공간 예측 연구를 위한 강력하고 일반화 가능한 기반 모델을 확립하기 위해.
제안 방법
- SwinLSTM은 ConvLSTM의 컨볼루션 연산을 Swin Transformer 블록으로 대체하여 2D 특징 맵에서 전역적 공간적 어텐션을 모델링한다.
- 입력 프레임은 겹치지 않는 패치로 나뉘며, 이는 어텐션 계산을 위한 학습 가능한 토큰으로 임bedding된다.
- 시간적 기억을 유지하기 위해 단순화된 LSTM 유닛을 사용하며, 입력, 망각, 출력 게이트는 Swin Transformer 블록의 출력과 함께 작동하도록 조정된다.
- Swin Transformer 블록은 이동된 창 자기주의를 사용하여 효율적으로 전역적 의존성을 계산하면서도 계산 효율성을 유지한다.
- 네트워크 아키텍처는 인코더 및 디코더 단계에서 특징 맵을 다운샘플링하고 업샘플링하기 위해 패치 병합 및 확장 레이어를 사용한다.
- 최종 은닉 상태에서 예측된 미래 프레임을 생성하기 위해 역전치 컨볼루션, 이중선형 보간 또는 선형 투영을 사용하는 재구성 헤드가 사용된다.
실험 결과
연구 질문
- RQ1LSTM 내의 컨볼루션 연산을 자기주의 메커니즘으로 대체하면 시공간 예측 정확도가 향상되는가?
- RQ2Swin Transformer를 통해 전역적 공간적 상관관계를 모델링하면 순환 모델의 시공간 작업 성능에 어떤 영향을 미치는가?
- RQ3다양한 데이터셋에 일반화하기 위한 최적의 패치 크기와 Swin Transformer 블록 수는 무엇인가?
- RQ4제안된 SwinLSTM 아키텍처는 다양한 시공간 예측 벤치마크에서 잘 일반화되는가?
- RQ5SwinLSTM의 은닉 상태와 셀 상태는 어떻게 공간적 운동과 궤적 정보를 인코딩하는가?
주요 결과
- Moving MNIST 데이터셋에서 SwinLSTM은 테스트 MSE 0.390과 SSIM 0.980을 기록하며, ConvLSTM 및 다른 SOTA 방법을 능가하는 최고의 성능을 달성한다.
- Human3.6m 데이터셋에서 SwinLSTM은 테스트 MSE 33.2(10으로 나누어진 값)와 SSIM 0.913을 기록하며, ConvLSTM보다 뚜렷이 향상된 성능을 보였다.
- 제거 실험 결과, TaxiBJ 및 Human3.6m에서 역전치 컨볼루션 재구성 방식이 이중선형 보간 및 선형 투영 방식보다 가장 우수한 성능을 보였다.
- 최적의 패치 크기는 데이터셋에 따라 다르다: Human3.6m에서는 패치 크기 4가 가장 우수한 성능을 냈고, TaxiBJ에서는 패치 크기 2가 최고였다.
- Swin Transformer 블록 수(STB)는 성능에 비단조화적인 영향을 미치며, TaxiBJ 및 Human3.6m 양쪽에서 18개 블록이 가장 우수한 결과를 냈다.
- 특징 맵의 시각화 결과, 셀 상태는 숫자 궤적을 기억하는 반면, 은닉 상태는 현재 위치를 인코딩하며, 더 깊은 Swin 블록은 점차 전역적 공간 상관관계를 학습하는 것으로 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.