Skip to main content
QUICK REVIEW

[논문 리뷰] Deep RNN Framework for Visual Sequential Applications

Bo Pang, Kaiwen Zha|arXiv (Cornell University)|2018. 11. 25.
Human Pose and Action Recognition참고 문헌 53인용 수 5
한 줄 요약

이 논문은 시각적 순차 작업을 위한 매우 깊은 RNN을 효과적으로 훈련시킬 수 있도록 Context Bridge Module (CBM)와 Overlap Coherence Training Scheme을 포함한 딥 RNN 프레임워크를 제안한다. CBM는 시간 흐름과 표현 흐름을 분리하여 처리하고, 훈련 방식은 겹치는 짧은 클립을 통해 계산 비용을 감소시켜, Kinetics, UCF-101, HMDB-51에서 영상 분류 작업에서 11퍼센트 이상의 상대적 정확도 향상을 이룬 15층 네트워크를 가능하게 한다.

ABSTRACT

Extracting temporal and representation features efficiently plays a pivotal role in understanding visual sequence information. To deal with this, we propose a new recurrent neural framework that can be stacked deep effectively. There are mainly two novel designs in our deep RNN framework: one is a new RNN module called Context Bridge Module (CBM) which splits the information flowing along the sequence (temporal direction) and along depth (spatial representation direction), making it easier to train when building deep by balancing these two directions; the other is the Overlap Coherence Training Scheme that reduces the training complexity for long visual sequential tasks on account of the limitation of computing resources. We provide empirical evidence to show that our deep RNN framework is easy to optimize and can gain accuracy from the increased depth on several visual sequence problems. On these tasks, we evaluate our deep RNN framework with 15 layers, 7* than conventional RNN networks, but it is still easy to train. Our deep framework achieves more than 11% relative improvements over shallow RNN models on Kinetics, UCF-101, and HMDB-51 for video classification. For auxiliary annotation, after replacing the shallow RNN part of Polygon-RNN with our 15-layer deep CBM, the performance improves by 14.7%. For video future prediction, our deep RNN improves the state-of-the-art shallow model's performance by 2.4% on PSNR and SSIM. The code and trained models are published accompanied by this paper: https://github.com/BoPang1996/Deep-RNN-Framework.

연구 동기 및 목표

  • 시간 흐름과 표현 흐름이 얽혀 있는 문제로 인해 매우 깊은 RNN을 시각적 순차 작업에 훈련시키는 데 도전하는 것.
  • 긴 영상 시퀀스에서 깊은 RNN을 훈련시킬 때 발생하는 높은 계산 비용과 메모리 소비를 줄이는 것.
  • 더 깊은 아키텍처를 통해 영상 분류, 행동 예측, 영상 예측 작업의 성능을 향상시키는 것.
  • 훈련 중에 시퀀스 길이를 크게 줄이면서도 시간적 일관성을 유지할 수 있는 훈련 방식을 설계하는 것.

제안 방법

  • 시간 흐름과 표현 흐름을 별도의 독립된 계산 유닛으로 분리한 후 병합하는 Context Bridge Module (CBM)를 도입한다.
  • 훈련 초반에 시간 정보의 역전파를 억제하기 위해 Temporal Dropout (TD)를 사용하여 흐름 간 간섭을 줄인다.
  • 긴 시퀀스를 겹치는 짧은 클립으로 나누어 계산 비용과 메모리 소비를 줄이는 Overlap Coherence Training Scheme을 제안한다.
  • 인접한 클립 간 예측 일관성을 유지하기 위해 오버랩 코her런스 손실을 사용하며, 엄격한 마르코프 가정 없이도 시간적 일관성을 유지한다.
  • 두 흐름을 요소별 곱셈 또는 덧셈으로 병합하며, 분석 결과 곱셈 방식이 더 높은 성능을 보였다.
  • 백본으로 VGG19를 사용하고, 깊은 RNN 아키텍처를 위해 CBM를 15층으로 스택한다.

실험 결과

연구 질문

  • RQ1소실 기울기와 계산 비용 문제로 인해 10층을 초월하는 깊은 RNN 아키텍처를 시각적 시퀀스 모델링에 성공적으로 훈련시킬 수 있는가?
  • RQ2RNN에서 시간 흐름과 표현 흐름을 분리하면 깊은 네트워크의 훈련 안정성과 성능 향상에 기여하는가?
  • RQ3겹치는 짧은 클립 기반의 훈련 방식은 계산 복잡도를 줄이면서도 긴 시퀀스에서 시간적 일관성을 유지할 수 있는가?
  • RQ4병합 함수의 선택(예: 곱셈 대비 덧셈)이 깊은 RNN의 모델 성능에 어떤 영향을 미치는가?
  • RQ5시간 흐름과 표현 흐름의 균형을 유지하기 위해 최적의 TD 비율은 무엇인가?

주요 결과

  • 15층 CBM를 갖춘 깊은 RNN 프레임워크는 Kinetics, UCF-101, HMDB-51에서 얕은 RNN 모델 대비 11퍼센트 이상의 상대적 정확도 향상을 달성한다.
  • Polygon-RNN의 얕은 RNN을 15층 CBM로 교체하면 Cityscapes에서 IoU가 14.7퍼센트 향상된다.
  • 영상 미래 예측 작업에서 깊은 RNN은 이전 최고 성능의 얕은 모델 대비 PSNR와 SSIM을 각각 2.4퍼센트 향상시킨다.
  • 0.5 TD 비율에서 최고의 성능를 기록했으며, 1.0 TD 비율은 층 간 시간 흐름이 완전히 분리되어 성능 저하가 발생한다.
  • 오버랩 코her런스 훈련 방식은 효과적 시퀀스 길이를 줄여 표준 GPU에서 깊은 RNN의 훈련을 가능하게 하며, 시간적 일관성을 유지한다.
  • 요소별 곱셈 병합 방식이 덧셈보다 성능이 뛰어나, 흐름의 비대칭 융합이 영상 분류의 표현 학습을 향상시킨다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.