Skip to main content
QUICK REVIEW

[논문 리뷰] Context-LSTM: a robust classifier for video detection on UCF101

Dengshan Li, Rujing Wang|arXiv (Cornell University)|2022. 03. 13.
Anomaly Detection Techniques and Applications인용 수 5
한 줄 요약

이 논문은 UCF101 행동 인식 벤치마크에서 최신 기술 수준의 정확도를 달성하면서 훈련 시간과 GPU 메모리 사용량을 크게 줄이는 경량의 LSTM 기반 아키텍처인 Context-LSTM을 제안한다. ReLU, 배치 정규화, 최대 풀링을 갖춘 LSTM 블록을 연결함으로써 장기적인 시간적 의존성을 효율적으로 포착하고 인간과 유사한 시간적 추론을 모방하여 강력한 비디오 행동 검출을 구현한다.

ABSTRACT

Video detection and human action recognition may be computationally expensive, and need a long time to train models. In this paper, we were intended to reduce the training time and the GPU memory usage of video detection, and achieved a competitive detection accuracy. Other research works such as Two-stream, C3D, TSN have shown excellent performance on UCF101. Here, we used a LSTM structure simply for video detection. We used a simple structure to perform a competitive top-1 accuracy on the entire validation dataset of UCF101. The LSTM structure is named Context-LSTM, since it may process the deep temporal features. The Context-LSTM may simulate the human recognition system. We cascaded the LSTM blocks in PyTorch and connected the cell state flow and hidden output flow. At the connection of the blocks, we used ReLU, Batch Normalization, and MaxPooling functions. The Context-LSTM could reduce the training time and the GPU memory usage, while keeping a state-of-the-art top-1 accuracy on UCF101 entire validation dataset, show a robust performance on video action detection.

연구 동기 및 목표

  • 비디오 행동 검출 모델의 훈련 시간과 GPU 메모리 소비를 줄이기 위해.
  • 단순화된 아키텍처에도 불구하고 UCF101 벤치마크에서 높은 정확도를 유지하기 위해.
  • 비디오 수준의 행동 인식에 대해 순환적인 LSTM 구조의 효과성을 탐색하기 위해.
  • 인간의 시간적 인지 방식을 모방하는 모델을 설계하기 위해.
  • 최소한의 계산 비용으로 경쟁 가능한 성능을 달성하기 위해.

제안 방법

  • 모델은 순차적인 비디오 특징을 처리하기 위해 LSTM 블록의 연결된 아키텍처를 사용한다.
  • 스택된 LSTM 블록을 통해 셀 상태와 히든 상태의 흐름을 유지함으로써 장기적 의존성 모델링을 수행한다.
  • 블록 간 연결에 ReLU 활성화 함수, 배치 정규화, 최대 풀링을 적용하여 특징 학습과 차원 조절을 향상시킨다.
  • 효율적인 훈련과 추론을 위해 PyTorch로 아키텍처를 구현한다.
  • 시간적 특징는 비디오 프레임에서 추출되어 순차적으로 Context-LSTM에 입력되어 분류된다.
  • 표준 교차 엔트로피 손실을 사용하여 UCF101 데이터셋에서 엔드 투 엔드로 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1단순한 LSTM 기반 아키텍처가 훈련 시간과 메모리 사용량을 줄이며 UCF101에서 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ2정규화 및 풀링를 적용한 연결된 LSTM 아키텍처가 장기적인 시간적 의존성을 얼마나 효과적으로 모델링하는가?
  • RQ3Context-LSTM가 비디오 행동 인식에서 인간과 유사한 시간적 추론을 어느 정도 모방하는가?
  • RQ4비디오 검출 작업에서 모델 복잡도와 성능 사이의 상호 교환 관계는 어떠한가?
  • RQ5경량 순환 모델이 Two-stream이나 C3D와 같은 더 복잡한 아키텍처를 초월하거나 그 성능을 따라잡을 수 있는가?

주요 결과

  • Context-LSTM는 전체 UCF101 검증 세트에서 최신 기술 수준의 모델들과 경쟁 가능한 상위-1 정확도를 달성한다.
  • 기존의 비디오 인식 모델 대비 훈련 시간과 GPU 메모리 사용량을 줄였다.
  • 블록 접합부에 ReLU, 배치 정규화, 최대 풀링을 통합함으로써 특징 표현력과 모델 안정성이 향상되었다.
  • 연결된 LSTM 아키텍처는 장기간의 비디오 시퀀스에 걸쳐 깊은 시간적 특징을 효과적으로 포착한다.
  • UCF101 데이터셋의 다양한 행동 클래스에 걸쳐 강력한 성능을 보였다.
  • 단순함과 낮은 계산 부하에도 불구하고 모델은 뛰어난 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.