Skip to main content
QUICK REVIEW

[논문 리뷰] Temporal attention filters for human activity recognition in videos.

AJ Piergiovanni, Chenyou Fan|arXiv (Cornell University)|2016. 05. 26.
Human Pose and Action Recognition인용 수 5
한 줄 요약

이 논문은 변수 지속 시간을 가진 하위 이벤트를 모델링하여 비디오 내 인간 행동 인식을 향상시키기 위해 미분 가능한 시간 주기적 주의 필터를 소개한다. 이 방법은 정적 또는 LSTM으로 학습된 동적 필터를 사용하여 관련 시간 세그먼트에 집중하며, CNN과 함께 엔드 투 엔드 훈련이 가능하게 하여 명시적인 시간 구조를 포착함으로써 인식 정확도를 향상시킨다.

ABSTRACT

In this paper, we newly introduce the concept of temporal attention filters, and describe how they can be used for human activity recognition from videos. Many high-level activities are often composed of multiple temporal parts (e.g., sub-events) with different duration/speed, and our objective is to make the model explicitly consider such temporal structure using multiple temporal filters. Our attention filters are designed to be fully differentiable, allowing end-of-end training of the temporal filters together with the underlying frame-based or segment-based convolutional neural network architectures. The paper not only presents an approach of learning optimal static temporal attention filters to be shared across different videos, but also describes an approach of dynamically adjusting attention filters per testing video using recurrent long short-term memory networks (LSTMs). We experimentally confirm that the proposed concept of temporal attention filters benefits the activity recognition tasks by capturing the temporal structure in videos.

연구 동기 및 목표

  • 비디오 내에서 지속 시간과 속도가 다양하게 변하는 하위 이벤트로 구성된 고수준 행동을 인식하는 데 도전 과제를 해결하기 위해.
  • 인식 성능 향상을 위해 비디오 시퀀스의 시간 구조를 명시적으로 모델링하는 메커니즘을 개발하기 위해.
  • 완전히 미분 가능한 시간 주의 필터를 설계하여 컨volutional 신경망과 함께 공동 훈련이 가능하게 하기 위해.
  • 각 비디오에 맞게 최적화되는 LSTMs를 사용한 정적 및 동적 적응형 주의 필터를 탐색하기 위해.

제안 방법

  • 비디오 프레임 또는 세그먼트의 관련 시간 세그먼트에 집중할 수 있는 학습 가능한, 미분 가능한 모듈로 시간 주의 필터를 제안한다.
  • 모든 비디오에 공통적으로 사용되는 정적 시간 주의 필터를 도입하며, 엔드 투 엔드 훈련 중 최적화한다.
  • 입력 비디오 시퀀스에 따라 필터 파라미터를 적응적으로 조정할 수 있는 LSTMs를 사용한 동적 주의 메커니즘을 개발한다.
  • 프레임 기반 또는 세그먼트 기반 CNN 아키텍처와 주의 필터를 통합하여 공동 최적화를 수행한다.
  • 시간 역전파(backpropagation through time)와 표준 역전파를 사용하여 주의 필터와 기반 CNN을 함께 훈련한다.
  • 시간 윈도우에 걸쳐 학습 가능한 주의 가중치 분포를 사용하여 중요한 하위 이벤트에 초점을 맞춘다.

실험 결과

연구 질문

  • RQ1학습 가능한 시간 주의 필터는 지속 시간이 다양하게 변하는 하위 이벤트를 포함한 복잡한 인간 행동 인식을 향상시킬 수 있는가?
  • RQ2미분 가능한 시간 주의 필터의 통합은 비디오 기반 행동 인식 성능 향상에 기여하는가?
  • RQ3LSTM을 통한 동적 주의와 정적 주의는 다양한 시간 구조를 모델링할 때 어떻게 비교되는가?
  • RQ4주의 메커니즘은 비디오 인식에서 CNN과 함께 엔드 투 엔드로 효과적으로 훈련될 수 있는가?

주요 결과

  • 제안된 시간 주의 필터는 비디오 내에서 지속 시간이 다양하게 변하는 하위 이벤트를 명시적으로 모델링함으로써 행동 인식 성능을 향상시킨다.
  • 미분 가능한 주의 필터의 사용은 CNN과 함께 엔드 투 엔드 훈련이 가능하게 하여 특징 학습과 시간 정렬을 향상시킨다.
  • LSTM을 통한 동적 주의 메커니즘은 각 비디오에 맞게 시간 집중 영역을 적응적으로 조정할 수 있어 시간 변동성에 대한 강건성을 향상시킨다.
  • 명시적인 시간 주의 메커니즘이 없는 기준 모델 대비 인식 정확도가 향상됨을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.