Skip to main content
QUICK REVIEW

[논문 리뷰] Attention-based Temporal Weighted Convolutional Neural Network for Action Recognition

Jinliang Zang, Le Wang|arXiv (Cornell University)|2018. 03. 19.
Human Pose and Action Recognition참고 문헌 41인용 수 17
한 줄 요약

이 논문은 의미적으로 중요한 비디오 스니펫에 집중하기 위해 학습 가능한 시간적 주의를 적용하여 영상 행동 인식을 향상시키는 주의 기반 시간 가중 컨볼루션 신경망(ATW)을 제안한다. 다중 스트림 CNN에 소프트 주의 메커니즘을 통합함으로써 ATW는 엔드 투 엔드 학습을 가능하게 하고, UCF-101에서 94.6%의 정확도와 HMDB-51에서 70.5%의 정확도를 달성하여 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Research in human action recognition has accelerated significantly since the introduction of powerful machine learning tools such as Convolutional Neural Networks (CNNs). However, effective and efficient methods for incorporation of temporal information into CNNs are still being actively explored in the recent literature. Motivated by the popular recurrent attention models in the research area of natural language processing, we propose the Attention-based Temporal Weighted CNN (ATW), which embeds a visual attention model into a temporal weighted multi-stream CNN. This attention model is simply implemented as temporal weighting yet it effectively boosts the recognition performance of video representations. Besides, each stream in the proposed ATW framework is capable of end-to-end training, with both network parameters and temporal weights optimized by stochastic gradient descent (SGD) with backpropagation. Our experiments show that the proposed attention mechanism contributes substantially to the performance gains with the more discriminative snippets by focusing on more relevant video segments.

연구 동기 및 목표

  • 고정된 시간 풀링을 초월하여 장거리 시간적 의존성을 효과적으로 모델링함으로써 영상 내 행동 인식을 향상시키기 위해.
  • 긴 영상에서 노이즈가 있거나 관련성이 없는 영상 세그먼트 문제를 해결하기 위해 가장 분류에 유용한 스니펫에 집중할 수 있도록 학습하기 위해.
  • 인간 자세와 같은 추가 애너테이션 없이도 엔드 투 엔드로 학습 가능한 시간적 주의 메커니즘을 설계하기 위해.
  • 표준 데이터셋 레이블만을 사용하여 UCF-101 및 HMDB-51와 같은 표준 벤치마크에서 최신 기술 수준의 성능를 달성하기 위해.
  • 간단한 학습 가능한 주의를 가진 시간적 가중치가 영상 수준 예측에서 균일하거나 고정된 가중치 방법보다 뛰어난 성능을 낼 수 있음을 보여주기 위해.

제안 방법

  • ATW 프레임워크는 각 스트림이 겹치지 않는 영상 세그먼트에서 다른 스니펫(예: RGB, 옵티컬 플로우, 워프드 플로우)을 처리하는 다중 스트림 CNN 아키텍처를 사용한다.
  • 학습 가능한 시간적 주의 메커니즘이 행동 클래스에 대한 관련성에 따라 각 스니펫에 동적 가중치를 할당하며, 시간 세그먼트에 대한 소프트 주의 레이어로 구현된다.
  • 주의 가중치는 완전 연결 레이어를 거친 후 소프트맥스 활성화 함수를 통해 계산되며, 이는 네트워크가 최종 예측에 가장 기여하는 스니펫을 학습할 수 있도록 한다.
  • 컨볼루션 가중치와 주의 파rameter를 포함한 전체 네트워크는 확률적 경사 하강법을 사용하여 역전파를 통해 엔드 투 엔드로 학습된다.
  • 주의 메커니즘은 영상 수준의 예측 단계에서 적용되며, 모든 스니펫의 특징이 가중치가 부여되고 융합된 후 최종 분류 레이어로 전달된다.
  • 기본 네트워크로 ResNet을 사용하며, 공간 스트림은 ImageNet에서 사전 훈련하고, 시간 스트림은 교차 모odal 사전 훈련을 통해 훈련한다.

실험 결과

연구 질문

  • RQ1학습 가능한 시간적 가중치 메커니즘이 가장 정보적인 영상 세그먼트에 집중함으로써 영상 행동 인식을 향상시킬 수 있는가?
  • RQ2표준 데이터셋 레이블만을 사용하여 주의 메커니즘을 엔드 투 엔드로 훈련하면, 고정되거나 균일한 가중치 전략보다 성능이 향상되는가?
  • RQ3제안된 ATW 모델은 UCF-101 및 HMDB-51와 같은 표준 벤치마크에서 최신 기술 수준의 방법들과 비교해 어떻게 성능을 내는가?
  • RQ4주의 메커니즘이 배경 혼잡성이 있는 긴 복잡한 영상에서 의미적으로 중요한 프레임을 효과적으로 식별하고 우선순위를 정할 수 있는가?
  • RQ5인식 정확도를 최대화하기 위해 주의 레이어의 최적의 영상 세그먼트 수(N)와 초기화 전략은 무엇인가?

주요 결과

  • 제안된 ATW 모델은 UCF-101 데이터셋에서 94.6%의 탑-1 정확도를 달성하여, 이전 최신 기술 수준의 TSN(3 모odal)의 93.4%와 KVMF의 93.1%를 초월한다.
  • HMDB-51 데이터셋에서 ATW는 70.5%의 정확도를 기록하여, TSN(3 모달)의 69.4%와 최근 모델인 LTC(64.8%) 및 KVMF(63.3%)를 모두 능가한다.
  • UCF-101에서 최고의 성능은 N=4개 세그먼트에서 달성되었으며, 이는 85.80%의 정확도를 기록했고, 다양한 세그먼트 수에 대해 모델이 강건함을 보였다.
  • 주의 가중치를 1로, 바이어스를 0으로 초기화할 경우 UCF-101에서 가장 높은 정확도(85.80%)를 기록했으며, 랜덤 가우시안 및 균일 초기화보다 우수한 성능을 보였다.
  • 주의 가중치의 시각화 결과는 모델이 전경 행동 세그먼트에 집중하고 배경 또는 관련 없는 프레임을 억제하는 방식으로 학습하고 있음을 확인했다.
  • 제거 분석 결과, 주의 메커니즘이 균일한 가중치 전략보다 성능을 크게 향상시키며, 노이즈를 감소시키고 분류에 도움이 되는 특징을 강화하는 데 효과적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.