Skip to main content
QUICK REVIEW

[논문 리뷰] Action Classification and Highlighting in Videos

Atousa Torabi, Leonid Sigal|arXiv (Cornell University)|2017. 08. 31.
Human Pose and Action Recognition참고 문헌 49인용 수 5
한 줄 요약

이 논문은 객체, 풍경, 동작과 같은 주목할 만한 시각적 특징에 주목함으로써 비디오에서 동작 분류와 프레임 강조를 동시에 수행하는 주목기반 LSTM 모델을 제안한다. 이러한 의미적 카테고리들을 위한 상보적인 VGG-19 특징을 활용함으로써, 이 모델은 ActivityNet에서 최신 기술 수준(SOTA) 성능을 달성하여 mAP를 최대 54.2% 향상시키며, 기존의 순수한 LSTM 및 CNN 기반 모델보다 8퍼센트 이상 뛰어난 성능을 보였다.

ABSTRACT

Inspired by recent advances in neural machine translation, that jointly align and translate using encoder-decoder networks equipped with attention, we propose an attentionbased LSTM model for human activity recognition. Our model jointly learns to classify actions and highlight frames associated with the action, by attending to salient visual information through a jointly learned soft-attention networks. We explore attention informed by various forms of visual semantic features, including those encoding actions, objects and scenes. We qualitatively show that soft-attention can learn to effectively attend to important objects and scene information correlated with specific human actions. Further, we show that, quantitatively, our attention-based LSTM outperforms the vanilla LSTM and CNN models used by stateof-the-art methods. On a large-scale youtube video dataset, ActivityNet, our model outperforms competing methods in action classification.

연구 동기 및 목표

  • 지속적, 시점, 시각적 혼잡도의 변동성이 큰 비디오에서 인간의 동작을 인식하는 데 도전하는 것.
  • 시간적 맥락과 주목할 만한 시각적 단서에 대한 선택적 주목을 통합하여 동작 인식 성능을 향상시키는 것.
  • 동작 분류와 관련 프레임 강조를 동시에 수행하는 엔드 투 엔드 학습을 가능하게 하는 것.
  • 성능 향상에 기여하는 다중 의미 특징(객체, 풍경, 동작)에 주목하는 것의 효과를 탐색하는 것.

제안 방법

  • 비디오의 관련 시간적 세그먼트에 동적으로 집중할 수 있는 소프트 주목 기반 메커니즘을 갖춘 인코더-디코더 LSTM 아키텍처를 사용한다.
  • 스패티오-타임리얼 특징을 위해 C3D 네트워크를 사용하여 비디오 프레임을 인코딩하고, 객체, 풍경, 동작 분류에 맞게 미세조정된 VGG-19 네트워크를 의미 특징 추출에 사용한다.
  • 각 타임스텝에서 주목 가중치를 계산하여 가장 관련성이 높은 시각적 표현에 주목하고, 이를 LSTM 히든 상태에 통합한다.
  • 미분 가능한 주목 기반 메커니즘을 사용하여 엔드 투 엔드 학습이 가능하게 하여, 모델이 동작 인식에 가장 정보가 많은 비디오 부분을 학습할 수 있도록 한다.
  • 다양한 의미 모odal(객체, 풍경, 동작)에 주목하는 다중 주목 헤드를 사용하고, 평균화를 통해 예측을 융합한다.
  • VGG-19 모델의 fc6 및 fc8 레이어 특징을 모두 사용하며, fc8 레이어가 일관되게 더 높은 성능를 보였다.

실험 결과

연구 질문

  • RQ1표준 LSTM 및 CNN 기반 모델과 비교해 볼 때, 주목기반 LSTM 모델이 비디오에서 동작 분류와 프레임 강조를 동시에 향상시킬 수 있는가?
  • RQ2상보적인 의미 특징(객체, 풍경, 동작)에 주목하는 것이 동작 인식 성능 향상에 뚜렷한 기여를 하는가?
  • RQ3다양한 주목 기반 메커니즘(예: 프레임 수준 주목 vs. 최종 상태 주목)이 인식 성능에 어떤 영향을 미치는가?
  • RQ4다른 의미 특징(객체, 풍경, 동작)에 주목하는 모델들이 조합되었을 때, 얼마나 상호 보완적인가?
  • RQ5시각적 혼잡이 존재하는 상황에서도 주목 기반 메커니즘이 의미적으로 관련 있는 시각적 단서를 학습할 수 있는가?

주요 결과

  • 제안된 주목기반 LSTM은 ActivityNet 데이터셋에서 기존의 순수한 LSTM 및 CNN 모델보다 mAP 기준 8퍼센트 이상 높은 성능을 기록했다.
  • 객체, 풍경, 동작 분류에 대해 미세조정된 VGG-19 특징에 주목함으로써, 가장 우수한 개별 모델 대비 최대 5.6퍼센트 향상된 성능를 달성했다.
  • 모든 세 가지 의미 모달리티(객체, 풍경, 동작)에 주목하는 통합 모델은 ActivityNet에서 최고의 mAP 54.2%와 AC 52.8%를 기록했다.
  • '기름 주입하기'와 같은 특정 동작 클래스에서는 '자동차 스피커 설치하기'와 같이 쉽게 감지 가능한 객체를 포함하고 있어 정확도가 30퍼센트 이상 향상되었다.
  • 모든 타임스텝에서 주목을 계산하는 아키텍처(그림 4a)는 최종 스텝에서만 주목을 계산하는 아키텍처(그림 4b)보다 성능이 뛰어났다.
  • 정성적 분석을 통해 주목 기반 메커니즘이 일관되게 의미적으로 관련 있는 객체와 풍경을 강조함으로써 모델의 해석 가능성성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.