Skip to main content
QUICK REVIEW

[논문 리뷰] Order-aware Convolutional Pooling for Video Based Action Recognition

Peng Wang, Lingqiao Liu|arXiv (Cornell University)|2016. 01. 31.
Human Pose and Action Recognition참고 문헌 30인용 수 4
한 줄 요약

이 논문은 순서 인식 가능 합성곱 풀링을 제안하며, 각 특징 차원의 시간적 변화에 대해 학습 가능한 1D 합성곱 필터를 적용함으로써 영상 행동 인식에서 동적 시간 정보를 포착하는 새로운 시간 풀링 방법이다. 기존의 풀링 방법보다는 최소한의 파라미터 증가로 현저히 뛰어난 성능을 기록한다. HMDB51과 UCF101에서 각각 64.1%와 89.6%의 정확도를 달성하며, 상태의 기준을 초월하면서도 계산 효율성을 유지한다.

ABSTRACT

Most video based action recognition approaches create the video-level representation by temporally pooling the features extracted at each frame. The pooling methods that they adopt, however, usually completely or partially neglect the dynamic information contained in the temporal domain, which may undermine the discriminative power of the resulting video representation since the video sequence order could unveil the evolution of a specific event or action. To overcome this drawback and explore the importance of incorporating the temporal order information, in this paper we propose a novel temporal pooling approach to aggregate the frame-level features. Inspired by the capacity of Convolutional Neural Networks (CNN) in making use of the internal structure of images for information abstraction, we propose to apply the temporal convolution operation to the frame-level representations to extract the dynamic information. However, directly implementing this idea on the original high-dimensional feature would inevitably result in parameter explosion. To tackle this problem, we view the temporal evolution of the feature value at each feature dimension as a 1D signal and learn a unique convolutional filter bank for each of these 1D signals. We conduct experiments on two challenging video-based action recognition datasets, HMDB51 and UCF101; and demonstrate that the proposed method is superior to the conventional pooling methods.

연구 동기 및 목표

  • 기존의 시간 풀링 방법(예: 평균 풀링 또는 최대 풀링)이 프레임 순서를 忽시하여 영상 행동 인식에서 동적 시간 정보를 손실한다는 한계를 해결하기 위해.
  • 고차원 특징 공간에서 파라미터 폭발을 일으키지 않으면서도, 각 프레임 수준의 특징에 대한 국소적 시간 패턴을 포착할 수 있는 파라미터 효율적인 방법을 개발하기 위해.
  • 각 특징 차원의 시간적 변화를 1D 신호로 모델링하고, 지도 학습 기반의 필터 베이스를 적용하여 판별 가능한 패턴을 탐지함으로써 영상 수준의 표현 학습을 향상시키기 위해.
  • 표준 풀링 및 최신 기술 대비 순서 인식 표현을 학습함으로써 성능 향상이 이루어지는지 표준 벤치마크에서 입증하기 위해.

제안 방법

  • 각 프레임 수준의 특징 차원의 시간적 변화를 1D 신호로 간주하여, 전용 합성곱 필터 베이스를 통해 국소적 시간 패턴 탐지를 가능하게 한다.
  • 각 특징 차원에 대해 고유한 1D 합성곱 필터 세트를 학습하며, 이는 시간 순서에서의 국소적 동적 패턴을 탐지하는 검출기 역할을 한다.
  • 모든 차원의 필터 응답을 표준 시간 풀링(예: 평균 또는 최대 풀링)을 통해 집계하여 최종 영상 수준의 표현을 형성한다.
  • 분류를 위해 선형 SVM를 사용하는 엔드 투 엔드 학습 방식으로 지도 학습을 수행한다.
  • 전체 고차원 특징 텐서에 3D 합성곱을 적용하는 대신 각 특징 차원 별로 독립적으로 작동함으로써 파라미터 폭발을 방지한다.
  • L2 정규화와 연결을 통해 외관 및 운동 특징을 융합한 후, 통합 표현에 대해 순서 인식 풀링을 적용한다.

실험 결과

연구 질문

  • RQ1학습 가능한 1D 합성곱을 사용해 개별 특징 차원의 시간적 변화를 모델링할 경우, 표준 풀링 방법을 초월해 영상 행동 인식 성능을 향상시킬 수 있는가?
  • RQ2제안된 순서 인식 가능 합성곱 풀링 방법은 표준 풀링 및 최신 기술 대비 표준 영상 행동 인식 벤치마크에서 어떻게 성능을 내는가?
  • RQ3외관 및 운동 특징을 융합함으로써 성능 향상이 이루어지는가? 또한 IDT와 같은 비지도 풀링 전략과 어떻게 보완되는가?
  • RQ4각 차원당 필터 수가 성능 및 일반화 능력에 얼마나 영향을 미치는가?
  • RQ5이 방법은 영상 행동 인식 외의 시간 시리즈 작업(예: 텍스트 분류)으로도 일반화 가능한가?

주요 결과

  • HMDB51 데이터셋에서 제안된 방법은 64.1%의 정확도를 달성하였으며, 베이스라인 방법(CNN + 글로벌 운동 풀링)보다 1.6% 높고, 두 번째로 좋은 방법(스택드 피셔 벡터)보다 2.7% 높은 성능을 기록하였다.
  • UCF101 데이터셋에서 방법은 89.6%의 정확도를 기록하였으며, 최신 기술인 딥 넷(88.6%)보다 1.0% 높고, 두 개의 스트림 컨볼루션 넷(88.0%)보다 1.6% 높은 성능을 보였다.
  • 비지도 글로벌 운동 풀링과 조합했을 때, UCF101에서의 성능이 89.6%로 상승하여, 지도 학습 및 비지도 표현 간 강력한 보완성을 입증하였다.
  • 외관 및 운동 특징을 융합한 경우, UCF101에서 0.9% 향상되고, HMDB51에서 1.6% 향상되어, 다중 모odal 특징 융합에서의 효과성을 입증하였다.
  • 제거 분석 결과, 필터 수를 늘일수록 성능 향상이 이루어지며, 높은 필터 수에서 최적의 성능 향상이 관찰되어, 방법의 확장성과 학습 능력을 검증하였다.
  • LRCN(68.2%) 및 공간-시간 컨볼루션 넷(63.3%)과 비교해도 뛰어난 성능을 기록하여, 순환 또는 3D 합성곱을 사용하는 딥 러닝 모델 대비도 효과성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.