Skip to main content
QUICK REVIEW

[논문 리뷰] Generalized Rank Pooling for Activity Recognition

Anoop Cherian, Basura Fernando|arXiv (Cornell University)|2017. 04. 07.
Human Pose and Action Recognition참고 문헌 43인용 수 18
한 줄 요약

이 논문은 영상 클립의 CNN 특징에서 저질서 부분공간 표현을 학습함으로써 시간적 순서를 유지하는, 라만 최적화 기반의 새로운 방법인 일반화된 랭크 풀링(GRP)을 제안한다. 영상 시퀀스를 그라스만 만에 있는 부분공간으로 모델링하고 코너지이트 경사 하강법을 사용함으로써, 여러 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 평균 풀링 및 랭크 풀링보다 일부 데이터셋에서 최대 20% 향상된 성능을 기록한다.

ABSTRACT

Most popular deep models for action recognition split video sequences into short sub-sequences consisting of a few frames; frame-based features are then pooled for recognizing the activity. Usually, this pooling step discards the temporal order of the frames, which could otherwise be used for better recognition. Towards this end, we propose a novel pooling method, generalized rank pooling (GRP), that takes as input, features from the intermediate layers of a CNN that is trained on tiny sub-sequences, and produces as output the parameters of a subspace which (i) provides a low-rank approximation to the features and (ii) preserves their temporal order. We propose to use these parameters as a compact representation for the video sequence, which is then used in a classification setup. We formulate an objective for computing this subspace as a Riemannian optimization problem on the Grassmann manifold, and propose an efficient conjugate gradient scheme for solving it. Experiments on several activity recognition datasets show that our scheme leads to state-of-the-art performance.

연구 동기 및 목표

  • 영상 특징에서 시간적 순서를 손실하는 전통적인 풀링 방법의 한계를 해결하기 위해.
  • 저질서 부분공간 표현을 통해 딥 CNN 특징의 시간적 동역학을 유지함으로써 행동 인식을 향상시키기 위해.
  • 이전의 랭크 풀링의 제약, 즉 단일 선에 의존하고 선형 순위 매기기에 의존하는 점을 개선하기 위해, 다중 정규직교 초평면으로 일반화하기 위해.
  • 직교 제약 조건 하에 이러한 부분공간을 학습하기 위한 효율적인 최적화 프레임워크를 개발하기 위해.
  • 기존의 풀링 및 인식 방법과 비교하여 부분공간 기반 영상 표현의 우수성을 입증하기 위해.

제안 방법

  • GRP는 부분공간이 압축된 영상 표현을 나타내는, 그라스만 만에 있는 라만 최적화 문제로 풀링 문제를 공식화한다.
  • 프로젝션된 특징에서 시간적 순서를 유지하기 위해, 저질서 근사 오차와 이차 순위 손실을 동시에 최소화한다.
  • 부분공간 기저의 직교 제약 조건은 라만 최적화를 통해 강제되며, 특히 코너지이트 경사 하강법 알고리즘을 사용한다.
  • RGB 및 옵티컬 플로우 입력을 사용하여 짧은 영상 클립의 중간 CNN 특징에서 부분공간 파arameter를 엔드 투 엔드로 학습한다.
  • 이 방법은 이중 스트림 네트워크 아키텍처에서 적용되며, VGG-16 및 ResNet-152 모델에서 특징이 추출된다.
  • 비선형 분류기로 그라스만 만에 임bedded된 부분공간 파arameter에서 분류를 수행한다.

실험 결과

연구 질문

  • RQ1저질서 부분공간 표현은 평균 풀링 또는 최대 풀링보다 영상 특징의 시간적 순서를 더 효과적으로 유지할 수 있는가?
  • RQ2단일 선에서 다차원 부분공간으로 랭크 풀링을 일반화함으로써 행동 인식 정확도가 향상되는가?
  • RQ3그라스만 만에서의 라만 최적화는 비볼록이고 직교 제약 조건이 있는 최적화 문제를 효율적으로 해결할 수 있는가?
  • RQ4다양한 행동 인식 벤치마크에서 GRP는 최신 기술 수준의 방법들과 비교해 어떤 성능을 보이는가?
  • RQ5더 깊은 CNN(예: ResNet-152)을 사용할 경우 GRP 프레임워크의 성능 향상 정도는 어느 정도인가?

주요 결과

  • GRP는 HMDB-51 및 UCF101 데이터셋에서 최신 기술 수준 성능를 달성하였으며, ResNet-152 특징을 사용할 경우 평균 정확도 93.5%를 기록하였다.
  • JHMDB 데이터셋에서는 IDT-FV 특징을 사용하여 73.7%의 정확도를 기록하였으며, 이는 이전 최신 기술 수준 방법보다 1.5% 높은 성능였다.
  • MPII 및 JHMDB에서 GRP는 랭크 풀링보다 10~20% 향상된 성능를 기록하였으며, 직선 대비 부분공간 사용의 이점을 입증하였다.
  • 순서 제약 조건이 없는 변형은 GRP보다 유의미하게 열등한 성능를 보였으며, 시간적 순서 유지의 중요성을 확인하였다.
  • VGG-16 특징 대비 ResNet-152 특징을 사용할 경우 성능 향상이 7% 발생하였으며, 더 깊은 네트워크와의 확장 가능성도 입증하였다.
  • JHMDB의 21개 행동 중 13개에서 GRP는 최근의 P-CNN 방법을 능가하였으며, 19개 행동에서는 동일하거나 우월한 성능를 기록하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.