Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Linear Dynamical Systems with High-Order Tensor Data for Skeleton based Action Recognition

Wenwen Ding, Kai Liu|arXiv (Cornell University)|2017. 01. 14.
Human Pose and Action Recognition참고 문헌 17인용 수 3
한 줄 요약

이 논문은 3D 스켈레톤 시퀀스를 고차원 텐서 시계열로 모델링하여 공간-시간적 구조를 유지하고 벡터화에 의한 차원의 저주 문제를 피하는 일반화된 선형 동적 시스템(gLDS)을 제안한다. gLDS 파라미터를 추정하기 위해 투커 분해를 적용하고, 액션을 그라스만 만에 있는 부분공간으로 표현함으로써, 사전 학습과 희소 코딩을 사용하여 MSR-Action3D(94.96%), UCF-Kinect(96.48%), Northwestern-UCLA Multiview(92.99%) 데이터셋에서 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

In recent years, there has been renewed interest in developing methods for skeleton-based human action recognition. A skeleton sequence can be naturally represented as a high-order tensor time series. In this paper, we model and analyze tensor time series with Linear Dynamical System (LDS) which is the most common for encoding spatio-temporal time-series data in various disciplines dut to its relative simplicity and efficiency. However, the traditional LDS treats the latent and observation state at each frame of video as a column vector. Such a vector representation fails to take into account the curse of dimensionality as well as valuable structural information with human action. Considering this fact, we propose generalized Linear Dynamical System (gLDS) for modeling tensor observation in the time series and employ Tucker decomposition to estimate the LDS parameters as action descriptors. Therefore, an action can be represented as a subspace corresponding to a point on a Grassmann manifold. Then we perform classification using dictionary learning and sparse coding over Grassmann manifold. Experiments on MSR Action3D Dataset, UCF Kinect Dataset and Northwestern-UCLA Multiview Action3D Dataset demonstrate that our proposed method achieves superior performance to the state-of-the-art algorithms.

연구 동기 및 목표

  • 스켈레톤 기반 액션 인식에서 벡터 기반 표현 방식의 한계를 해결하여 3D 관절 데이터의 구조적 및 고차원 의존성을 유지하지 못하는 문제를 해결한다.
  • 3D 인간 액션 시퀀스를 고차원 텐서 시계열로 모델링하여 공간-시간적 구조를 유지하고 차원의 저주 문제를 완화한다.
  • 기존의 벡터 상태에서 텐서 상태로 확장된 다중선형 변환을 통해 일반화된 LDS(gLDS)를 개발한다.
  • gLDS 파라미터의 투커 분해를 통한 액션 기술자 학습과 그라스만 만에 있는 부분공간으로서의 액션 표현을 통해 액션 인식 정확도를 향상시킨다.
  • 그라스만 만에 기반한 사전 학습과 희소 코딩을 통해 교차 주체 및 교차 시점 액션 인식의 강건성을 확보한다.

제안 방법

  • 스켈레톤 시퀀스를 n차원 텐서 시계열로 표현하여, 각 스켈레톤 프레임을 공간적 구조를 유지하는 (n-1)차원 텐서로 표현한다.
  • 잠재 상태와 관측 상태를 모두 텐서로 간주하고, 벡터 기반 투영 대신 다중선형 변환을 사용하는 일반화된 LDS(gLDS) 모델을 제안한다.
  • 텐서 시계열의 모드-n 행렬화에 대해 투커 분해를 적용하여 gLDS 파라미터를 추정하고 주요 성분을 추출한다.
  • gLDS의 관측 가능성 행렬에서 각 액션의 부분공간 표현을 학습하여 액션을 그라스만 만에 있는 점으로 매핑한다.
  • 분류 성능을 향상시키기 위해 그라스만 만에 기반한 사전 학습과 희소 코딩을 수행한다.
  • 기존의 2RB 및 LTBSVM과 같은 기준 방법보다 성능을 향상시키는 새로운 학습 알고리즘(3RB)을 사용하여 프레임워크를 최적화한다.

실험 결과

연구 질문

  • RQ13D 스켈레톤 시퀀스를 고차원 텐서 시계열로 모델링하는 것이, 벡터화된 표현 방식에 비해 액션 인식 성능을 향상시키는가?
  • RQ2텐서 상태에서 작동하는 일반화된 LDS(gLDS)가 기존의 벡터 기반 LDS보다 공간-시간 역학을 더 잘 포착하는가?
  • RQ3gLDS 파라미터의 투커 분해가 구조적 정보를 유지하면서도 분류에 효과적인 액션 기술자를 효과적으로 추출하는가?
  • RQ4그라스만 만에 기반한 사전 학습과 희소 코딩이 스켈레톤 기반 액션 인식 작업의 분류 정확도를 어떻게 향상시키는가?
  • RQ5제안된 방법이 다중시점 액션 데이터셋에서 주체 및 시점 간의 일반화 능력에 얼마나 뛰어난가?

주요 결과

  • 제안된 gLDS 방법은 도전적인 한 사람을 제외한 주체에 대한 교차 검증 프rotocol를 적용한 MSR-Action3D 데이터셋에서 총 정확도 94.96%를 달성하여 이전 최신 기술 수준의 방법들을 능가한다.
  • UCF-Kinect 데이터셋에서의 전체 정확도는 96.48%를 기록하였으며, 이는 HOJ3D 및 LTBSVM보다 각각 7.98%, 5.56% 높은 성능이다.
  • Northwestern-UCLA Multiview 데이터셋의 교차 주체 설정에서 92.99%의 정확도를 달성하여 MST-AOG 대비 10.8% 높은 성능을 보이며 주체 변화에 대한 강건성을 입증했다.
  • 교차 시점 설정에서는 74.6%의 정확도를 기록하여 MST-AOG 대비 1.3% 향상되었으며, 이는 중간 정도의 시점 불변성을 나타내지만, 3D 관절 좌표에만 의존함으로써 성능에 한계가 있음을 시사한다.
  • 하위공간 차원이 16까지 증가함에 따라 인식률이 상승하지만, 이후 노이즈와 클래스 간 혼동으로 인해 성능이 저하됨을 확인하여 정보와 복잡성 간의 최적 균형이 존재함을 시사한다.
  • 혼동 행렬 분석 결과 대부분의 액션에 대해 높은 분류 정확도(>95%)를 기록하였으며, 오류는 주로 '높은 손 흔들기'와 '손으로 잡기'처럼 유사한 액션 간에 주로 발생한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.