Skip to main content
QUICK REVIEW

[논문 리뷰] Sparse Coding of Shape Trajectories for Facial Expression and Action Recognition

Amor Ben Tanfous, Hassen Drira|arXiv (Cornell University)|2019. 08. 08.
Human Pose and Action Recognition참고 문헌 81인용 수 5
한 줄 요약

이 논문은 케נדל의 형태 공간에서 2D/3D 랜드마크 트랙토리의 모델링을 통해 얼굴 표정 및 동작 인식을 위한 리만 스parse coding 및 사전 학습(Scalable Coding and Dictionary Learning, SCDL)을 제안한다. 2D 얼굴 표정에 대해서는 재생핵 힐버트 공간(RKHS)에서 외재적 SCDL을 사용하고, 3D 골격 동작에 대해서는 접선 공간에서 내재적 SCDL을 적용하여 비선형 다양체에서의 분류성, 희소성, 유클리드 공간 호환성을 확보한 표현을 통해 최신 기법들과 경쟁 가능한 성능을 달성한다.

ABSTRACT

The detection and tracking of human landmarks in video streams has gained in reliability partly due to the availability of affordable RGB-D sensors. The analysis of such time-varying geometric data is playing an important role in the automatic human behavior understanding. However, suitable shape representations as well as their temporal evolution, termed trajectories, often lie to nonlinear manifolds. This puts an additional constraint (i.e., nonlinearity) in using conventional Machine Learning techniques. As a solution, this paper accommodates the well-known Sparse Coding and Dictionary Learning approach to study time-varying shapes on the Kendall shape spaces of 2D and 3D landmarks. We illustrate effective coding of 3D skeletal sequences for action recognition and 2D facial landmark sequences for macro- and micro-expression recognition. To overcome the inherent nonlinearity of the shape spaces, intrinsic and extrinsic solutions were explored. As main results, shape trajectories give rise to more discriminative time-series with suitable computational properties, including sparsity and vector space structure. Extensive experiments conducted on commonly-used datasets demonstrate the competitiveness of the proposed approaches with respect to state-of-the-art.

연구 동기 및 목표

  • 시간적 랜드마크 데이터에서 비선형 형태 다양체의 과제를 해결하기 위해.
  • 2D 및 3D 케נדל 형태 공간에서 형태 트랙토리의 통합된 희소 코드화 프레임워크를 개발하기 위해.
  • 얼굴 표정 및 동작 인식에서 최적의 성능를 얻기 위해 내재적 및 외재적 SCDL 솔루션을 비교하기 위해.
  • 다양체 값 트랙토리를 희소하고 분류 가능한 시간 시리즈로 변환하여 유클리드 공간에서 효과적인 시간적 모델링 및 분류를 가능하게 하기 위해.
  • 표준 벤치마크를 통해 매크로 및 마이크로 표정 인식, 3D 동작 인식에 대해 제안된 방법의 효과성을 입증하기 위해.

제안 방법

  • 2D/3D 랜드마크 시퀀스를 케נדל 형태 공간에서의 트랙토리로 표현하여 시야 불변 분석을 달성하기 위해.
  • 2D 얼굴 트랙토리를 재생핵 힐버트 공간(RKHS)에 임bedding하기 위해 프로크루스테스 가우시안 커널을 사용하여 외재적 SCDL을 적용하기 위해.
  • 다양체 상의 기준점의 접선 공간에 데이터를 투영하여 3D 골격 트랙토리에 대해 내재적 SCDL을 구현하기 위해.
  • 학습 데이터로부터 리만 사전을 학습하여 형태 트랙토리의 희소 코드화를 가능하게 하면서 기하학적 구조를 유지하기 위해.
  • 희소 코드를 유클리드 공간에서 시간적 모델링 및 분류를 위한 분류 가능한 특징으로 사용하기 위해.
  • 최종적으로 생성된 희소 시간 시리즈에 표준 분류기(SVM 등)를 적용하여 인식 작업을 수행하기 위해.

실험 결과

연구 질문

  • RQ1외재적 SCDL이 2D 얼굴 표정 인식에 얼마나 효과적인가? 특히 CK+ 데이터셋에서 미묘한 표정, 예를 들어 경멸 같은 감정에 대해.
  • RQ23D 동작 인식에서 접선 공간에서의 내재적 SCDL은 외재적 SCDL에 비해 성능 및 내성에 대해 어떻게 비교되는가?
  • RQ3케נדל 형태 공간에서 형태 트랙토리의 희소 코드화가 원시 랜드마크 시퀀스보다 더 분류 가능하고 노이즈에 강건한 특징을 제공할 수 있는가?
  • RQ4커널 선택 및 파rameter 설정(예: 프로크루스테스 가우시안 커널의 σ)이 3D 형태 공간에서 외재적 SCDL의 성능에 미치는 영향은 무엇인가?
  • RQ5제안된 프레임워크는 마이크로 표정을 포함한 다양한 데이터셋과 표정 유형으로 일반화되는가?

주요 결과

  • 외재적 SCDL은 프로크루스테스 가우시안 커널을 사용하여 CK+ 데이터셋에서 경멸과 같은 미묘한 감정에 대해 내재적 SCDL보다 뛰어난 성능을 보였다.
  • 외재적 접근은 2D 마이크로 표정 인식에서도 유망한 결과를 도출하여 미세한 형태 변형을 효과적으로 포착할 수 있음을 확인했다.
  • 3D 동작 인식에서는 내재적 SCDL이 뛰어난 성능을 보였는데, 이는 3D 케נדל 공간에 양의 정부호 커널이 없어 외재적 SCDL의 효과가 제한되기 때문이다.
  • 제안된 희소 코드화 프레임워크는 분류 가능하고 노이즈에 강건하며 유클리드 공간 호환 가능한 특징을 생성하여 유클리드 공간에서 효과적인 분류를 가능하게 했다.
  • 광범위한 실험을 통해 제안된 방법은 표준 벤치마크에서 얼굴 표정 및 동작 인식 분야에서 최신 기법들과 경쟁 가능한 성능을 보였다.
  • 비교 연구를 통해 내재적 SCDL이 기준점에서의 접선 공간 근사에 의한 왜곡을 피할 수 있어, 큰 변동성이 있는 3D 데이터에 더 적합함을 밝혔다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.