Skip to main content
QUICK REVIEW

[논문 리뷰] Skepxels: Spatio-temporal Image Representation of Human Skeleton Joints for Action Recognition

Jian Liu, Naveed Akhtar|arXiv (Cornell University)|2017. 11. 16.
Human Pose and Action Recognition참고 문헌 53인용 수 17
한 줄 요약

이 논문은 인간의 뼈대 관절 시퀀스를 유연한 차원의 이미지로 변환하여 효과적인 CNN 기반 동작 인식을 가능하게 하는 새로운 시공간 이미지 표현인 Skepxels을 제안한다. 고유한 거리 척도를 사용해 관절을 2차원 격자로 정렬하고 위치와 속도를 모두 인코딩함으로써, 풍부한 시공간 상관관계를 포착한다. 이로 인해 NTU, NUCLA, UTD-MHAD 데이터셋에서 각각 4.4%, 5.7%, 9.3%의 최신 기준 성능 향상을 달성한다.

ABSTRACT

Human skeleton joints are popular for action analysis since they can be easily extracted from videos to discard background noises. However, current skeleton representations do not fully benefit from machine learning with CNNs. We propose "Skepxels" a spatio-temporal representation for skeleton sequences to fully exploit the "local" correlations between joints using the 2D convolution kernels of CNN. We transform skeleton videos into images of flexible dimensions using Skepxels and develop a CNN-based framework for effective human action recognition using the resulting images. Skepxels encode rich spatio-temporal information about the skeleton joints in the frames by maximizing a unique distance metric, defined collaboratively over the distinct joint arrangements used in the skeletal image. Moreover, they are flexible in encoding compound semantic notions such as location and speed of the joints. The proposed action recognition exploits the representation in a hierarchical manner by first capturing the micro-temporal relations between the skeleton joints with the Skepxels and then exploiting their macro-temporal relations by computing the Fourier Temporal Pyramids over the CNN features of the skeletal images. We extend the Inception-ResNet CNN architecture with the proposed method and improve the state-of-the-art accuracy by 4.4% on the large scale NTU human activity dataset. On the medium-sized N-UCLA and UTH-MHAD datasets, our method outperforms the existing results by 5.7% and 9.3% respectively.

연구 동기 및 목표

  • 희소하고 이미지처럼 보이지 않는 관절 데이터로 인해 CNN의 잠재력이 제한적으로 활용되고 있는 문제를 해결하기 위해.
  • 의미를 왜곡하고 노이즈를 유발하는 열 기반 또는 업샘플링된 뼈대 표현 방식의 한계를 극복하기 위해.
  • 다양한 프레임 간 뼈대 관절 간의 시공간 상관관계를 유지하는 유연하고 학습 가능한 이미지 표현을 개발하기 위해.
  • CNN 특징를 활용해 미시적 시간적 관절 관계와 거시적 시간적 행동 패tern을 계층적으로 모델링하기 위해.
  • 정밀한 3D 뼈대 데이터뿐 아니라 실제 RGB 비디오 뼈대 데이터에도 잘 일반화됨을 입증하기 위해.

제안 방법

  • Skepxels은 뼈대 관절의 위치를 다중 프레임에서 가져와 관절 배열에 대한 고유한 거리 척도를 사용해 2차원 텐서로 정렬함으로써 새로운 원자적 시각 단위인 '뼈대 픽셀'을 정의한다.
  • 이 방법은 다양한 프레임의 Skepxels을 배열하여 임의의 차원을 가진 뼈대 이미지를 구성함으로써 시공간 역학을 유지한다.
  • 이미지 텐서에 연속 프레임 간의 시간적 차이를 통합하여 관절 위치와 속도를 모두 인코딩한다.
  • 계층적 CNN 파이프라인을 사용한다: 먼저 Inception-ResNet이 Skepxel 이미지에서 미시적 시간적 특징을 추출하고, 이후 푸리에 시간 피라미드가 프레임 간 거시적 시간적 의존성을 모델링한다.
  • 이 접근법은 Inception-ResNet, GoogLeNet, ResNet 등 다양한 CNN 아키텍처를 지원하며, 추가 정확도 향상을 위한 모델 앙상블도 가능하다.
  • 노이즈가 있는 뼈대 데이터에 대해서도 강건함을 입증하였으며, DeeperCut로 추출한 관절을 사용한 RGB 비디오에서도 유사한 성능을 기록하였다.

실험 결과

연구 질문

  • RQ1적절히 이미지로 표현된 뼈대 관절 시퀀스만을 사용해도 CNN 기반의 동작 인식 프레임워크가 최신 기준 성능을 달성할 수 있는가?
  • RQ2열 기반 또는 업샘플링된 표현 방식과 비교해 2차원 격자 기반의 뼈대 이미지 표현 방식은 시공간 상관관계를 얼마나 잘 포착하는가?
  • RQ3Skepxels이 단일 이미지 텐서 내에서 관절 위치와 속도와 같은 의미론적 개념을 얼마나 잘 인코딩할 수 있는가?
  • RQ4제안된 표현 방식은 정밀하지 않은 뼈대 추출을 가진 실제 RGB 비디오 데이터에도 일반화되는가?
  • RQ5Skepxels을 활용한 계층적 특징 학습(미시적 및 거시적 시간적)이 다양한 데이터셋에서 인식 정확도를 크게 향상시킬 수 있는가?

주요 결과

  • 제안된 Skepxel 표현 방식은 대규모 NTU 인간 행동 데이터셋에서 4.4%의 정확도 향상을 이끌어내며 새로운 최신 기준을 수립하였다.
  • NUCLA 데이터셋에서는 기존 방법 대비 5.7%의 정확도 향상을 달성하여 강력한 일반화 능력을 입증하였다.
  • UTD-MHAD 데이터셋에서는 9.3%의 정확도 향상을 기록하여 중간 규모의 다중 모odal 행동 데이터에 대해 표현 방식의 효과성을 입증하였다.
  • 모든 데이터셋과 CNN 아키텍처에서 위치와 속도 정보를 모두 포함한 Skepxels(Loc+Vel)는 위치 정보만 포함한 인코딩보다 일관되게 높은 성능을 기록하였다.
  • 노이즈가 있는 뼈대 데이터에 대해서도 일반화 능력이 뛰어나, DeeperCut로 추출한 관절을 사용한 경우 UTD-MHAD에서 92.3%의 정확도를 기록하여 정밀한 3D 뼈대 데이터를 사용한 결과와 유사한 성능을 확보하였다.
  • Skepxels을 사용해 여러 CNN 모델을 앙상블함으로써 성능을 추가로 향상시킬 수 있었으며, UTD-MHAD에서 98.6%의 정확도에 도달하여 이 접근법의 확장성과 강건성을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.