Skip to main content
QUICK REVIEW

[논문 리뷰] Logsig-RNN: a novel network for robust and efficient skeleton-based action recognition

Shujian Liao, Terry Lyons|arXiv (Cornell University)|2021. 10. 25.
Human Pose and Action Recognition참고 문헌 59인용 수 11
한 줄 요약

이 논문은 로그-서명 표현과 순환망을 결합한 새로운 신경망 모듈인 Logsig-RNN을 제안한다. 이는 변수 길이, 비균일 시간 간격의 시계열 데이터에 대해 수학적으로 안정적인 로그-서명 표현을 활용하고, 경로 변환 레이어를 통합하여 차원을 감소시켜, 체계적이고 비용 효율적인 뼈대 기반 동작 인식을 향상시킨다. 이 방법은 Chalearn2013 및 NTU RGB+D 120 데이터셋에서 최신 기술 수준(SOTA)의 정확도를 달성하며, 누락된 데이터에 대한 강건성과 계산 비용 절감에도 기여한다.

ABSTRACT

This paper contributes to the challenge of skeleton-based human action recognition in videos. The key step is to develop a generic network architecture to extract discriminative features for the spatio-temporal skeleton data. In this paper, we propose a novel module, namely Logsig-RNN, which is the combination of the log-signature layer and recurrent type neural networks (RNNs). The former one comes from the mathematically principled technology of signatures and log-signatures as representations for streamed data, which can manage high sample rate streams, non-uniform sampling and time series of variable length. It serves as an enhancement of the recurrent layer, which can be conveniently plugged into neural networks. Besides we propose two path transformation layers to significantly reduce path dimension while retaining the essential information fed into the Logsig-RNN module. Finally, numerical results demonstrate that replacing the RNN module by the Logsig-RNN module in SOTA networks consistently improves the performance on both Chalearn gesture data and NTU RGB+D 120 action data in terms of accuracy and robustness. In particular, we achieve the state-of-the-art accuracy on Chalearn2013 gesture data by combining simple path transformation layers with the Logsig-RNN. Codes are available at https://github.com/steveliao93/GCN_LogsigRNN.

연구 동기 및 목표

  • 변수 길이와 비균일 샘플링을 가진 뼈대 시퀀스에서 분류 가능한 시공간 특징을 추출하는 데 도전하는 것.
  • 뼈대 기반 동작 인식에서 누락된 데이터에 대한 강건성 향상과 계산 비용 절감을 위한 것.
  • 기존 최신 기술 수준(SOTA) 네트워크에 아키텍처의 대대적 개선 없이도 쉽게 통합할 수 있는 플러그 앤 플레이 신경 모듈을 개발하는 것.
  • 수학적으로 타당한 시계열 표현을 사용하여 기준 데이터셋에서 최신 기술 수준의 성능을 입증하는 것.

제안 방법

  • 로그-서명 레이어와 RNN을 조합한 Logsig-RNN 모듈을 도입하여 복잡한 고차원 시계열 데이터를 효율적으로 표현한다.
  • 공간 차원을 감소시키면서도 분류 가능한 관절 및 신체 부위 정보를 유지하기 위해 경로 변환 레이어(임bedding 및 그래프 컨볼루션 레이어)를 활용한다.
  • 시계열에 로그-서명 변환을 적용하여 차원 감소와 함께 누락되거나 비균일하게 샘플링된 데이터에 대한 강건성을 확보한다.
  • 파이토치 및 텐서플로우에서 기울기 전파를 지원하는 백프로파게이션을 위한 기울기 가능 로그-서명 계산을 위해 iisignature 및 signatory 패키지를 사용한다.
  • 누적 및 시간 통합 레이어와 같은 보조 레이어를 통합하여 이차 변동성과 속도 정보를 포착함으로써 특징 학습을 향상시킨다.
  • 기존 GCN 또는 RNN 기반의 동작 인식 프레임워크에 원활하게 통합할 수 있는 스택형 모듈식 아키텍처(PT-Logsig-RNN)를 설계한다.

실험 결과

연구 질문

  • RQ1로그-서명 표현은 변수 길이 및 비균일 샘플링된 시퀀스에서 뼈대 기반 동작 인식의 강건성과 효율성을 향상시키는가?
  • RQ2경로 변환 레이어의 통합은 Logsig-RNN 모듈의 성능과 일반화 능력에 어떤 영향을 미치는가?
  • RQ3실제 뼈대 데이터셋에서 표준 RNN 및 최신 기술 수준(SOTA) 모델 대비 Logsig-RNN은 정확도와 강건성 측면에서 어느 정도 뛰어나게 성능을 발휘하는가?
  • RQ4로그-서명 레이어는 팯딩이나 재샘플링 없이도 누락된 데이터를 효과적으로 처리할 수 있는가?
  • RQ5RNN에 입력되는 타임스텝 수를 줄임으로써 계산 비용을 낮추는 동안도 제안된 모듈은 높은 성능을 유지하는가?

주요 결과

  • Logsig-RNN 모듈은 Chalearn2013 손짓 인식 데이터셋에서 기존 최신 기술 수준(SOTA) 방법들을 능가하는 최신 기술 수준의 정확도를 달성한다.
  • NTU RGB+D 120 데이터셋에서 표준 RNN을 Logsig-RNN으로 대체함으로써 일관되게 정확도와 강건성이 향상된다.
  • 로그-서명 표현은 RNN에 입력되는 타임스텝 수를 감소시켜 훈련 비용과 메모리 사용량을 크게 절감한다.
  • 이 방법은 누락된 데이터에 대해 강건성을 보이며, 시퀀스에서 최대 16개의 점을 제거한 후에도 로그-서명 특징의 평균 절대 상대 오차가 6% 이하로 유지된다.
  • 경로 변환 레이어, 특히 임베딩과 GCN의 조합은 필수적인 시공간 정보를 유지하면서도 효과적으로 차원을 감소시킨다.
  • 제거 분석 결과, 누적 및 시간 통합 레이어가 고차원 통계와 운동 속도 정보를 포착함으로써 성능 향상에 기여하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.