Skip to main content
QUICK REVIEW

[논문 리뷰] 3D Skeleton-based Few-shot Action Recognition with JEANIE is not so Naïve

Lei Wang, Jun Liu|arXiv (Cornell University)|2021. 12. 23.
Human Pose and Action Recognition인용 수 7
한 줄 요약

이 논문은 3D 스켈레톤에 대한 few-shot 행동 인식 프레임워크인 JEANIE를 제안한다. 이는 시간적 요소와 시뮬레이션된 카메라 시점 정렬을 동시에 최적화하기 위해 미분 가능한, 사영 기하학적 특성을 고려한 동적 시간 왜곡(DTW)의 변종을 사용한다. 4D 시간-시점 공간에서 매끄러운 경로를 모델링하고, 유사도 기반 손실을 사용하는 경량 그래프 신경망을 적용함으로써, NTU-60, NTU-120, Kinetics-skeleton, UWA3D Multiview Activity II에서 최신 기술 수준의 성능을 달성한다. 기존 기준 모델 대비 최대 6% 향상되었으며, 새로운 시점과 소수의 샘플 조건에서도 강건성을 입증하였다.

ABSTRACT

In this paper, we propose a Few-shot Learning pipeline for 3D skeleton-based action recognition by Joint tEmporal and cAmera viewpoiNt alIgnmEnt (JEANIE). To factor out misalignment between query and support sequences of 3D body joints, we propose an advanced variant of Dynamic Time Warping which jointly models each smooth path between the query and support frames to achieve simultaneously the best alignment in the temporal and simulated camera viewpoint spaces for end-to-end learning under the limited few-shot training data. Sequences are encoded with a temporal block encoder based on Simple Spectral Graph Convolution, a lightweight linear Graph Neural Network backbone (we also include a setting with a transformer). Finally, we propose a similarity-based loss which encourages the alignment of sequences of the same class while preventing the alignment of unrelated sequences. We demonstrate state-of-the-art results on NTU-60, NTU-120, Kinetics-skeleton and UWA3D Multiview Activity II.

연구 동기 및 목표

  • 제한된 레이블 데이터로 인해 신뢰할 수 있는 메트릭 학습이 어려운 3D 스켈레톤 시퀀스에서의 소수의 샘플로 행동 인식 문제를 해결하기 위해.
  • 다양한 운동 속도와 카메라 각도로 인해 발생하는 시간적 및 시점적 불일치를 동시에 모델링하여 쿼리 및 서포트 시퀀스 간의 매칭을 향상시키기 위해.
  • 시간적 및 시뮬레이션된 카메라 시점 공간에서 작동하는, 미분 가능하고 종단 간(end-to-end) 학습이 가능한 정렬 기반 메커니즘을 개발하기 위해.
  • 3D 스켈레톤 데이터를 사용하여 저샷 설정에서 새로운 행동 클래스에 대한 일반화 능력을 향상시키기 위해.
  • NTU-120 및 UWA3D Multiview Activity II와 같은 다중 시점 3D 스켈레톤 데이터셋에서 소수의 샘플로 행동 인식의 새로운 벤치마크를 설정하기 위해.

제안 방법

  • 시간적 및 시뮬레이션된 카메라 시점 공간에서 동시에 정렬을 최적화하는, 사영 기하학적 특성을 반영한 동적 시간 왜곡(DTW)의 미분 가능한 변종을 제안한다.
  • 스테레오 투영 대수를 사용하여 다수의 시뮬레이션된 카메라 시점을 생성함으로써, 실제 카메라 캘리브레이션을 필요로 하지 않고도 시점 불변 표현 학습을 가능하게 한다.
  • 간결한 스펙트럴 그래프 컨볼루션(SGC) 기반 시간 블록 인코더를 경량 백본으로 사용하며, 향상된 특징 학습을 위해 선택적 트랜스포머 버전을 통합한다.
  • 유사도 기반 손실을 도입하여 동일 클래스의 행동 시퀀스 간 정렬을 장려하고, 관련 없는 시퀀스 간 정렬을 억제한다.
  • 각 단계가 작은 시점 이동에 제약을 받는 4D 공간(시간 × 시점)에서의 공동 경로를 최적화함으로써 종단 간 훈련을 수행한다.
  • 고정 길이 M의 시간 블록과 간격 S를 사용하여 정렬 이전에 局부적 표현을 추출함으로써 장시간 시퀀스의 효율적 처리를 가능하게 한다.

실험 결과

연구 질문

  • RQ1제한된 감독 하에서 3D 스켈레톤 시퀀스에서 시간적 및 시점적 정렬을 동시에 수행하면 소수의 샘플로 행동 인식 성능이 향상되는가?
  • RQ2스테레오 투영 기하학을 통한 시점 정렬 모델링이 소수의 샘플 설정에서 단순한 오일러 각도 회전보다 우수한가?
  • RQ3제안된 미분 가능한 정렬 기반 메커니즘이 다양한 운동 속도와 카메라 시점 변화를 효과적으로 처리하는가?
  • RQ4유사도 기반 손실이 새로운 행동 클래스와 알려지지 않은 시점으로의 일반화 능력을 얼마나 향상시키는가?
  • RQ5제안된 방법이 여러 카메라 시점 간에서 일반화되어 다중 시점 3D 스켈레톤 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • JEANIE는 소수의 샘플 조건에서 Kinetics-skeleton에서 52.5%의 정확도를 기록하여, 기준 모델(soft-DTW 전용) 대비 12.9% 향상되었고, Free Viewpoint Matching(FVM) 대비 12.2% 향상되었다.
  • UWA3D Multiview Activity II에서 S 2 GC 백본을 사용한 JEANIE는 평균 정확도 63.7%를 기록하여 S 2 GC 기준 모델 대비 10.1% 향상되었고, FVM 대비 12.0% 향상되었다.
  • NTU-120 다중 시점 분류에서, 왼쪽 및 중심 시점에서 훈련하고 오른쪽 시점에서 테스트할 경우, JEANIE는 새로운 클래스에서 70.8%의 정확도를 달성하여 알려지지 않은 시점으로의 강력한 일반화 능력을 입증하였다.
  • 트랜스포머 인코더를 추가하면 JEANIE의 성능이 Kinetics-skeleton에서 2% 향상되어 더 풍부한 특징 모델링의 이점이 있음을 시사한다.
  • 2D 스켈레톤 대비 3D 스켈레톤을 사용할 경우, 모든 벤치마크에서 성능이 3–4% 향상되었으며, 이는 3D 기하 정보의 우수성을 입증한다.
  • 모든 데이터셋과 설정에서 모든 기준 모델을 일관되게 초월하며, 동일 클래스 및 새로운 클래스의 소수의 샘플 평가 프로토콜 모두에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.