Skip to main content
QUICK REVIEW

[논문 리뷰] Contrastive Learning from Spatio-Temporal Mixed Skeleton Sequences for Self-Supervised Skeleton-Based Action Recognition

Zhan Chen, Hong Liu|arXiv (Cornell University)|2022. 07. 07.
Human Pose and Action Recognition인용 수 15
한 줄 요약

이 논문은 뼈대 기반 동작 인식을 위한 자기지도 학습 대비 학습 프레임워크인 SkeleMixCLR를 제안하며, 하드 대비 쌍을 생성하기 위해 새로운 시간-공간 뼈대 혼합 증강(SkeleMix)을 도입한다. 상하좌우 구조와 시간-공간 마스크 풀링을 활용해 잘라낸 뼈대 조각(자르기 전시)과 나머지 시퀀스(자르기 후시)를 결합함으로써 운동 표현 학습을 향상시킨다. 이로 인해 NTU-RGB+D, NTU120-RGB+D, PKU-MMD 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Self-supervised skeleton-based action recognition with contrastive learning has attracted much attention. Recent literature shows that data augmentation and large sets of contrastive pairs are crucial in learning such representations. In this paper, we found that directly extending contrastive pairs based on normal augmentations brings limited returns in terms of performance, because the contribution of contrastive pairs from the normal data augmentation to the loss get smaller as training progresses. Therefore, we delve into hard contrastive pairs for contrastive learning. Motivated by the success of mixing augmentation strategy which improves the performance of many tasks by synthesizing novel samples, we propose SkeleMixCLR: a contrastive learning framework with a spatio-temporal skeleton mixing augmentation (SkeleMix) to complement current contrastive learning approaches by providing hard contrastive samples. First, SkeleMix utilizes the topological information of skeleton data to mix two skeleton sequences by randomly combing the cropped skeleton fragments (the trimmed view) with the remaining skeleton sequences (the truncated view). Second, a spatio-temporal mask pooling is applied to separate these two views at the feature level. Third, we extend contrastive pairs with these two views. SkeleMixCLR leverages the trimmed and truncated views to provide abundant hard contrastive pairs since they involve some context information from each other due to the graph convolution operations, which allows the model to learn better motion representations for action recognition. Extensive experiments on NTU-RGB+D, NTU120-RGB+D, and PKU-MMD datasets show that SkeleMixCLR achieves state-of-the-art performance. Codes are available at https://github.com/czhaneva/SkeleMixCLR.

연구 동기 및 목표

  • 자기지도 학습 기반 뼈대 기반 동작 인식에서 표준 데이터 증강 기반 대비 쌍의 기여도 감소 문제를 해결하기 위해.
  • 새로운 데이터 증강을 통해 더 정보가 풍부하고 하드인 대비 쌍을 생성함으로써 표현 학습을 향상시키기 위해.
  • 뼈대 시퀀스의 위상적 구조와 시간-공간적 맥락을 활용하여 더 나은 운동 표현 학습을 위해.
  • 대규모 레이블 데이터에 의존하지 않고도 자기지도 학습 기반 뼈대 기반 동작 인식에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • SkeleMix는 뼈대 관절을 위상적 구조에 기반해 다섯 개의 신체 부위로 분할하고, 랜덤으로 일부를 선택해 시간-공간적으로 자르는 방식으로 작동한다.
  • 자른 조각(자르기 전시)과 나머지 뼈대 시퀀스(자르기 후시)를 랜덤으로 조합하여 혼합 뼈대 시퀀스를 생성한다.
  • 시간-공간 마스크 풀링(STMP) 연산은 특징 수준에서 자르기 전시와 자르기 후시를 분리하여, 양쪽 모두의 맥락을 유지한다.
  • 그래프 컨볼루션 연산으로 인해 교차 시각 맥락이 발생함으로써, 자르기 전시와 자르기 후시 간에 하드 양성 쌍을 형성하고 대비 학습을 적용한다.
  • 성능 향상을 위해 다중 SkeleMix 증강(SkeleMixCLR+)을 활용해 프레임워크를 확장한다.
  • 관절, 운동, 뼈대 스트림을 사용해 NTU-60, NTU-120, PKU-MMD에서 평가하며, 최종 동작 인식 작업에 대해 미세 조정을 수행한다.

실험 결과

연구 질문

  • RQ1새로운 혼합 증강 전략을 통해 하드 대비 쌍을 도입하면 자기지도 학습 기반 뼈대 기반 동작 인식 성능 향상이 가능한가?
  • RQ2자른 뼈대 조각과 나머지 시퀀스를 조합하는 SkeleMix는 표준 증강 기법과 비교해 표현 학습에 어떤 영향을 미치는가?
  • RQ3시간-공간 마스크 풀링 연산이 대비 학습을 위해 교차 시각 맥락을 얼마나 잘 유지하는가?
  • RQ4제안된 방법은 다양한 데이터셋과 데이터 분할(예: 교차 주관절, 교차 시점)에 대해 일반화 가능한가?
  • RQ5SkeleMixCLR는 최소 또는 전혀 레이블이 없는 자기지도 설정에서 최신 기술 수준의 성능를 달성할 수 있는가?

주요 결과

  • NTU-60 Xsub 벤치마크에서 SkeleMixCLR+는 87.7%의 정확도를 기록하여, 지도 학습 기반 3s-ST-GCN(85.2%)과 이전 자기지도 학습 방법들을 모두 초월한다.
  • NTU-60 Xview에서 SkeleMixCLR+는 82.9%의 정확도를 달성하여 이전 최신 기술 수준의 방법(3s-AimCLR, 80.9%)을 뛰어넘는다.
  • 1% 레이블 데이터만을 사용하는 반감독 학습 환경에서 SkeleMixCLR+는 PKU-MMD에서 62.6%, NTU-60 Xsub에서 55.9%의 성능을 기록하며 모든 베이스라인을 압도한다.
  • 10% 레이블 데이터를 사용할 경우, SkeleMixCLR+는 PKU-MMD에서 88.6%, NTU-60 Xsub에서 84.7%의 성능을 기록하여 저 supervision 환경에서도 강력한 일반화 능력을 입증한다.
  • t-SNE 시각화 결과, SkeleMixCLR+는 SkeletonCLR보다 더 조밀하고 분리 가능한 특징 클러스터를 생성하며, 관절, 운동, 뼈대 스트림 전반에서 NMI 점수 향상을 보였다.
  • 제거 실험 결과, 다중 SkeleMix 증강(SkeleMixCLR+)이 성능 향상에 기여함을 확인하여 다양한 하드 대비 쌍의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.