Skip to main content
QUICK REVIEW

[논문 리뷰] Spatiotemporal Decouple-and-Squeeze Contrastive Learning for Semi-Supervised Skeleton-based Action Recognition

Binqian Xu, Xiangbo Shu|arXiv (Cornell University)|2023. 02. 05.
Human Pose and Action Recognition인용 수 5
한 줄 요약

이 논문은 공간 및 시간 특징을 분리하여 처리하고, 공간 압축, 시간 압축, 전반적 특징을 세 가지 전용 대비 손실을 통해 함께 대비하는 스팩트로타임프루어 디커플-압축 대비 학습(SDS-CL)이라는 새로운 반감독형 뼈대 기반 동작 인식 프레임워크를 제안한다. SDS-CL은 네 가지 공개 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 선형 평가 기준 NTU RGB+D에서 73.6% 및 78.9%의 정확도를 기록하고, 미세조정 기준 91.9%/97.2%를 기록함으로써 명시적으로 공간-시간 특이성을 유지함으로써 표현 학습을 향상시킴을 보여준다.

ABSTRACT

Contrastive learning has been successfully leveraged to learn action representations for addressing the problem of semi-supervised skeleton-based action recognition. However, most contrastive learning-based methods only contrast global features mixing spatiotemporal information, which confuses the spatial- and temporal-specific information reflecting different semantic at the frame level and joint level. Thus, we propose a novel Spatiotemporal Decouple-and-Squeeze Contrastive Learning (SDS-CL) framework to comprehensively learn more abundant representations of skeleton-based actions by jointly contrasting spatial-squeezing features, temporal-squeezing features, and global features. In SDS-CL, we design a new Spatiotemporal-decoupling Intra-Inter Attention (SIIA) mechanism to obtain the spatiotemporal-decoupling attentive features for capturing spatiotemporal specific information by calculating spatial- and temporal-decoupling intra-attention maps among joint/motion features, as well as spatial- and temporal-decoupling inter-attention maps between joint and motion features. Moreover, we present a new Spatial-squeezing Temporal-contrasting Loss (STL), a new Temporal-squeezing Spatial-contrasting Loss (TSL), and the Global-contrasting Loss (GL) to contrast the spatial-squeezing joint and motion features at the frame level, temporal-squeezing joint and motion features at the joint level, as well as global joint and motion features at the skeleton level. Extensive experimental results on four public datasets show that the proposed SDS-CL achieves performance gains compared with other competitive methods.

연구 동기 및 목표

  • 기존의 대비 학습 방법이 전반적 특징에 공간 및 시간 정보를 혼합함으로써 프레임 수준 및 관절 수준의 의미를 혼동한다는 한계를 해결하기 위해.
  • 공간 특이성 및 시간 특이성 특징을 명시적으로 캡처하고 대비함으로써 반감독 설정에서 표현 학습을 향상시키기 위해.
  • 새로운 주의 및 대비 손실 메커니즘을 통해 공간 압축, 시간 압축, 전반적 표현을 통합 최적화하는 통합 프레임워크를 설계하기 위해.
  • 3D 및 2D 뼈대 데이터셋, 특히 Kinetics-Skeleton과 같은 도전적인 벤치마크에서 공간-시간 분리의 효과를 검증하기 위해.

제안 방법

  • 관절 및 운동 특징 간의 공간-시간 분리된 내부-상호 주의 맵을 계산하고, 이들 간의 상호 주의 맵을 생성하는 스팩트로타임프루어 분리 주의(SIIA) 메커니즘을 제안한다.
  • 관절 및 운동 모odal 간에 시간 프레임 수준에서 공간 압축 특징을 대비하는 공간 압축 시간 대비 손실(STL)을 도입한다.
  • 관절 및 운동 모달 간에 관절 수준에서 시간 압축 특징을 대비하는 시간 압축 공간 대비 손실(TSL)을 도입한다.
  • 전체 뼈대 수준에서 전반적 특징을 대비하는 전반적 대비 손실(GL)을 도입하여 전체 행동 표현을 유지한다.
  • STL, TSL, GL 세 가지 대비 손실을 함께 사용하여, 쌍이 맞지 않거나 약한 레이블이 부여된 뼈대 시퀀스에서 모델을 자기지도 학습 방식으로 훈련시킨다.
  • NTU RGB+D 및 Kinetics-Skeleton을 포함한 여러 데이터셋에서 pretrain + 선형 평가 및 pretrain + 미세조정 프로토콜을 적용한다.

실험 결과

연구 질문

  • RQ1공간 및 시간 표현을 분리하면 반감독형 뼈대 기반 동작 인식 성능이 향상되는가?
  • RQ2시간 압축 특징을 시간 프레임 수준에서, 공간 압축 특징을 관절 수준에서 대비하면 전반적 특징만을 대비하는 것보다 더 나은 표현 학습이 이루어지는가?
  • RQ3제안된 스팩트로타임프루어 분리 주의(SIIA) 메커니즘이 모달 특이적 공간 및 시간 동적 특성을 효과적으로 캡처하는가?
  • RQ4SDS-CL 프레임워크는 2D 뼈대 시퀀스로 일반화되어 대규모 데이터셋인 Kinetics-Skeleton에서도 경쟁력 있는 성능을 달성할 수 있는가?
  • RQ5다양한 대비 신호(공간, 시간, 전반적)를 동시에 최적화하면 단일 또는 双대 대비 접근보다 더 높은 성능을 내는가?

주요 결과

  • pretrain + 선형 평가 프로토콜에서 NTU RGB+D에서 SDS-CL은 73.6% 및 78.9%의 정확도를 기록했으며, 이는 CrosSCLR(72.9%/79.9%) 및 3s-Colorization(88.0%/94.9%)보다 우월하다.
  • pretrain + 미세조정 프로토콜에서 3s-SDS-CL은 NTU RGB+D에서 CS 및 CV 분할에서 각각 91.9% 및 97.2%의 정확도를 기록했으며, 3s-Colorization(88.0%/94.9%)보다 각각 3.9 및 2.3 프로센트 포인트 높게 기록했다.
  • Kinetics-Skeleton 데이터셋에서 SDS-CL은 37.3%의 정확도를 기록했으며, GCN-NAS(37.1%)를 초월하여 2D 뼈대 시퀀스로의 일반화 능력이 뛰어나다는 것을 입증했다.
  • 제거 실험 결과, STL, TSL, GL 손실의 조합이 일관된 성능 향상을 이끌어내며, 각 손실이 표현 학습에 독자적인 기여를 한다는 것이 확인되었다.
  • SIIA 메커니즘이 관절 수준의 미세한 공간적(예: ‘양손을 마주 대고 문지르기’) 또는 시간적(예: ‘앉기’) 차이가 필요한 동작에서 성능 향상을 보이며, 모달 특이적 공간 및 시간 의존성을 효과적으로 캡처함을 입증했다.
  • 프레임워크는 데이터 모달에 대해 강건하게 작동하며, 관절, 운동, 뼈대 특징 모두에서 잘 작동하며, 3D 및 2D 뼈대 입력 간의 강력한 전이성도 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.