Skip to main content
QUICK REVIEW

[논문 리뷰] Contrastive Learning from Extremely Augmented Skeleton Sequences for Self-supervised Action Recognition

Tianyu Guo, Hong Liu|arXiv (Cornell University)|2021. 12. 07.
Human Pose and Action Recognition인용 수 11
한 줄 요약

이 논문은 골격 기반 행동 인식을 위한 자기지도 학습 대비 학습 프레임워크인 AimCLR을 제안한다. 이는 극한의 데이터 증강과 새로운 정보 탐색 전략을 활용하여 더 일반화 가능한 표현을 학습한다. 에너지 기반 주의 유도 드롭아웃, 이중 분포 발산 최소화, 최근접 이웃 탐색을 도입함으로써, 여러 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 선형 평가 프로토콜 하에 NTU RGB+D 120에서 이전 방법보다 최대 4.0% 높은 성능을 기록하였다.

ABSTRACT

In recent years, self-supervised representation learning for skeleton-based action recognition has been developed with the advance of contrastive learning methods. The existing contrastive learning methods use normal augmentations to construct similar positive samples, which limits the ability to explore novel movement patterns. In this paper, to make better use of the movement patterns introduced by extreme augmentations, a Contrastive Learning framework utilizing Abundant Information Mining for self-supervised action Representation (AimCLR) is proposed. First, the extreme augmentations and the Energy-based Attention-guided Drop Module (EADM) are proposed to obtain diverse positive samples, which bring novel movement patterns to improve the universality of the learned representations. Second, since directly using extreme augmentations may not be able to boost the performance due to the drastic changes in original identity, the Dual Distributional Divergence Minimization Loss (D$^3$M Loss) is proposed to minimize the distribution divergence in a more gentle way. Third, the Nearest Neighbors Mining (NNM) is proposed to further expand positive samples to make the abundant information mining process more reasonable. Exhaustive experiments on NTU RGB+D 60, PKU-MMD, NTU RGB+D 120 datasets have verified that our AimCLR can significantly perform favorably against state-of-the-art methods under a variety of evaluation protocols with observed higher quality action representations. Our code is available at https://github.com/Levigty/AimCLR.

연구 동기 및 목표

  • 기존 골격 기반 행동 인식을 위한 대비 학습 방법에서 새로운 운동 패턴 탐색이 제한되어 있는 문제를 해결하기 위해.
  • 극한의 데이터 증강으로 인한 심한 신체 정체성 변화로 인한 성능 저하를 완화하기 위해.
  • 표준 대비 학습 쌍을 초월해 양성 샘플 세트를 확장함으로써 특징 학습을 향상시키기 위해.
  • 더 합리적인 양성 샘플 탐색 전략을 통해 표현 품질을 향상시키기 위해.
  • 선형, 미세조정, 준지도 학습 설정을 포함한 다양한 평가 프로토콜 하에서 최신 기술 수준의 성능를 달성하기 위해.

제안 방법

  • 다양하고 정체성이 왜곡된 시각을 생성하기 위해 극한의 증강을 제안하여 새로운 운동 패턴을 폭 드러내는 데 기여한다.
  • 증강 과정에서 정보가 적은 관절을 선택적으로 억제하기 위해 에너지 기반 주의 유도 드롭 모듈(EADM)을 도입하여 강건성을 향상시킨다.
  • 일반적인 시각과 극한의 시각 간의 특징 분포를 부드럽게 정렬하기 위해 이중 분포 발산 최소화 손실(D3M 손실)을 설계하여 분포 이탈을 감소시킨다.
  • 메모리 백에서 의미적으로 유사한 샘플을 포함시켜 양성 세트를 확장하기 위해 최근접 이웃 탐색(НNM)을 활용하여 학습 효율성을 향상시킨다.
  • 극한의 시각, EADM, D3M 손실, NNM을 대비 학습 프레임워크 내에서 통합하여 풍부한 정보 탐색을 가능하게 한다.
  • 관절, 뼈, 좌표 스트림을 포함한 이중 스트림 대비 학습 목표를 사용하여 특징의 다양성과 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1극한의 데이터 증강이 자기지도 학습 골격 표현의 일반화 능력을 크게 향상시킬 수 있는가?
  • RQ2극한의 증강으로 인한 골격 정체성의 심한 변화는 어떻게 완화할 수 있으며, 성능 유지에 기여하는가?
  • RQ3표준 양성 쌍을 초월해 더 합리적인 양성 샘플 탐색 전략이 대비 학습을 향상시킬 수 있는가?
  • RQ4다양한 증강된 시각으로부터 풍부한 정보를 통합하면 더 나은 행동 표현 학습이 가능할 수 있는가?
  • RQ5제안된 방법은 선형, 미세조정, 준지도 학습 설정을 포함한 다양한 평가 프로토콜 하에서 최신 기술 수준의 성능를 달성할 수 있는가?

주요 결과

  • NTU RGB+D 60에서, 3s-AimCLR는 xsub 프로토콜 하에 54.8%의 정확도를 기록했으며, xview에서는 54.3%를 기록하여 3s-CrosSCLR보다 각각 3.7%와 4.0% 높은 성능를 보였다.
  • PKU-MMD에서, 3s-AimCLR는 Part I에서 57.5%를 기록했고, Part II에서는 15.1%를 기록하여 3s-CrosSCLR보다 각각 7.8%와 4.9% 높은 성능를 기록했다.
  • 라벨이 1%인 데이터만으로도, 3s-AimCLR는 PKU-MMD Part I에서 86.1%의 정확도를 기록했고, NTU-60 xview에서는 81.6%를 기록하여 ISC 및 3s-CrosSCLR를 상당한 격차로 앞섰다.
  • 미세조정 평가에서, 3s-AimCLR는 NTU-60 xsub에서 86.9%의 정확도를 기록했고, xset에서는 80.9%를 기록하여 3s-CrosSCLR보다 각각 0.7%와 0.5% 높은 성능를 기록했다.
  • NTU-120에서, 3s-AimCLR는 xsub에서 80.1%의 정확도를 기록했고, xset에서는 80.9%를 기록하여 이전의 SOTA인 ISC보다 각각 0.5%와 0.8% 높은 성능를 기록했다.
  • KNN 평가 결과, AimCLR에서 생성된 특징은 더 분류 능력이 뛰어나며, 모든 데이터셋에서 SkeletonCLR보다 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.