Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Self-Supervised Learning for Semi-Supervised 3D Action Recognition

Chenyang Si, Xuecheng Nie|arXiv (Cornell University)|2020. 07. 12.
Human Pose and Action Recognition참고 문헌 46인용 수 6
한 줄 요약

이 논문은 이웃 일致성 정규화와 적대적 특징 분포 정렬을 통해 운동 표현 학습을 향상시키는 새로운 프레임워크인 적대적 자기지도 학습(Adversarial Self-Supervised Learning, ASSL)을 제안한다. 레이블이 없는 데이터에 대한 자기지도 학습을 공동으로 최적화하고, 레이블이 있는 데이터와 없는 데이터의 특징 분포를 정렬하기 위한 적대적 정규화를 통해 ASSL은 특히 낮은 레이블 비율 환경에서 최신 기술 수준(SOTA) 성능을 달성하며, N-UCLA에서 레이블의 15%만으로도 74.8%의 정확도를 기록한다.

ABSTRACT

We consider the problem of semi-supervised 3D action recognition which has been rarely explored before. Its major challenge lies in how to effectively learn motion representations from unlabeled data. Self-supervised learning (SSL) has been proved very effective at learning representations from unlabeled data in the image domain. However, few effective self-supervised approaches exist for 3D action recognition, and directly applying SSL for semi-supervised learning suffers from misalignment of representations learned from SSL and supervised learning tasks. To address these issues, we present Adversarial Self-Supervised Learning (ASSL), a novel framework that tightly couples SSL and the semi-supervised scheme via neighbor relation exploration and adversarial learning. Specifically, we design an effective SSL scheme to improve the discrimination capability of learned representations for 3D action recognition, through exploring the data relations within a neighborhood. We further propose an adversarial regularization to align the feature distributions of labeled and unlabeled samples. To demonstrate effectiveness of the proposed ASSL in semi-supervised 3D action recognition, we conduct extensive experiments on NTU and N-UCLA datasets. The results confirm its advantageous performance over state-of-the-art semi-supervised methods in the few label regime for 3D action recognition.

연구 동기 및 목표

  • 자신지도 학습을 통해 레이블이 없는 3D 스켈레톤 시퀀스에서 분류 가능한 운동 표현을 학습하는 데 도전한다.
  • 자기지도 학습으로 학습된 표현과 지도 학습으로부터 유도된 표현 간의 일치하지 않는 문제를 해결한다.
  • 레이블이 적은 환경에서 레이블이 없는 데이터를 효과적으로 활용하여 모델의 일반화 능력을 향상시킨다.
  • 이웃 탐색과 적대적 정규화를 통해 자기지도 학습과 준지도 학습을 밀접하게 연결한 통합 프레임워크를 제안한다.

제안 방법

  • 지역 이웃 내의 샘플들 간에 운동 표현의 일관성을 강제하는 이웃 일치성 정규화 기법을 제안하여, 클래스 수준의 의미 이해를 향상시킨다.
  • 레이블이 없는 스켈레톤 시퀀스에서 시간적 운동 패턴을 학습하기 위해 자기 복원(pretext) 작업을 도입한다.
  • 도메인 구분자와 함께 적대적 훈련을 수행하여 레이블이 있는 샘플과 없는 샘플의 특징 분포를 정렬함으로써 지도 학습과 자기지도 학습 표현 간의 도메인 차이를 줄인다.
  • 레이블이 있는 데이터에 대한 지도 학습과 레이블이 없는 데이터에 대한 자기지도 학습을 공동 최적화 목표를 통해 통합한다.
  • t-SNE 시각화를 통해 적대적 정렬 이후 레이블이 있는 및 없는 샘플의 특징가 더 단단하고 잘 분리된 군집을 형성함을 확인한다.
  • 유사한 스켈레톤 시퀀스 간의 일관성을 강제하기 위해 시아미즈형 네트워크 아키텍처를 사용하여 이웃 관계를 계산한다.

실험 결과

연구 질문

  • RQ13D 동작 인식에서 이웃 기반 일관성 정규화는 자기지도 학습 운동 표현의 분류 능력을 향상시키는가?
  • RQ2레이블이 있는 데이터와 없는 데이터 간의 적대적 특징 분포 정렬은 표현의 일치하지 않는 문제를 줄이고 준지도 학습 3D 동작 인식의 일반화 능력을 향상시키는가?
  • RQ3낮은 레이블 설정에서 기존 준지도 학습 및 자기지도 학습 방법과 비교해 본다면 제안된 ASSL 프레임워크는 얼마나 효과적인가?
  • RQ4로컬 데이터 관계(이웃)를 탐색하는 것은 레이블이 없는 데이터로부터 숨겨진 동작 의미를 추론하는 데 모델의 능력을 얼마나 향상시키는가?

주요 결과

  • 레이블이 5%에 불과한 NTU 데이터셋에서 ASSL은 57.3%의 정확도를 기록하며, 지도 학습 기반 베이스라인 및 분석 버전보다 뚜렷이 뛰어난 성능을 보였다.
  • N-UCLA 데이터셋에서 레이블이 15%일 경우 ASSL은 74.8%의 정확도를 달성하여, 낮은 지도 학습 환경에서도 뛰어난 성능을 보였다.
  • 분석 결과, 모든 구성 요소가 포함된 경우 ASSL의 적대적 정규화로 성능이 N-UCLA에서 8.4% 향상되었으며(66.4%에서 74.8%로), 이를 확인하였다.
  • t-SNE 시각화 결과, 적대적 훈련을 적용한 ASSL은 레이블이 있는 및 없는 샘플 모두 더 단단하고 잘 분리된 특징 군집을 형성함을 보여주었으며, 이는 내부 클래스의 응집성과 외부 클래스의 분리도 향상되었음을 시사한다.
  • 훈련 과정 중에 클래스 일치 이웃의 비율이 증가함을 확인하여, 이웃 탐색이 기반 클래스 의미를 드러내는 데 기여함을 확인하였다.
  • 제안된 방법은 최신 기술 수준의 준지도 학습 3D 동작 인식 방법을 초월하여, NTU 및 N-UCLA 데이터셋 모두에서 새로운 SOTA 성능을 확립하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.