Skip to main content
QUICK REVIEW

[논문 리뷰] ColloSSL: Collaborative Self-Supervised Learning for Human Activity Recognition

Yash Jain, Chi Ian Tang|arXiv (Cornell University)|2022. 02. 01.
Context-Aware Activity Recognition Systems인용 수 5
한 줄 요약

ColloSSL는 여러 대의 동기화된 웨어러블 기기에서 얻은 레이블이 없는 관성 센서 데이터를 활용하여 강건한 인간 활동 인식 표현을 학습하는 협업형 자기지도 학습 프레임워크를 제안한다. 서로 다른 기기의 데이터를 자연스러운 변환으로 간주함으로써 기기 선택, 대비 샘플링, 다중 시각 대비 손실을 통해 감독 신호를 생성하며, 최신 기준 모델보다 최대 7.9% 높은 F₁ 점수를 기록하고 레이블이 10%에 불과한 완전히 지도 학습 모델을 능가한다.

ABSTRACT

A major bottleneck in training robust Human-Activity Recognition models (HAR) is the need for large-scale labeled sensor datasets. Because labeling large amounts of sensor data is an expensive task, unsupervised and semi-supervised learning techniques have emerged that can learn good features from the data without requiring any labels. In this paper, we extend this line of research and present a novel technique called Collaborative Self-Supervised Learning (ColloSSL) which leverages unlabeled data collected from multiple devices worn by a user to learn high-quality features of the data. A key insight that underpins the design of ColloSSL is that unlabeled sensor datasets simultaneously captured by multiple devices can be viewed as natural transformations of each other, and leveraged to generate a supervisory signal for representation learning. We present three technical innovations to extend conventional self-supervised learning algorithms to a multi-device setting: a Device Selection approach which selects positive and negative devices to enable contrastive learning, a Contrastive Sampling algorithm which samples positive and negative examples in a multi-device setting, and a loss function called Multi-view Contrastive Loss which extends standard contrastive loss to a multi-device setting. Our experimental results on three multi-device datasets show that ColloSSL outperforms both fully-supervised and semi-supervised learning techniques in majority of the experiment settings, resulting in an absolute increase of upto 7.9% in F_1 score compared to the best performing baselines. We also show that ColloSSL outperforms the fully-supervised methods in a low-data regime, by just using one-tenth of the available labeled data in the best case.

연구 동기 및 목표

  • 인간 활동 인식(HAR)을 위한 대규모 레이블이 부여된 관성 센서 데이터 수집의 높은 비용과 확장성 한계를 해결하기 위해.
  • 여러 대의 동기화된 웨어러블 기기에서 온 레이블이 없는 데이터가 표현 학습을 위한 효과적인 감독 신호를 생성하는 데 활용될 수 있는지 탐구하기 위해.
  • HAR 분야의 다중 기기, 시간 동기화 센서 데이터에 특화된 새로운 대비 학습 프레임워크를 개발하기 위해.
  • 특히 낮은 데이터 환경에서의 일반화 능력과 데이터 효율성을 향상시키기 위해.

제안 방법

  • 센서 간 거리와 운동 유사도를 기반으로 긍정 및 부정 기기를 식별하는 기기 선택 전략을 도입하여 의미 있는 대비 쌍을 형성한다.
  • 다양한 기기에서 긍정 및 부정 뷰를 샘플링하여 대비 학습 배치를 구성하는 대비 샘플링 알고리즘을 제안한다.
  • 표준 대비 손실을 다중 기기 뷰를 처리할 수 있도록 확장한 다중 시각 대비 손실 함수를 설계한다. 이를 통해 공동 표현 학습을 가능하게 한다.
  • 각 기기의 특징을 인코딩하고 대비 최적화를 통해 정렬하는 데 Siamese 신경망 아키텍처를 사용한다.
  • 스마트폰, 스마트워치 등 IMU를 탑재한 여러 기기에서 시간 동기화된 데이터를 동일한 활동의 자연스러운 변환으로 간주한다.
  • 대비 학습 이전에 개별 기기 스트림에 표준 데이터 증강 기법(예: 마스킹, 회전)을 적용한다.

실험 결과

연구 질문

  • RQ1여러 대의 동기화된 웨어러블 기기에서 온 레이블이 없는 데이터가 HAR에서 자기지도 학습을 위한 의미 있는 감독 신호를 생성하는 데 사용될 수 있는가?
  • RQ2ColloSSL의 성능은 F₁ 점수와 데이터 효율성 측면에서 완전 지도 학습 및 준지도 학습 기준 모델과 비교해 어떻게 되는가?
  • RQ3ColloSSL는 모델의 해석 가능성과 일반화 능력을 향상시키는 분리된, 의미적으로 유의미한 표현을 학습할 수 있는가?
  • RQ4특히 레이블이 제공된 데이터의 일부만 사용할 경우, 모델은 낮은 데이터 환경에서 어떻게 성능을 발휘하는가?

주요 결과

  • Col로SSL은 세 개의 다중 기기 HAR 데이터셋에서 최고 성능 기준 모델보다 최대 7.9% 높은 절대적인 F₁ 점수 향상을 달성한다.
  • 레이블이 10%에 불과한 경우에도 ColloSSL가 완전 지도 학습 모델을 능가하며, 뛰어난 데이터 효율성을 입증한다.
  • 시각화된 중요도 맵을 통해 관련 센서 신호에 주의를 기울이는 것으로 확인되어 잘 분리된 의미적으로 의미 있는 특징을 학습한다.
  • 다양한 센서 모odal 및 기기 유형 간에 잘 일반화되어 있어, 관성 센싱을 넘어서도 적용 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.