[논문 리뷰] Towards Continual Egocentric Activity Recognition: A Multi-modal Egocentric Activity Dataset for Continual Learning
이 논문은 10명의 참가자가 32종류의 일상 활동을 수행하면서 RGB 영상, 가속도계, 자이로스코프 데이터를 결합한 새로운 다중모달 이고세트릭 활동 데이터셋인 UESTC-MMEA-CL을 소개한다. 이 데이터셋은 제1인칭 활동 인식에서 지속적 학습 연구를 가능하게 하며, 예시 기반 방법인 iCaRL이 치명적인 잊음 현상을 크게 줄임을 보여준다 — RGB+Acc+Gyro 융합 기반 평균 정확도 77.8%를 달성한다. 반면 센서 전용 모달리티는 예시 없이 성능이 심각하게 저하된다.
With the rapid development of wearable cameras, a massive collection of egocentric video for first-person visual perception becomes available. Using egocentric videos to predict first-person activity faces many challenges, including limited field of view, occlusions, and unstable motions. Observing that sensor data from wearable devices facilitates human activity recognition, multi-modal activity recognition is attracting increasing attention. However, the deficiency of related dataset hinders the development of multi-modal deep learning for egocentric activity recognition. Nowadays, deep learning in real world has led to a focus on continual learning that often suffers from catastrophic forgetting. But the catastrophic forgetting problem for egocentric activity recognition, especially in the context of multiple modalities, remains unexplored due to unavailability of dataset. In order to assist this research, we present a multi-modal egocentric activity dataset for continual learning named UESTC-MMEA-CL, which is collected by self-developed glasses integrating a first-person camera and wearable sensors. It contains synchronized data of videos, accelerometers, and gyroscopes, for 32 types of daily activities, performed by 10 participants. Its class types and scale are compared with other publicly available datasets. The statistical analysis of the sensor data is given to show the auxiliary effects for different behaviors. And results of egocentric activity recognition are reported when using separately, and jointly, three modalities: RGB, acceleration, and gyroscope, on a base network architecture. To explore the catastrophic forgetting in continual learning tasks, four baseline methods are extensively evaluated with different multi-modal combinations. We hope the UESTC-MMEA-CL can promote future studies on continual learning for first-person activity recognition in wearable applications.
연구 동기 및 목표
- 제1인칭 활동 인식을 위한 다중모달, 지속적 학습에 적합한 데이터셋의 부족 문제를 해결하기 위해, 특히 웨어러블 센서 데이터를 제1인칭 영상과 통합하는 것.
- 특히 시각 및 관성 센서 데이터를 융합한 다중모달 딥 러닝에서 치명적인 잊음 현상이 어떻게 나타나는지 조사하기 위해.
- 순차적 과제 학습 환경에서 지속적 학습 전략(예: iCaRL, EWC, LwF)의 효과를 다중모달 제1인칭 활동 인식에 평가하기 위해.
- 웨어러블 응용 분야에서 지속적, 다중모달 제1인칭 활동 인식 연구를 가속화하기 위해 기준 데이터셋과 기준 모델을 제공하기 위해.
제안 방법
- 저자들은 제1인칭 카메라와 관성 측정 장치(IMU)를 통합한 맞춤형 웨어러블 안경 시스템을 개발하여 동기화된 RGB 영상, 가속도계, 자이로스코프 데이터를 수집하였다.
- 이 데이터셋인 UESTC-MMEA-CL은 10명의 참가자가 수행한 32종류의 일상 활동 클래스를 포함하며, 모든 모달리티 간 시간적 및 공간적 동기화가 완료되었다.
- 공유된 딥 네URAL 네트워크 내에서 RGB, 가속도, 자이로스코프 모달리티의 특징을 융합하기 위해 중간 융합(TBW 유사) 아키텍처를 사용하여 공동 표현 학습을 수행하였다.
- 순차적 과제 학습 환경에서 테스트된 네 가지 지속적 학습 전략(fine-tune, iCaRL(예시 기반), EWC(파rameter 정규화), LwF(지식 정착))을 평가하였다.
- 관성 신호가 활동 패턴을 구분하는 데 보조적인 역할을 하는지를 확인하기 위해 센서 데이터의 통계 분석을 수행하였다.
- 성능 측정을 위해 유모달 및 다중모달 조합을 모두 사용하여 평균 정확도(A)와 잊음률(F)을 기준으로 실험을 수행하였다.
실험 결과
연구 질문
- RQ1순차적으로 과제를 학습할 때 다중모달 이고세트릭 활동 인식에서 치명적인 잊음 현상은 어떻게 나타나는가?
- RQ2특히 예시 기반 대비 예시 없이 구현된 전략에 비해, 다양한 지속적 학습 전략이 RGB, 가속도계, 자이로스코프 모달리티에서 얼마나 효과적으로 잊음 현상을 완화하는가?
- RQ3유모달 학습 대비 RGB + Acc + Gyro 융합이 잊음 현상을 얼마나 줄이는가?
- RQ4왜 가속도계 및 자이로스코프 전용 네트워크는 RGB 네트워크에 비해 지속적 학습에서 현저히 높은 잊음률과 낮은 정확도를 보이는가?
- RQ5제안된 UESTC-MMEA-CL 데이터셋은 향후 지속적, 다중모달 이고세트릭 활동 인식 연구를 위한 신뢰할 수 있는 기준 데이터셋으로 기능할 수 있는가?
주요 결과
- iCaRL 방법은 RGB+Acc+Gyro 다중모달 조합에서 평균 정확도 77.8%를 기록하며 상대적으로 낮은 잊음률 33.5%를 보였다.
- 예시 기반 iCaRL은 특히 다중모달 환경에서 예시 없이 구현된 EWC 및 LwF 전략보다 잊음 현상을 훨씬 효과적으로 줄였다.
- 센서 전용 네트워크(가속도계 및 자이로스코프)는 지속적 학습 조건에서도 평균 정확도가 20% 미만이었으며, 잊음률은 60%를 초과하였다.
- RGB+Gyro 조합은 iCaRL 기반으로 평균 정확도 77.4%를 기록하여 단독 RGB 네트워크(70.4%)를 능가했으며, 강력한 상호보완 효과를 보였다.
- Fine-tuning는 RGB+Acc+Gyro 조합에서 99.0%의 잊음률을 기록하여, 정규화가 없는 경우 치명적인 잊음 현상의 심각성을 확인시켰다.
- 센서 데이터의 통계 분석을 통해 관성 신호가 다양한 활동 클래스에 대해 고유하고 유용한 패턴을 제공함을 확인하여, 시각 데이터와의 융합의 타당성을 뒷받침하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.