[논문 리뷰] BON: An extended public domain dataset for human activity recognition
이 논문은 스페인 바르셀로나, 영국 옥스포드, 케냐 나이로비에서 25명의 참가자로부터 가슴에 부착한 GoPro 카메라를 사용해 촬영한 18개의 일반적인 사무실 활동을 포함하는 대규모 공개형 제1인칭 시각(FPV) 데이터셋인 BON을 소개한다. 이 데이터셋은 2,639개의 5초 분량 비디오 세그먼트와 상세한 애너테이션을 포함하며, IEEE VIP 컵 2019에서 상위 성능을 보인 3개의 베이스라인 모델을 제공함으로써, 내부 클래스 변동성과 외부 클래스 유사성과 같은 과제가 존재하는 바에도 불구하고 안정적인 벤치마킹을 가능하게 한다.
Body-worn first-person vision (FPV) camera enables to extract a rich source of information on the environment from the subject's viewpoint. However, the research progress in wearable camera-based egocentric office activity understanding is slow compared to other activity environments (e.g., kitchen and outdoor ambulatory), mainly due to the lack of adequate datasets to train more sophisticated (e.g., deep learning) models for human activity recognition in office environments. This paper provides details of a large and publicly available office activity dataset (BON) collected in different office settings across three geographical locations: Barcelona (Spain), Oxford (UK) and Nairobi (Kenya), using a chest-mounted GoPro Hero camera. The BON dataset contains eighteen common office activities that can be categorised into person-to-person interactions (e.g., Chat with colleagues), person-to-object (e.g., Writing on a whiteboard), and proprioceptive (e.g., Walking). Annotation is provided for each segment of video with 5-seconds duration. Generally, BON contains 25 subjects and 2639 total segments. In order to facilitate further research in the sub-domain, we have also provided results that could be used as baselines for future studies.
연구 동기 및 목표
- 제1인칭 시각을 활용한 제1인칭 사무실 활동 인식을 위한 대규모 공개 데이터셋의 부족을 해결한다.
- 다양한 지리적 위치에서 실제 사무실 환경의 활동 데이터를 수집하여 모델의 일반화 능력을 향상시킨다.
- 18개의 다른 사무실 활동을 사람-사람, 사람-물체, 자각적 상호작용으로 분류한 풍부한 애너테이션을 제공한다.
- IEEE VIP 컵 2019에서 사용된 BON 전체 데이터셋 기반의 상위 성능 모델을 공개하여 벤치마킹을 가능하게 한다.
- 사물함 사용 방식의 다양성 등 실생활 과제들, 예를 들어 조명 변화, 가림, 내부 클래스 변동성, 외부 클래스 유사성 등을 부각시킨다.
제안 방법
- 3개의 글로벌 사무소 환경에서 25명의 참가자로부터 가슴에 부착한 GoPro Hero3+ 카메라를 사용해 1280×720 해상도, 30fps로 비디오 데이터를 촬영했다.
- 각 5초 분량의 2,639개 비디오 세그먼트를 18개의 사무실 활동으로 애너테이션 처리하였으며, 이는 사람-사람, 사람-물체, 자각적 행동으로 3개의 카테고리로 분류되었다.
- 지역(바르셀로나, 옥스포드, 나이로비)과 참가자 간의 다양성을 확보하기 위해 전략적 데이터 수집을 실시하여 모델 훈련의 다양성과 강건성을 높였다.
- 스페이셜-타임리얼 주의망(STANet), Inception-V3에 MLP를 결합한 모델, 어텐션 기반 앙상블 RNN을 사용해 베이스라인 모델 개발을 수행했다.
- 클래스 불균형 문제를 해결하기 위해 사전 학습된 ImageNet 모델(예: DenseNet, Wide-ResNet)을 사용해 특징 추출을 수행하고, 미세조정과 균형 잡힌 배치 샘플링을 적용했다.
- 스페이셜-타임리얼 모델링 향상을 위해 최상위 성능을 보인 STANet 기반 베이스라인에 광학 흐름과 RGB 프레임을 입력으로 통합했다.
실험 결과
연구 질문
- RQ1다양한 지리적 및 환경적 조건에서 제1인칭 시각 기반의 사무실 활동 인식을 위한 대규모 공개 FPV 데이터셋을 어떻게 구성할 수 있는가?
- RQ2제1인칭 비디오에서 사무실 활동을 인식할 때 내부 클래스 변동성과 외부 클래스 유사성과 같은 주요 과제는 무엇인가?
- RQ3다양한 딥러닝 아키텍처가 실제 제1인칭 사무실 활동 인식 벤치마크에서 어떻게 성능을 내는가?
- RQ4전이 학습과 어텐션 메커니즘은 BON과 같은 도전적인 다변화된 데이터셋에서 정확도 향상에 얼마나 기여하는가?
- RQ5주요 경쟁 대회에서 공개된 베이스라인 모델이 향후 BON에 대한 연구에서 신뢰할 수 있는 성능 기준이 될 수 있는가?
주요 결과
- BON 데이터셋은 3개국에서 온 25명의 참가자로부터 수집된 18개의 다른 사무실 활동을 포함하는 2,639개의 레이블이 부여된 비디오 세그먼트를 포함하며, 지리적 및 환경적 다양성을 확보한다.
- STANet 기반 최상위 성능 모델은 BON 데이터셋에서 평균 F1 스코어 0.749를 기록하여 IEEE VIP 컵 2019 경쟁에서 다른 방법들을 압도했다.
- 2위를 차지한 Inception-V3와 MLP 기반 모델은 평균 F1 스코어 0.678을 기록하여 단순한 아키텍처에서도 뛰어난 성능을 보였다.
- 3위를 차지한 앙상블 RNN 모델은 평균 F1 스코어 0.658을 기록하여 어텐션과 클래스 균형 샘플링을 통합한 다중 모델 조합의 효과를 입증했다.
- 데이터셋은 조명 변화, 가림, 높은 내부 클래스 변동성(예: 자판기 사용 방식의 다양성) 및 외부 클래스 유사성(예: 읽기 vs. 타이핑, 기계 사용 vs. 기계를 가져오기) 등의 심각한 실생활 과제를 보여준다.
- 다양한 손건조기 및 보행 환경 등 다양한 사무실 환경의 통합은 실생활 적용에서 강건하고 일반화 능력이 뛰어난 모델의 필요성을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.