Skip to main content
QUICK REVIEW

[논문 리뷰] MMTSA: Multimodal Temporal Segment Attention Network for Efficient Human Activity Recognition

Ziqi Gao, Yuntao Wang|arXiv (Cornell University)|2022. 10. 14.
Context-Aware Activity Recognition Systems인용 수 6
한 줄 요약

MMTSA는 RGB 비디오와 IMU 데이터를 효율적으로 융합하여 인간 활동 인식을 수행하는 다중모달 시간적 세그먼트 주의망을 제안한다. 이는 IMU 신호를 그람형 각도 필드(GAF) 이미지로 변환하고, 중복을 줄이기 위해 희소 샘플링을 적용하며, 효과적인 융합을 위해 상호 세그먼트 주의 모듈을 사용한다. MMAct에서 기존 SOTA 방법 대비 11.13% 높은 교차 주체 F1 점수를 기록하며, FLOPs는 94% 감소하고 지연 시간은 82.6% 감소하여 엣지 장치에 효율적으로 구현 가능하다.

ABSTRACT

Multimodal sensors provide complementary information to develop accurate machine-learning methods for human activity recognition (HAR), but introduce significantly higher computational load, which reduces efficiency. This paper proposes an efficient multimodal neural architecture for HAR using an RGB camera and inertial measurement units (IMUs) called Multimodal Temporal Segment Attention Network (MMTSA). MMTSA first transforms IMU sensor data into a temporal and structure-preserving gray-scale image using the Gramian Angular Field (GAF), representing the inherent properties of human activities. MMTSA then applies a multimodal sparse sampling method to reduce data redundancy. Lastly, MMTSA adopts an inter-segment attention module for efficient multimodal fusion. Using three well-established public datasets, we evaluated MMTSA's effectiveness and efficiency in HAR. Results show that our method achieves superior performance improvements 11.13% of cross-subject F1-score on the MMAct dataset than the previous state-of-the-art (SOTA) methods. The ablation study and analysis suggest that MMTSA's effectiveness in fusing multimodal data for accurate HAR. The efficiency evaluation on an edge device showed that MMTSA achieved significantly better accuracy, lower computational load, and lower inference latency than SOTA methods.

연구 동기 및 목표

  • 밀도 높은 샘플링과 이질적인 하위 네트워크에 의존하는 기존 다중모달 HAR 방법의 비효율성과 성능 한계를 해결하기 위해.
  • 그람형 각도 필드(GAF)를 사용해 통일되고 동형적인 표현을 통해 단일 모odal 입력(RGB 및 IMU) 간의 시간적 상관관계를 유지하고 구조적 차이를 줄이기 위해.
  • 입력 클립으로부터 핵심 시간 세그먼트를 선택하는 다중모달 희소 샘플링 전략을 도입하여 계산 중복을 줄이기 위해.
  • 세그먼트 간 동적 가중치를 적용하는 상호 세그먼트 주의 메커니즘을 통해 다중모달 융합을 효율적으로 구현하기 위해.
  • 높은 정확도를 유지하면서 FLOPs, 파라미터 수, 추론 지연 시간을 최소화하여 엣지 배포를 최적화하기 위해.

제안 방법

  • 시간적 및 구조적 특성을 인간 활동의 맥락에서 유지하면서, 원시 IMU 시계열 데이터를 그람형 각도 필드(GAF) 변환을 통해 2차원 회색조 이미지로 변환한다.
  • RGB 및 IMU 입력에서 대표적인 시간 세그먼트를 선택하는 다중모달 희소 샘플링 전략을 적용하여 데이터 중복을 줄이되 핵심 정보를 손실하지 않도록 한다.
  • RGB 및 IMU 모달의 대응 세그먼트 간에서 동적 주의 가중치를 학습하는 상호 세그먼트 주의 모듈을 설계하여 효율적이고 맥락 인식 가능한 융합을 가능하게 한다.
  • GAF 변환 이후 양 모달에 동일한 백본 네트워크를 사용하여 구조적 차이를 최소화하고 파라미터 효율성을 향상시킨다.
  • 일반화 능력을 향상시키기 위해 조기 정지와 데이터 증강을 적용한 교차 엔트로피 손실을 사용하여 엔드 투 엔드 MMTSA 모델을 훈련시킨다.
  • FLOPs, 파라미터 수, 추론 지연 시간 등의 지표를 사용하여 엣지 디바이스에서의 모델 효율성을 평가한다.

실험 결과

연구 질문

  • RQ1IMU와 RGB 데이터에 대한 통일되고 동형적인 표현이 다중모달 HAR에서 시간적 상관관계를 향상시키고 구조적 차이를 줄이는 데 기여하는가?
  • RQ2다중모달 세그먼트의 희소 샘플링이 계산 부담을 크게 줄이면서도 정확도를 유지하는가?
  • RQ3상호 세그먼트 주의 메커니즘이 시간적 세그먼트 간 다중모달 특징을 효과적으로 융합하여 인식 성능을 향상시키는가?
  • RQ4엣지 디바이스에서 MMTSA는 정확도, FLOPs, 추론 지연 시간 측면에서 SOTA 방법과 비교해 어떻게 성능을 내는가?
  • RQ5제안된 방법은 IMU를 초월한 일차원 센서 모달리티로도 확장 가능한가?

주요 결과

  • MMTSA는 이전 SOTA 방법 대비 MMAct 데이터셋에서 교차 주체 F1 점수를 11.13% 향상시켰다.
  • DataEgo 데이터셋에서 MMTSA는 SOTA 모델 대비 FLOPs를 94% 감소시키고 추론 지연 시간을 82.6% 감소시켰으며, 더 높은 정확도를 유지했다.
  • 제거 실험 결과, GAF 변환, 희소 샘플링, 상호 세그먼트 주의 모두 성능 향상과 효율성 향상에 기여하는 것으로 확인되었다.
  • MMTSA는 MMAct, NTU-RGB+D, DataEgo의 세 개의 공개 데이터셋에서 뛰어난 일반화 능력과 강건성을 보였다.
  • 엔지 디바이스에서의 효율성은 검증되었으며, 모바일 및 웨어러블 시스템에서 실시간 배포에 매우 적합함을 보였다.
  • 더 높은 파라미터 수에도 불구하고 MMTSA의 계산 효율성과 낮은 지연 시간 덕분에 엣지 배포에 매우 적합하며, 프루닝 및 양자화를 통한 추가 최적화 가능성이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.