Skip to main content
QUICK REVIEW

[논문 리뷰] Husformer: A Multi-Modal Transformer for Multi-Modal Human State Recognition

Ruiqi Wang, Wonse Jo|arXiv (Cornell University)|2022. 09. 30.
Emotion and Mood Recognition인용 수 8
한 줄 요약

Husformer는 다중모달 입력에서 수동적 특징 공학 및 정렬이 필요 없이, 상호모달 주의를 통해 모달 간 의존성을 모델링하고, 자기주의 주의를 통해 융합된 표현 내의 맥락적 특징을 우선시함으로써 인간 상태 인식을 향상시키는 엔드 투 엔드 다중모달 트랜스포머 프레임워크이다. DEAP, WESAD, MOCAS, CogLoad 네 가지 벤치마크 데이터셋에서 최신 기술 대비 뛰어난 성능을 보이며, 특히 원시 다중모달 입력에서 두각을 나타낸다.

ABSTRACT

Human state recognition is a critical topic with pervasive and important applications in human-machine systems. Multi-modal fusion, the combination of metrics from multiple data sources, has been shown as a sound method for improving the recognition performance. However, while promising results have been reported by recent multi-modal-based models, they generally fail to leverage the sophisticated fusion strategies that would model sufficient cross-modal interactions when producing the fusion representation; instead, current methods rely on lengthy and inconsistent data preprocessing and feature crafting. To address this limitation, we propose an end-to-end multi-modal transformer framework for multi-modal human state recognition called Husformer. Specifically, we propose to use cross-modal transformers, which inspire one modality to reinforce itself through directly attending to latent relevance revealed in other modalities, to fuse different modalities while ensuring sufficient awareness of the cross-modal interactions introduced. Subsequently, we utilize a self-attention transformer to further prioritize contextual information in the fusion representation. Using two such attention mechanisms enables effective and adaptive adjustments to noise and interruptions in multi-modal signals during the fusion process and in relation to high-level features. Extensive experiments on two human emotion corpora (DEAP and WESAD) and two cognitive workload datasets (MOCAS and CogLoad) demonstrate that in the recognition of human state, our Husformer outperforms both state-of-the-art multi-modal baselines and the use of a single modality by a large margin, especially when dealing with raw multi-modal signals. We also conducted an ablation study to show the benefits of each component in Husformer.

연구 동기 및 목표

  • 기존의 다중모달 융합 방법이 수동적 특징 공학 및 일관되지 않은 정렬에 의존하는 데에 기인한 한계를 해결하기 위해.
  • 사전 특징 정렬 없이도 효과적으로 상호모달 의존성과 맥락적 상호작용을 모델링할 수 있는 엔드 투 엔드 프레임워크를 개발하기 위해.
  • 원시로 처리되지 않은 다중모달 신호를 사용할 경우에도 인식 정확도와 강인성을 향상시키기 위해.
  • 인간-로봇 팀워크 및 CCTV 모니터링과 같은 실용적 응용 분야에서 실시간, 적응형 인간 상태 예측을 가능하게 하기 위해.

제안 방법

  • 모델은 1D 컨볼루션 레이어를 통해 다중모달 입력(예: EEG, EMG, GSR, 눈 깜빡임)을 처리하여 공통 차원성을 가진 저수준 단모달 특징을 추출한다.
  • 저수준 단모달 특징는 융합된 저수준 표현으로 연결되며, 이는 상호모달 주의 메커니즘의 공통 맥락으로 기능한다.
  • 상호모달 주의 트랜스포머는 각 모달이 다른 모달의 관련 특징에 주목할 수 있도록 하여, 모달 간 관련성에 기반해 단모달 표현을 강화한다.
  • 강화된 단모달 특징는 중간 수준 융합 표현으로 연결되며, 이는 자기주의 주의 트랜스포머를 통해 처리되어 장기적인 맥락적 의존성을 강조한다.
  • 최종 고수준 융합 표현은 완전히 연결된 레이어에 입력되어 인간의 정서적 및 인지 상태 분류를 수행한다.
  • 전체 프레임워크는 엔드 투 엔드로 훈련되어 수작업 특징 정렬 또는 전처리가 필요 없도록 한다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 프레임워크는 수동적 특징 정렬이나 공학 없이도 다중모달 인간 상태 인식에서 상호모달 의존성을 효과적으로 모델링할 수 있는가?
  • RQ2기존의 조기 또는 후기 융합 전략과 비교해 상호모달 주의는 융합 표현 품질을 어떻게 향상시키는가?
  • RQ3융합 표현에서 자기주의 주의는 장거리 의존성에 대한 맥락 모델링과 성능 향상에 얼마나 기여하는가?
  • RQ4Husformer는 사전 처리되거나 정렬된 특징에 의존하는 모델과 비교해 원시 다중모달 입력에서 어떻게 성능을 발휘하는가?
  • RQ5Husformer는 인간-로봇 시스템에서 실시간 인지 부하 예측과 같은 실제 응용 분야에 일반화될 수 있는가?

주요 결과

  • Husformer는 DEAP, WESAD, MOCAS, CogLoad 네 가지 벤치마크 데이터셋에서 최신 기술 다중모달 기반 모델 및 단모달 모델을 뛰어넘는 성능을 보였다.
  • 특히 원시 다중모달 특징를 사용할 경우 뛰어난 성능을 발휘하여 특징 공학 의존도가 낮고 강인함을 입증하였다.
  • 제거 실험 결과, 상호모달 주의 및 자기주의 주의 메커니즘이 모두 필수적임을 확인하였으며, 상호모달 주의는 융합 품질을 향상시키고, 자기주의 주의는 맥락적 특징 우선순위를 높였다.
  • 주의 패턴의 시각화 결과, 상호모달 주의는 배치 간 일관되고 적응 가능한 주의 맵을 생성하였으며, 특히 EEG 및 EMG 모달리티에서 관련 특징을 잘 강조하였다.
  • Husformer의 자기주의 주의 메커니즘은 안정적이고 장기적인 맥락 패턴을 학습하는 반면, 상호모달 주의가 제거된 베이스라인 HusFuse는 일관되지도 않고 비효율적인 주의 분포를 보였다.
  • 실제 CCTV 모니터링 작업에서 Husformer는 100 Hz 속도로 실시간으로 인지 부하(낮음/중간/높음)를 정확히 예측하여 인간-로봇 팀 내에서 동적 부하 조정을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.