Skip to main content
QUICK REVIEW

[논문 리뷰] EmMixformer: Mix transformer for eye movement recognition

Huafeng Qin, Hongyu Zhu|arXiv (Cornell University)|2024. 01. 10.
Gaze Tracking and Assistive Technology인용 수 4
한 줄 요약

EmMixformer는 눈동자 움직임 데이터에서 국소적 시간적 의존성, 장거리 순차적 패턴, 그리고 전역 주파수 도메인 특징을 동시에 모델링하기 위해 Attention LSTM, 표준 Transformer, 그리고 푸리에 변환기 모듈을 통합한 새로운 하이브리드 트랜스포머 아키텍처를 제안한다. 이 모델은 GazeBase RAN 데이터셋에서 검증 오류율 0.0795%를 기록하며 기존 방법들을 크게 능가하는 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Eye movement (EM) is a new highly secure biometric behavioral modality that has received increasing attention in recent years. Although deep neural networks, such as convolutional neural network (CNN), have recently achieved promising performance, current solutions fail to capture local and global temporal dependencies within eye movement data. To overcome this problem, we propose in this paper a mixed transformer termed EmMixformer to extract time and frequency domain information for eye movement recognition. To this end, we propose a mixed block consisting of three modules, transformer, attention Long short-term memory (attention LSTM), and Fourier transformer. We are the first to attempt leveraging transformer to learn long temporal dependencies within eye movement. Second, we incorporate the attention mechanism into LSTM to propose attention LSTM with the aim to learn short temporal dependencies. Third, we perform self attention in the frequency domain to learn global features. As the three modules provide complementary feature representations in terms of local and global dependencies, the proposed EmMixformer is capable of improving recognition accuracy. The experimental results on our eye movement dataset and two public eye movement datasets show that the proposed EmMixformer outperforms the state of the art by achieving the lowest verification error.

연구 동기 및 목표

  • 기존 딥 러닝 모델이 눈동자 움직임 시계열에서 국소적 및 전역적 시간적 의존성을 모두 포착하는 데에 한계가 있음을 해결하기 위해.
  • 시간 도메인과 주파수 도메인에서 다중 주의 메커니즘을 통합하여 눈동자 움직임 생체 인식 정확도를 향상시키기 위해.
  • 눈동자 움직임 데이터에서 단기, 장기, 전역적 맥락적 표현을 효과적으로 융합하는 통합형 엔드 투 엔드 딥 러닝 프레임워크를 개발하기 위해.
  • 새로운 혼합 트랜스포머 아키텍처를 사용하여 눈동자 움직임 인식 분야에서 새로운 최신 기술 수준의 기준을 설정하기 위해.

제안 방법

  • 제안된 EmMixformer는 세 가지 구성 요소를 조합한 혼합 블록 아키텍처를 사용한다: 장거리 시퀀스 모델링을 위한 표준 트랜스포머, 단기 시간적 의존성을 학습하기 위한 Attention LSTM, 전역 주파수 도메인 패턴을 포착하기 위한 푸리에 트랜스포머.
  • Attention LSTM 모듈은 표준 LSTM에 자기 주의 메커니즘을 통합하여 관련 시간 단계에 더 잘 집중하고 짧은 시퀀스에서의 특징 표현을 향상시킨다.
  • 푸리에 트랜스포머는 입력 신호를 빠른 푸리에 변환(FFT)을 통해 변환한 후 주파수 도메인에서 자기 주의를 적용하여 전역적인 구조적 패턴을 학습한다.
  • 세 모듈은 혼합 블록 내에서 병렬로 처리되며, 국소적, 장거리, 전역적 특징 간 상호보완적 학습을 가능하게 한다.
  • 모델은 눈동자 움직임 시퀀스에서 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 훈련되며, 주요 평가 지표로 검증 오류율(EER)을 사용한다.
  • 추가 구성 요소를 단계적으로 추가함(Transformer → LSTM+Transformer → attLSTM+Transformer → 전체 EmMixFormer)으로 인한 추론 실험을 통해 각 모듈의 기여도를 검증한다.

실험 결과

연구 질문

  • RQ1시간 도메인과 주파수 도메인 주의 메커니즘을 통합한 하이브리드 트랜스포머 아키텍처가 표준 모델 대비 눈동자 움직임 인식 정확도를 향상시킬 수 있는가?
  • RQ2Attention LSTM과 푸리에 트랜스포머는 눈동자 움직임 시계열에서 단기 및 전역적 의존성을 얼마나 기여하는가?
  • RQ3다중 주의 메커니즘(시간 도메인 자기 주의, 주의력 향상 LSTM, 주파수 도메인 주의)의 통합은 모델의 일반화 능력과 강건성에 어떤 영향을 미치는가?
  • RQ4제안된 EmMixFormer 아키텍처는 시간 샘플링 간격이 다양할 수 있는 다양한 눈동자 움직임 데이터셋에서 최신 기술 수준의 성능을 달성하는가?

주요 결과

  • EmMixFormer는 GazeBase의 RAN 서브데이터셋에서 검증 오류율(EER) 0.0795%를 기록하여 기준 트랜스포머(0.1220% EER)보다 뚜렷한 향상을 보였다.
  • 추론 실험 결과, 트랜스포머에 Attention LSTM을 추가함으로써 EER가 0.1220%에서 0.0897%로 감소하여 단기 의존성 모델링의 가치를 입증했다.
  • attLSTM+Transformer 구성에 푸리에 트랜스포머를 추가함으로써 EER가 0.0795%로 추가로 감소하여 전역 주파수 도메인 특징 학습의 중요성을 확인했다.
  • 시간 간격 증가에 따라 모든 모델에서 성능 저하가 관찰되었으며, 이는 시간 변동성의 과제임을 시사하지만, EmMixFormer는 다중 척도 주의 메커니즘을 통해 이를 효과적으로 완화했다.
  • 저자들이 자체 확보한 눈동자 움직임 데이터셋과 두 개의 공개 벤치마크를 포함한 세 데이터셋에서 기존 최신 기술 수준의 방법들을 모두 능가하며, 눈동자 움직임 인식 분야에서 새로운 SOTA를 수립했다.
  • 추론 결과에 따르면, 주의 메커니즘이 통합된 LSTM(attention-enhanced LSTM)이 표준 LSTM보다 성능 향상을 보였으며, 세 모듈의 조합이 최적의 인식 정확도를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.