Skip to main content
QUICK REVIEW

[論文レビュー] EmMixformer: Mix transformer for eye movement recognition

Huafeng Qin, Hongyu Zhu|arXiv (Cornell University)|Jan 10, 2024
Gaze Tracking and Assistive Technology被引用数 4
ひとこと要約

EmMixformerは、眼動画像データにおける局所的時間的依存性、長距離の順序パターン、およびグローバルな周波数ドメイン特徴を統合的にモデル化する、注目LSTM、標準Transformer、およびフォーリエTransformerモジュールを組み合わせた新規ハイブリッドTransformerアーキテクチャを提案する。このモデルは、GazeBase RANデータセットで0.0795%の検証誤差率を達成し、既存手法を著しく上回る最先端の性能を発揮する。

ABSTRACT

Eye movement (EM) is a new highly secure biometric behavioral modality that has received increasing attention in recent years. Although deep neural networks, such as convolutional neural network (CNN), have recently achieved promising performance, current solutions fail to capture local and global temporal dependencies within eye movement data. To overcome this problem, we propose in this paper a mixed transformer termed EmMixformer to extract time and frequency domain information for eye movement recognition. To this end, we propose a mixed block consisting of three modules, transformer, attention Long short-term memory (attention LSTM), and Fourier transformer. We are the first to attempt leveraging transformer to learn long temporal dependencies within eye movement. Second, we incorporate the attention mechanism into LSTM to propose attention LSTM with the aim to learn short temporal dependencies. Third, we perform self attention in the frequency domain to learn global features. As the three modules provide complementary feature representations in terms of local and global dependencies, the proposed EmMixformer is capable of improving recognition accuracy. The experimental results on our eye movement dataset and two public eye movement datasets show that the proposed EmMixformer outperforms the state of the art by achieving the lowest verification error.

研究の動機と目的

  • 既存のディーブラーニングモデルが眼動画像シーケンスにおける局所的およびグローバルな時間的依存性を捉えることの限界を解消すること。
  • 時間領域および周波数領域における複数のアテンションメカニズムを統合することで、眼動画像バイオメトリクス認識の精度を向上させること。
  • 眼動画像データにおける短期的、長期的、およびグローバルな文脈表現を効果的に統合する、統一的でエンドツーエンドのディーブラーニングフレームワークを構築すること。
  • 新規のミックスド・トランスフォーマー・アーキテクチャを用いて、眼動画像認識分野における新たな最先端のベンチマークを確立すること。

提案手法

  • 提案されたEmMixformerは、3つのコンponentを組み合わせたミックスド・ブロックアーキテクチャを採用する:長距離シーケンスモデリングに標準Transformer、短期的時間的依存性の学習に注目LSTM、グローバルな周波数ドメインパターンの抽出にフォーリエTransformer。
  • 注目LSTMモジュールは、標準LSTMに自己アテンション機構を組み込むことで、関連する時間ステップに焦点を当て、短いシーケンスにおける特徴表現を向上させる。
  • フォーリエTransformerは、入力信号を高速フーリエ変換(FFT)で変換した後、周波数ドメインで自己アテンションを適用することで、グローバルな構造的パターンを学習可能にする。
  • 3つのモジュールはミックスド・ブロック内で並列に処理され、局所的、長距離的、グローバルな特徴の補完的学習を可能にする。
  • モデルは、眼動画像シーケンス上でクロスエントロピー損失を用いてエンドツーエンドで訓練され、検証誤差率(EER)が主な評価指標として用いられる。
  • アブレーションスタディでは、モジュールを段階的に追加(Transformer → LSTM+Transformer → attLSTM+Transformer → 完全なEmMixFormer)することで、各モジュールの寄与度を検証する。

実験結果

リサーチクエスチョン

  • RQ1時間ドメインおよび周波数ドメインのアテンションメカニズムを統合したハイブリッドトランスフォーマー・アーキテクチャは、標準モデルと比較して眼動画像認識の精度を向上させることができるか?
  • RQ2注目LSTMおよびフォーリエTransformerは、眼動画像シーケンスにおける短期的およびグローバル依存性のモデル化に、どの程度寄与するか?
  • RQ3時間領域の自己アテンション、強化されたLSTMへのアテンション、および周波数ドメインアテンションを統合した複数のアテンションメカニズムは、モデルの一般化性能およびロバストネスにどのような影響を及えるか?
  • RQ4提案されたEmMixFormerアーキテクチャは、時間サンプリング間隔が異なる多様な眼動画像データセットにおいても、最先端の性能を達成するか?

主な発見

  • EmMixFormerは、GazeBaseのRANサブデータセットで0.0795%の検証誤差率(EER)を達成し、ベースラインのTransformer(0.1220% EER)を著しく上回る。
  • アブレーションスタディにより、Transformerに注目LSTMを追加することでEERが0.1220%から0.0897%に低下し、短期的依存性のモデル化の価値が裏付けられた。
  • 注目LSTM+Transformer構成にフォーリエTransformerを統合することで、EERはさらに0.0795%に低下し、グローバルな周波数ドメイン特徴の学習の重要性が確認された。
  • 時間間隔の延長に伴う性能低下は、すべてのモデルで観察されたが、EmMixFormerはマルチスケールアテンションにより、時間的ばらつきの影響を効果的に軽減した。
  • 本モデルは、著者自身の眼動画像データセットおよび2つの公開ベンチマークを含む3つのデータセットで、既存の最先端手法を上回り、眼動画像認識分野における新たなSOTAを確立した。
  • アブレーション結果から、注目LSTMは標準LSTMよりも性能を向上させ、3つのモジュールを組み合わせた構成が最適な認識精度を達成することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。