[論文レビュー] TACOformer:Token-channel compounded Cross Attention for Multimodal Emotion Recognition
本稿では、生理的信号からの感情認識を向上させるために、トークンレベルおよびチャネルレベルのクロスアテンション機構を統合する新しいマルチモーダル統合フレームワーク、TACOformerを提案する。2次元空間的位置符号化とEEGおよび周辺信号のためのデュアルストリーム変換器を組み合わせることで、DEAPおよびDREAMERデータセットにおいて最先端の性能を達成し、既存手法と顕著な差をつける。
Recently, emotion recognition based on physiological signals has emerged as a field with intensive research. The utilization of multi-modal, multi-channel physiological signals has significantly improved the performance of emotion recognition systems, due to their complementarity. However, effectively integrating emotion-related semantic information from different modalities and capturing inter-modal dependencies remains a challenging issue. Many existing multimodal fusion methods ignore either token-to-token or channel-to-channel correlations of multichannel signals from different modalities, which limits the classification capability of the models to some extent. In this paper, we propose a comprehensive perspective of multimodal fusion that integrates channel-level and token-level cross-modal interactions. Specifically, we introduce a unified cross attention module called Token-chAnnel COmpound (TACO) Cross Attention to perform multimodal fusion, which simultaneously models channel-level and token-level dependencies between modalities. Additionally, we propose a 2D position encoding method to preserve information about the spatial distribution of EEG signal channels, then we use two transformer encoders ahead of the fusion module to capture long-term temporal dependencies from the EEG signal and the peripheral physiological signal, respectively. Subject-independent experiments on emotional dataset DEAP and Dreamer demonstrate that the proposed model achieves state-of-the-art performance.
研究の動機と目的
- 既存のマルチモーダル統合手法が、トークン単位またはチャネル単位の相互作用のどちらかに焦点を当てるが、両方を同時に扱わないという限界を解消すること。
- 生理的信号の時間的(トークン)および空間的(チャネル)次元における補完的相互依存関係を捉えることで、感情認識の精度を向上させること。
- EEGチャネルの空間的分布情報を、新規の2次元位置符号化方式によって保持すること。
- 感情認識を越えてマルチモーダルな多次元時系列データに一般化可能な統合モジュールを開発すること。
提案手法
- 統一されたアテンションメカニズムを通じて、トークンおよびチャネルレベルの両方でクロスモーダル相互作用を統合的にモデル化する、トークン-チャネルコンパound(TACO)クロスアテンションモジュールを導入する。
- EEGおよび周辺生理的信号(例:ECG、EMG、EOG、GSR)からの長期的時間的依存性を抽出するために、2つの独立したビジョン変換器エンコーダーを採用する。
- EEG電極の空間的配置を符号化するための2次元位置符号化法を適用し、脳信号解釈に不可欠なトポグラフィー情報を保持する。
- 時間ステップ(トークン)および信号チャネルの両方にわたってアテンションスコアを計算する統合アテンションメカニズムを用い、包括的な特徴統合を実現する。
- DEAPおよびDREAMERデータセットに対して、5分割交差検証を用いた被験者独立評価を実施し、妥当性を確保する。
- アンブレーションスタディおよび統計的t検定を実施し、TACOアテンションおよび2次元位置符号化の各コンポーネントの寄与を検証する。
実験結果
リサーチクエスチョン
- RQ1トークンレベルおよびチャネルレベルの両方の相互作用を統合的にモデル化する統一されたクロスアテンションメカニズムは、マルチモーダル感情認識を向上させることができるか?
- RQ2EEG信号に2次元空間的位置符号化を組み込むことで、標準的な1次元位置符号化と比較して性能が向上するか?
- RQ3TACOクロスアテンションは、単独のトークン単位(TCA)またはチャネル単位(CCA)のクロスアテンションと比較して、性能および特徴表現において優れているか?
- RQ4TACOモジュールによる向上は、複数の評価指標において統計的に有意であるか?
主な発見
- DEAPデータセットでは、感情のValenceで91.59%、Arousalで92.02%の精度を達成し、DCCA、FLDNET、GA-MLPを含むすべてのベースラインを上回った。
- DREAMERデータセットでは、Valenceで94.58%、Arousalで94.03%の精度に到達し、被験者独立設定における優れた一般化性能を示した。
- アンブレーションスタディの結果、TACOクロスアテンションモジュールは連結、TCA、CCAを大きく上回り、CCAと比較してValence精度で2.8%の絶対的向上を示した。
- 2次元位置符号化法は、1次元位置符号化と比較して、Valenceで2.25%、Arousalで2.10%の性能向上をもたらし、空間トポロジーの保持における有効性を裏付けた。
- 対応t検定の結果、TACOとTCA、CCAの両方を比較した場合にp < 0.05で統計的に有意な改善が確認され、提案手法の堅牢性を裏付けた。
- アテンション行列の可視化結果から、TACOは時間軸およびチャネル軸の両方で多様なアテンションスコアを割り当てているのに対し、TCAおよびCCAは一方の軸に沿って繰り返しパターンを示すことがわかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。