[論文レビュー] Multi-scale Transformer-based Network for Emotion Recognition from Multi Physiological Signals
本論文は、マルチスケール特徴抽出とガウス変換を活用して表現学習を向上させる、マルチモodalな生理的信号からの連続的感情認識のためのマルチスケール変換器ベースの深層学習モデルを提案する。モデルはEPiC 2023コンペティションベンチマークでRMSE 1.45を達成し、特に被験者間設定において、複数の評価シナリオで優れた性能を示した。
This paper presents an efficient Multi-scale Transformer-based approach for the task of Emotion recognition from Physiological data, which has gained widespread attention in the research community due to the vast amount of information that can be extracted from these signals using modern sensors and machine learning techniques. Our approach involves applying a Multi-modal technique combined with scaling data to establish the relationship between internal body signals and human emotions. Additionally, we utilize Transformer and Gaussian Transformation techniques to improve signal encoding effectiveness and overall performance. Our model achieves decent results on the CASE dataset of the EPiC competition, with an RMSE score of 1.45.
研究の動機と目的
- マルチモダリティ生理的信号における時間的およびマルチスケールパターンを効果的に捉えるエンドツーエンドの深層学習アーキテクチャの開発。
- ノイズが多く非定常な生理的信号の課題に対処するため、マルチスケール特徴抽出と頑健な信号符号化技術を統合。
- アテンションメカニズムとスケーラブルな特徴学習を活用して、被験者間および感情的刺激の観点でのモデル一般化を向上。
- EPiC 2023コンペティションデータセット上でモデルの性能を評価。このデータセットは、リアルタイムの生理的データから得られる瞬時の価値と覚醒度のアノテーションを提供する。
- 異なるデータ分割戦略(時系列間、被験者間、刺激要因間、バージョン間)がモデルの頑健性と一般化性能に与える影響を調査。
提案手法
- モデルは、4つのアテンションヘッドと1024次元の隠れ層を備えたマルチスケール変換器エンコーダーを採用し、生理的信号からの階層的表現を抽出する。
- 8つの生理的信号(ECG、BVP、EMG_CORU、EMG_TRAP、EMG_ZYGO、GSR、RSP、SKT)において、局所的およびグローバルな時間的パターンを捉えるためにマルチスケール特徴抽出を適用。
- 入力信号にガウス変換を適用することで、信号符号化の向上とノイズおよび非定常性に対するモデルの頑健性を強化。
- 10エポックにわたりコサインスケジューリングを用いたウォームリスタートを伴うAdamW最適化手法を用い、エンドツーエンドで学習を実行。目的関数は平均二乗誤差(MSE)損失を最小化する。
- シーケンス長は2048に固定され、4つの異なるシナリオ(時系列間、被験者間、刺激要因間、バージョン間)で評価が実施された。
- アーキテクチャはTensorFlowを用いて実装され、1台のGTX 3090 GPU上で学習され、高解像度の生理的シーケンスの効率的処理が可能となった。

実験結果
リサーチクエスチョン
- RQ1既存手法と比較して、マルチスケール変換器ベースのアーキテクチャは、マルチモダリティ生理的信号からの連続的価値と覚醒度をどの程度うまくモデル化できるか?
- RQ2マルチスケール特徴抽出とガウス変換は、ノイズの多い生理的データにおける感情認識の頑健性と精度にどのような影響を与えるか?
- RQ3特に被験者間および未知の感情的刺激に対して、モデルの一般化性能はどの程度向上するか?
- RQ4動画視聴中に収集されたリアルタイムの生理的信号から、感情変化の時間的ダイナミクスを効果的に学習できるか?
- RQ5アテンションメカニズムおよびマルチヘッド自己アテンションは、生理的信号シーケンス内の複雑な非線形関係を捉えるためにどの程度寄与するか?
主な発見
- 提案モデルはEPiC 2023コンペティションのテストセットで全体的にRMSE 1.45を達成し、連続的感情回帰において優れた性能を示した。
- 被験者間シナリオで最高の性能が得られ、覚醒度のRMSEは1.336、価値のRMSEは1.345であった。これは、未観測の個人に対しても強い一般化能力を示している。
- 被騟能者間シナリオでは、覚醒度の標準偏差が0.2276、価値の標準偏差が0.0576と低く抑えられており、高い一貫性と信頼性を示した。
- 刺激要因間シナリオでは性能が低下し、覚醒度のRMSEが1.509、価値のRMSEが1.514であった。これは、以前に見過ごされた感情的刺激への一般化が限定的であることを示唆している。
- バージョン間シナリオでは、覚醒度のRMSEが1.369、価値のRMSEが1.352であった。同じ感情的刺激の異なるバージョンでテストした場合、中程度の性能を示した。
- 時系列間シナリオの結果(覚醒度のRMSE 1.503、価値のRMSE 1.639)は、初期データから後の感情状態を予測することがモデルにとって困難であることを示しており、時間的一般化の課題が浮き彫りになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。