[論文レビュー] Self context-aware emotion perception on human-robot interaction
本論文は、感情の連続性をValence-Arousalフレームワークを用いて統合することで、長期的人間-ロボット対話における感情認識を向上させる、新しいアプローチである自己文脈認識モデル(SCAM)を提案する。SCAMは文脈認識損失と特徴保持メカニズムを用いることで、音声分野で9.36%、映像分野で3.79%、マルチモodal設定で1.45%の精度向上を達成し、IEMOCAPデータセットにおいて最先端の性能を実現した。
Emotion recognition plays a crucial role in various domains of human-robot interaction. In long-term interactions with humans, robots need to respond continuously and accurately, however, the mainstream emotion recognition methods mostly focus on short-term emotion recognition, disregarding the context in which emotions are perceived. Humans consider that contextual information and different contexts can lead to completely different emotional expressions. In this paper, we introduce self context-aware model (SCAM) that employs a two-dimensional emotion coordinate system for anchoring and re-labeling distinct emotions. Simultaneously, it incorporates its distinctive information retention structure and contextual loss. This approach has yielded significant improvements across audio, video, and multimodal. In the auditory modality, there has been a notable enhancement in accuracy, rising from 63.10% to 72.46%. Similarly, the visual modality has demonstrated improved accuracy, increasing from 77.03% to 80.82%. In the multimodal, accuracy has experienced an elevation from 77.48% to 78.93%. In the future, we will validate the reliability and usability of SCAM on robots through psychology experiments.
研究の動機と目的
- 長期間の人間-ロボット対話において感情の連続性を無視する既存の感情認識モデルの限界を是正すること。
- ロボット自身の感情的文脈と過去の感情状態を統合することで、感情認識の精度を向上させること。
- 感情の離散的・連続的モデルを統合するために、感情をValence-Arousal空間に固定することで、時間的整合性を高めること。
- 文脈損失と特徴保持の有効性を検証し、マルチモーダル感情認識の向上に寄与すること。
- 将来的な実ロボットシステムにおけるSCAMの心理的妥当性の検証の基盤を築くこと。
提案手法
- SCAMは、感情の位置づけと再ラベル付けを可能にする2次元のValence-Arousal座標系を採用し、基本的でない感情との関係を学習できるようにする。
- 先行セグメントの感情を予測するのを促す、新しい文脈損失を導入し、感情の傾向の連続性を捉える。
- 予測時に過去の感情的文脈からの関連特徴を保持・統合する専用の情報保持構造を採用する。
- 感情分類、ValenceおよびArousalの予測を同時に最適化するマルチタスク損失を用いて、単モーダルおよびマルチモーダル学習を統合する。
- ValenceとArousalに基づく再ラベル付けを適用することで、感情表現の洗練とモダリティ間の一般化を向上させる。
- 訓練および評価のために、音声、視覚、マルチモーダル設定のあらゆる構成でIEMOCAPデータセットを活用する。

実験結果
リサーチクエスチョン
- RQ1過去の対話からの感情的文脈を統合することで、人間-ロボット対話における長期的感情認識が著しく向上するか?
- RQ2ValenceとArousalを用いた感情の連続性モデリングが、異なるモダリティにおける認識精度をどのように向上させるか?
- RQ3提案された文脈損失が、時間的経過に伴う感情傾向の予測能力をどの程度向上させるか?
- RQ4対立的または曖昧なマルチモーダル信号を処理する際、SCAMはベースラインモデルと比較してどのように優れているか?
- RQ5連続的および離散的感情モデリングの統合が、より強固で正確な感情認識をもたらすか?
主な発見
- 音声モダリティにおいて、SCAMは63.10%から72.46%へと9.36%の精度向上を達成した。
- 映像モダリティでは、77.03%から80.82%へと3.79%の精度向上が見られた。
- マルチモーダル設定では、77.48%から78.93%へと1.45%の精度向上が確認された。
- 文脈損失はトレーニング中に一貫して減少しており、合計テスト損失の変動にもかかわらず、感情の連続性の学習が効果的に行われていることが示された。
- 可視化により、ラベルの一貫性とは無関係に、SCAMが継続的に変化する感情的文脈に対しても正確な感情予測を維持できていることが確認された。
- 誤差分析の結果、音声と映像モダリティは補完的な誤りを示し、特に「happy」と「neutral」の感情を識別する際、映像モダリティが音声モダリティを上回った。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。