[論文レビュー] Modality-Transferable Emotion Embeddings for Low-Resource Multimodal Emotion Recognition
本論文は、低リソースなマルチモodal感情認識のためのモダリティ転送可能なモデルを提案する。このモデルは、感情カテゴリを表すために事前学習済みのGloVe埋め込みを用い、これらの埋め込みを音声的および視覚的空間に変換するマッピング関数を学習する。入力表現と複数モダリティ間の感情埋め込みとの距離を測ることで、最先端の性能を達成し、未学習の感情についてもゼロショットおよびフェイントショット認識を効果的に行える。
Despite the recent achievements made in the multi-modal emotion recognition task, two problems still exist and have not been well investigated: 1) the relationship between different emotion categories are not utilized, which leads to sub-optimal performance; and 2) current models fail to cope well with low-resource emotions, especially for unseen emotions. In this paper, we propose a modality-transferable model with emotion embeddings to tackle the aforementioned issues. We use pre-trained word embeddings to represent emotion categories for textual data. Then, two mapping functions are learned to transfer these embeddings into visual and acoustic spaces. For each modality, the model calculates the representation distance between the input sequence and target emotions and makes predictions based on the distances. By doing so, our model can directly adapt to the unseen emotions in any modality since we have their pre-trained embeddings and modality mapping functions. Experiments show that our model achieves state-of-the-art performance on most of the emotion categories. In addition, our model also outperforms existing baselines in the zero-shot and few-shot scenarios for unseen emotions.
研究の動機と目的
- マルチモーダル感情認識における感情間の関係モデリングの欠如が、最適でない性能をもたらすという問題に対処する。
- とくに希少または未学習の感情カテゴリに対して、低リソースな感情認識の課題に取り組む。
- 事前学習済みの感情埋め込みとモダリティ転送を活用することで、未学習の感情に対するゼロショットおよびフェイントショット学習を可能にする。
- 複数モダリティ間で共有される意味的知識を統合したエンドツーエンド学習により、低リソース環境における汎化性と頑健性を向上させる。
提案手法
- テキストモダリティにおける感情カテゴリの意味的表現として、事前学習済みのGloVe埋め込みを用いる。
- テキスト感情埋め込みを音声的および視覚的空間に射影する2つのマッピング関数 $f_{t\rightarrow a}$ と $f_{t\rightarrow v}$ を学習する。
- 各モダリティにおいて、入力シーケンス表現とターゲット感情埋め込みとの距離を計算して予測を行う。
- 複数モダリティからの距離を学習されたアテンションメカニズムを用いて統合し、最終的な感情予測を生成する。
- 未学習の感情カテゴリに対して、同じフローをその事前学習済み埋め込みを用いて直接適用することでゼロショット推論を可能にする。
- 共同学習と継続的学習を用いて、既存クラスにおける悲観的忘却を防ぐことでフェイントショット適応を支援する。

実験結果
リサーチクエスチョン
- RQ1共有される意味的埋め込みを通じて感情間の関係をモデリングすることで、マルチモーダル感情認識の性能が向上するか?
- RQ2ラベル付き学習データが一切ない状況下で、モデルが未学習の感情カテゴリにどの程度一般化できるか?
- RQ3極めて少ないデータで低リソースな感情に対して、提案手法はどの程度有効か?
- RQ4モダリティごとの性能に差が生じるか?また、特定の感情が1つのモダリティに強く特徴的な場合、単一モダリティのゼロショット予測がマルチモーダル設定を上回る可能性はあるか?
主な発見
- 提案モデルは、IEMOCAPおよびCMU-MOSEIデータセットの大多数の感情カテゴリで最先端の性能を達成した。
- IEMOCAPデータセットでは、音声的および視覚的モダリティのみを用いて89.1%のゼロショット精度を達成し、マルチモーダルベースラインを上回った。
- フェイントショット学習では、共同学習(JT)を用いたモデルが、学習データの1%しか使用しない状況で、未学習の感情「驚き」に対して86.1%の精度を達成した。
- 微調整ベースラインと比較して、提案手法はフェイントショット状況で優れた性能を示した。微調整は悲観的忘却を引き起こし、性能の低下を招くためである。
- 特定の感情(例:音声モダリティにおける「驚き」)が1つのモダリティに強く特徴的な場合、単一モダリティのゼロショット予測がマルチモーダル設定を上回ることがある。
- アブレーションスタディの結果、テキストおよび音声モダリティが視覚モダリティよりも寄与度が高く、モダリティ統合はあらゆる設定で一貫して性能向上をもたらした。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。