Skip to main content
QUICK REVIEW

[論文レビュー] Multi-modal Expression Recognition with Ensemble Method

Chuanhe Liu, Xinjie Zhang|arXiv (Cornell University)|Mar 17, 2023
Speech and Audio Processing被引用数 4
ひとこと要約

本論文は、ABAW 2023 チャレンジ向けに、多様な事前学習済み視覚的および音声的特徴量と時系列エンコーダー(LSTM および Transformer)を組み合わせたアンサンブルベースのマルチモーダル表現認識システムを提示する。特徴量の戦略的融合とモデルアンサンブル戦略により、検証セットで平均 F1 スコア 0.45774 を達成した。

ABSTRACT

This paper presents our submission to the Expression Classification Challenge of the fifth Affective Behavior Analysis in-the-wild (ABAW) Competition. In our method, multimodal feature combinations extracted by several different pre-trained models are applied to capture more effective emotional information. For these combinations of visual and audio modal features, we utilize two temporal encoders to explore the temporal contextual information in the data. In addition, we employ several ensemble strategies for different experimental settings to obtain the most accurate expression recognition results. Our system achieves the average F1 Score of 0.45774 on the validation set.

研究の動機と目的

  • マルチモーダルデータ(視覚的および音声的)を活用することで、野生環境下における感情行動解析の性能を向上させること。
  • 単一モodal モデルの限界を補うために、補完的な視覚的および音声的特徴量を統合し、モデルの汎化性能と耐障害性を向上させること。
  • 視覚的および音声的モダリティに跨る複数の事前学習済みモデルから得られる効果的な特徴量の組み合わせを探索すること。
  • LSTM および Transformer アーキテクチャを用いて、順序的な感情動態の時系列モデリングを最適化すること。
  • 多様なアーキテクチャおよび特徴量セットを統合した構造的なモデルアンサンブル戦略により、最終予測性能を向上させること。

提案手法

  • 顔検出器を用いて顔画像を抽出・整列させ、欠損フレームについては時系列補間を実施することで、動画データを前処理する。
  • DenseNet、IResNet100、MobileNet、MAE による視覚的特徴量;eGeMAPS、ComParE 2016、VGGish、Wav2Vec 2.0、ECAPA-TDNN、HuBERT による音声的特徴量を含む、一連の事前学習済みモデルを用いてマルチモーダル特徴量を抽出する。
  • 異なる事前学習済みモデルから得られる多様な視覚的および音声的特徴量埋め込みを連結することで、マルチモーダル特徴表現を構築する。
  • 連結されたマルチモーダル特徴量に、LSTM および Transformer の2つの時系列エンコーダーを適用し、順序的文脈および時系列依存性をモデル化する。
  • Adam 最適化アルゴリズムを用い、25エポックのスケジュールで学習を実行し、ドロップアウト(0.3)、アテンションヘッド数(4)、シーケンス長(128)などのハイパーパramータを調整する。
  • 異なるアーキテクチャおよび特徴量組み合わせを持つモデル間での投票を含むアンサンブル戦略を採用することで、最終予測精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1異なる事前学習済み視覚的および音声的特徴量の組み合わせが、表現認識性能にどのように影響を与えるか?
  • RQ2LSTM と Transformer アーキテクチャのどちらが、顔および音声的表現の時系列ダイナミクスをモデル化する上でより効果的か?
  • RQ3モデルアンサンブルは、マルチモーダル表現認識における耐障害性および精度をどの程度向上させるか?
  • RQ4自己教師あり視覚的特徴量(例:MAE)は、教師ありモデル(例:IResNet100)と比較して、表現認識の文脈でどの程度優れているか?
  • RQ5手作業特徴量(例:ecapadnn、fbank)と深層ニューラルネットワークベースの音声特徴量の間で、マルチモーダル感情認識においてそれぞれの寄与度は何か?

主な発見

  • 多様な特徴量組み合わせおよびアーキテクチャを持つ複数のモデルのアンサンブルが、最高の検証 F1 スコア 0.45774 を達成した。
  • 最も性能の優れた個別モデル(LSTM に densenet、mae、ires100、ecapatdnn、hubert を組み合わせたもの)は F1 スコア 0.41410 を達成した。
  • MAE、IResNet100、DenseNet 視覚的特徴量と ecapatdnn、hubert 音声的特徴量を組み合わせた Transformer ベースのモデルは F1 スコア 0.39380 を達成した。
  • アブレーションスタディにおいて、MAE、IResNet100、DenseNet 視覚的特徴量と ecapatdnn、hubert 音声的特徴量の組み合わせが、最高の F1 スコア(0.39380)を達成した。
  • 手作業特徴量(例:ecapatdnn、fbank)を含めることで、一部の構成において、深層学習ベースの音声特徴量のみを用いる場合よりも性能が向上した。
  • モデルアンサンブル戦略は、個別モデルを著しく上回り、アーキテクチャおよび特徴選択の多様性の価値を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。