Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial-based neural networks for affect estimations in the wild

Decky Aspandi, Adria Mallol-Ragolta|arXiv (Cornell University)|Feb 3, 2020
Emotion and Mood Recognition参考文献 36被引用数 4
ひとこと要約

本論文は、ノイズ除去自己符号化器生成器から得られる潜在特徴を活用することで、野生環境下での価値と覚醒度推定を向上させる敵対的ニューラルネットワークフレームワークを提案する。これらの潜在特徴を条件とするマルチモーダルディスクライマーや音声モダリティを統合することで、SEWAおよびABAWチャレンジデータセットの両方で最先端の性能を達成し、分離された潜在表現を用いた敵対的訓練が感情計算モデルの性能向上に寄与することを示している。

ABSTRACT

There is a growing interest in affective computing research nowadays given its crucial role in bridging humans with computers. This progress has been recently accelerated due to the emergence of bigger data. One recent advance in this field is the use of adversarial learning to improve model learning through augmented samples. However, the use of latent features, which is feasible through adversarial learning, is not largely explored, yet. This technique may also improve the performance of affective models, as analogously demonstrated in related fields, such as computer vision. To expand this analysis, in this work, we explore the use of latent features through our proposed adversarial-based networks for valence and arousal recognition in the wild. Specifically, our models operate by aggregating several modalities to our discriminator, which is further conditioned to the extracted latent features by the generator. Our experiments on the recently released SEWA dataset suggest the progressive improvements of our results. Finally, we show our competitive results on the Affective Behavior Analysis in-the-Wild (ABAW) challenge dataset

研究の動機と目的

  • 野生環境(イン・ザ・ワイルド)における感情推定の向上を目的とした敵対的学習による潜在特徴の利用を検討すること。
  • 生成器から抽出した分離された潜在表現をディスクライマーに条件付けることで、マルチモーダルな感情認識を向上させること。
  • 潜在特徴の条件付けを伴う敵対的訓練が、連続的感覚推定タスクの性能向上に寄与するかどうかを調査すること。
  • 大規模かつ現実世界のデータセット(例:SEWAおよびAff-Wild2)に対して、提案手法の性能を評価すること。
  • 音声と視覚モダリティを敵対的特徴学習と組み合わせることで、頑健な感情推定を実現する有効性を示すこと。

提案手法

  • 星型GAN(Star-GAN)を模倣したアーキテクチャを採用し、条件付きディスクライマーと自己符号化器ベースの生成器(AEG)を用いて、画像のノイズ除去と潜在特徴抽出を実現する。
  • AEGはノイズのある入力を元に綺麗な画像を生成し、強固な潜在特徴zを出力する。これらの特徴zはディスクライマーの条件付けに使用される。
  • 条件付きディスクライマー(CD)は視覚的および音声的入力を受取り、潜在特徴zを条件として、本物/偽物の真偽性および価値/覚醒度レベルを推定する。
  • AEGとCDの間で敵対的訓練が行われる。AEGは再構成損失を最小化し、CDを欺くように学習する。一方、CDは本物および偽物のサンプルに対して分類精度を最大化する。
  • 音声モダリティは訓練中に、ディスクライマー内の視覚的特徴と音声埋め込みを連結することで統合される。
  • 再構成には標準のℓ²損失、分布マッチングには敵対的損失を用い、潜在空間における段階的訓練が実施される。

実験結果

リサーチクエスチョン

  • RQ1敵対的学習による潜在特徴は、野生環境下の動画データにおける連続的感覚推定を改善できるか?
  • RQ2ノイズ除去自己符号化器から抽出した潜在表現をディスクライマーに条件付けすることで、価値と覚醒度の予測性能が向上するか?
  • RQ3音声モダリティの統合は、敵対的フレームワークにおけるマルチモーダル感情推定の性能にどのように影響するか?
  • RQ4潜在特徴の条件付けを伴う敵対的訓練は、野生環境下の感情認識ベンチマークにおいて、標準的なディープラーニングベースラインをどの程度上回るか?
  • RQ5提案手法はSEWAやAff-Wild2のような多様なデータセットに一般化可能であり、競争力のある結果を達成できるか?

主な発見

  • AEG-CD-SZモデルは、SEWAデータセットにおける覚醒度推定でCCCが0.430を達成し、ベースライン(0.427)および最先端手法(0.392)を上回った。
  • ABAWチャレンジデータセットでは、AEG-CD-SZモデルが覚醒度でCCC 0.26を達成し、ベースライン(0.24)を上回り、標準ディスクライマーと比較しても一貫した改善が見られた。
  • 潜在特徴zと音声モダリティの両方の統合が、特に覚醒度次元において最も高い性能向上をもたらした。これはマルチモーダルおよび潜在特徴条件付き学習の重要性を示している。
  • ディスクライマー専用のベースライン(Disc)でさえ、SEWAのベースラインを価値および覚醒度の両指標で上回っており、敵対的訓練そのものが性能向上に寄与している可能性を示唆している。
  • AEGのノイズ除去能力は視覚的に検証され、生成画像は元の入力と比較して顕著なノイズ低減と明瞭性の向上を示した。
  • すべてのモデルバリアントにおいて段階的な改善が観察され、AEG-CD-SZは両データセットおよびすべての指標で一貫して最高の結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。