Skip to main content
QUICK REVIEW

[論文レビュー] A Personalized Affective Memory Neural Model for Improving Emotion Recognition

Pablo Barros, German I. Parisi|arXiv (Cornell University)|Apr 23, 2019
Emotion and Mood Recognition参考文献 35被引用数 4
ひとこと要約

本論文では、事前知識学習のための条件付き敵対的オートエンコーダと、個別化された感情表現を構築するためのGrow-When-Requiredネットワークを組み合わせた、パーソナライズされた感情記憶モデルを提案する。このモデルは、発振と価値の生成的編集を可能にすることで、オンラインで適応可能な感情認識を実現し、信頼性の高い顔の特徴エンコーディングと動的プロトタイプ更新を維持することで、実地データセットにおいて最先端の性能を達成している。

ABSTRACT

Recent models of emotion recognition strongly rely on supervised deep learning solutions for the distinction of general emotion expressions. However, they are not reliable when recognizing online and personalized facial expressions, e.g., for person-specific affective understanding. In this paper, we present a neural model based on a conditional adversarial autoencoder to learn how to represent and edit general emotion expressions. We then propose Grow-When-Required networks as personalized affective memories to learn individualized aspects of emotion expressions. Our model achieves state-of-the-art performance on emotion recognition when evaluated on extit{in-the-wild} datasets. Furthermore, our experiments include ablation studies and neural visualizations in order to explain the behavior of our model.

研究の動機と目的

  • 既存の感情認識モデルが個人差のある顔の表情を処理する点での限界を解消すること。
  • 完全な再トレーニングを必要とせずに、個別化された感情表現を学習することで、実世界の状況における適応性を向上させること。
  • オンラインによるニューラル表現のプロトタイプ更新を通じて、感情プロトタイプの継続的学習を可能にすること。
  • 強力な教師ありデータに依存するのを減らし、顔の表情の事前知識を獲得するための教師なしおよび敵対的学習を活用すること。
  • ニューラル可視化とアブレーションスタディを通じて、モデルの解釈可能性を向上させること。

提案手法

  • 条件付き敵対的オートエンコーダを用いて、所定の発振と価値を持つ顔の表情を生成する事前知識(PK)空間を学習する。
  • PKモデルは3つの識別器で訓練される:実際の顔画像用、感情固有の表現用、および写真的リアリズムの質を評価するためのもので、多様で現実的な顔の編集を保証する。
  • 個別化された感情記憶(P-AffMem)として、Grow-When-Required(GWR)ネットワークを用い、個々の顔の表情パターンに基づいて動的にプロトタイプニューロンを形成・更新する。
  • P-AffMemは、PKから事前に編集された顔の表現を初期化することで、相互作用開始直後から即座に認識能力を発揮できる。
  • エンコーダの活性化を可視化し、各識別器が特徴学習と表現品質にどのように影響するかを分析する。
  • 一般化された事前知識と個別に特化した学習を統合することで、再トレーニングなしにオンラインで適応可能なモデルを実現する。

実験結果

リサーチクエスチョン

  • RQ1ニューラルモデルは、教師なしの方法で一般化された感情表現をどのように学習し、パーソナライズされた感情認識を支援できるか?
  • RQ2生成的敵対的オートエンコーダは、感情モデリングのための顔の表情編集の多様性とリアリズムをどの程度向上させられるか?
  • RQ3GWRベースの感情記憶は、再トレーニングなしにリアルタイムで新しい顔の表情に動的に適応できるか?
  • RQ4事前知識とオンラインプロトタイプ学習の統合は、実地データセットにおける認識性能をどの程度向上させるか?
  • RQ5異なる識別器は、エンコーダーが感情に関連する顔の領域(例:目や口)に注目するのをどの程度形作るか?

主な発見

  • 提案されたモデルは、実地データセットにおける感情認識の最先端の性能を達成し、発振と価値の相関(CCC)指標において、既存のモデルを上回っている。
  • 3つの識別器(リアリズム、感情、写真的品質)を併用した場合が最良の客観的性能を示し、歪みのない明確な顔の特徴を生成するとともに、エンコーダーの注目を目の周辺や口といった感情に関連する重要な領域に集中させた。
  • ニューラル可視化により、感情識別器(D_em)を用いて訓練されたエンコーダーが、顔の表情に富んだ領域を効果的にフィルタリングしていることが確認され、この識別器を含まないモデルよりも高いCCCが得られた。
  • 感情記憶(P-AffMem)は、数秒間の動画処理後には、事前知識(PK)モデルを上回る性能を示し、継続的なオンライン適応と時間経過による精度向上を実証した。
  • アブレーションスタディの結果、ベース損失のみで訓練されたPKモデル(PK_base)は、意味のある表現を学習できず、劣悪な画像編集と低スコアのCCCが示された。
  • 生成的事前知識とオンラインプロトタイプ学習の統合により、完全な表情カバレッジが得られる前からも、信頼性の高い継続的で感情認識が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。