Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Domain Facial Expression Recognition: A Unified Evaluation Benchmark and Adversarial Graph Learning

Tianshui Chen, Tao Pu|arXiv (Cornell University)|Aug 3, 2020
Emotion and Mood Recognition参考文献 105被引用数 12
ひとこと要約

本稿では、クロスドメイン顔の感情認識(CD-FER)のための統一された評価ベンチマークを提案するとともに、グラフ畳み込みネットワークと adversarial 学習を用いて、ドメイン間で全体的および局所的特徴を同時に適応する Adversarial Graph Representation Adaptation(AGRA)フレームワークを導入する。AGRA は複数のデータセットで最先端の性能を達成し、ベンチマーク上での平均精度で先行手法を最大 8.5% まで上回った。

ABSTRACT

To address the problem of data inconsistencies among different facial expression recognition (FER) datasets, many cross-domain FER methods (CD-FERs) have been extensively devised in recent years. Although each declares to achieve superior performance, fair comparisons are lacking due to the inconsistent choices of the source/target datasets and feature extractors. In this work, we first analyze the performance effect caused by these inconsistent choices, and then re-implement some well-performing CD-FER and recently published domain adaptation algorithms. We ensure that all these algorithms adopt the same source datasets and feature extractors for fair CD-FER evaluations. We find that most of the current leading algorithms use adversarial learning to learn holistic domain-invariant features to mitigate domain shifts. However, these algorithms ignore local features, which are more transferable across different datasets and carry more detailed content for fine-grained adaptation. To address these issues, we integrate graph representation propagation with adversarial learning for cross-domain holistic-local feature co-adaptation by developing a novel adversarial graph representation adaptation (AGRA) framework. Specifically, it first builds two graphs to correlate holistic and local regions within each domain and across different domains, respectively. Then, it extracts holistic-local features from the input image and uses learnable per-class statistical distributions to initialize the corresponding graph nodes. Finally, two stacked graph convolution networks (GCNs) are adopted to propagate holistic-local features within each domain to explore their interaction and across different domains for holistic-local feature co-adaptation. We conduct extensive and fair evaluations on several popular benchmarks and show that the proposed AGRA framework outperforms previous state-of-the-art methods.

研究の動機と目的

  • 不一致なデータセットやバックボーンの選択により、クロスドメイン顔の感情認識(CD-FER)における公平で一貫性のある評価が不足している問題に対処すること。
  • 既存の CD-FER 手法が、ドメイン間でより転送可能であるにもかかわらず、局所的で細分化された特徴を無視しているという限界を特定すること。
  • 公平な比較が可能なよう、標準化されたソース/ターゲットデータセットと特徴抽出器を備えた統一された評価ベンチマークを提案すること。
  • グラフ表現学習と adversarial 訓練を用いて、ドメイン間で全体的および局所的特徴を共同で適応する、新しい AGRA フレームワークを開発すること。

提案手法

  • RAF-DB をソース、CK+、JAFFE、SFEW2.0、FER2013、ExpW をターゲットとして、同一のソース/ターゲットデータセットと ResNet-50 バックボーンを用いて、最先端手法を再実装することで統一された CD-FER ベンチマークを構築する。
  • ドメイン内での全体的・局所的特徴相関を表すグラフと、ドメイン間での特徴アライメントを表すグラフの2つを構築する。
  • 入力画像から抽出した全体的および局所的特徴のクラスごとの学習可能統計分布を用いて、グラフのノードを初期化する。
  • 2段階のグラフ畳み込みネットワーク(GCN)を用いる:1つはドメイン内での特徴伝搬と相互作用に、もう1つはドメイン間での全体的・局所的特徴の共適応に使用する。
  • ドメインシフトを最小化するために adversarial 学習を統合し、ドメイン不変な特徴表現を促進する。
  • 分類損失と adversarial 損失を組み合わせたマルチタスク損失を用いて、特徴学習とドメインアライメントを同時に最適化する。

実験結果

リサーチクエスチョン

  • RQ1ソース/ターゲットデータセットおよび特徴抽出器の選択が、CD-FER 評価のパフォーマンスと公平性に与える影響はいかほどか?
  • RQ2現在の最先端 CD-FER 手法が、ドメイン間でより転送可能である局所的で細分化された特徴をどれほど効果的に活用していないか、その程度は?
  • RQ3グラフベースのメッセージパッシングを用いた全体的および局所的特徴の共同適応は、クロスドメイン顔の感情認識を改善できるか?
  • RQ4提案された AGRA フレームワークは、多様なデータセットにおいて、既存手法と比較して精度と頑健性の面でどのように差をつけるか?
  • RQ5標準的な FER パイプラインにグラフネットワークを統合した場合の計算コストと効率への影響は?

主な発見

  • 提案された AGRA フレームワークは、5つのターゲットデータセット(CK+、JAFFE、SFEW2.0、FER2013、ExpW)全体で平均精度 66.13% を達成し、以前の最先端手法(ECAN)を平均で 7.49% 上回った。
  • CK+ データセットでは、AGRA は 85.27% の精度を達成し、次に良い手法(ECAN 79.77%)およびベースライン(ICID 74.42%)を大きく上回った。
  • アブレーションスタディの結果、adversarial 学習を除去すると平均精度が 58.18% に低下し、ドメイン不変特徴学習におけるその重要性が確認された。
  • グラフネットワークの統合により、推論時間は 2.54 ms、MACs は 0.00295% のみ増加し、計算オーバーヘッドは最小限に抑えられた。
  • 融合モジュールで GCN を Transformer に置き換えると性能が劣化したため、グラフベースのメッセージパッシングが、全体的・局所的特徴の共適応において優れた性能を発揮することが示された。
  • 統一ベンチマークは、先行研究におけるデータセットやバックボーンの選択の不一致が、誤ったパフォーマンス比較を引き起こしていることを明らかにした。これにより、標準化された評価の必要性が強調された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。