[論文レビュー] Occlusion-Adaptive Deep Network for Robust Facial Expression Recognition
本稿では、部分的閉塞下における顔の感情認識を向上させるために、閉塞領域からの汚損された特徴を抑圧するランドマークガイドド・アテンションブランチと、補完的で部分レベルの分類器を学習する顔領域ブランチを組み合わせた、閉塞に適応する深層ネットワーク(OADN)を提案する。OADNは、5つのベンチマークデータセットにおいて最先端の性能を達成し、Pose-FERPlusデータセットで88.52%の正確度、Occlusion-FERPlusデータセットで84.57%の正確度を記録しており、RANなどの先行手法を顕著に上回っている。
Recognizing the expressions of partially occluded faces is a challenging computer vision problem. Previous expression recognition methods, either overlooked this issue or resolved it using extreme assumptions. Motivated by the fact that the human visual system is adept at ignoring the occlusion and focus on non-occluded facial areas, we propose a landmark-guided attention branch to find and discard corrupted features from occluded regions so that they are not used for recognition. An attention map is first generated to indicate if a specific facial part is occluded and guide our model to attend to non-occluded regions. To further improve robustness, we propose a facial region branch to partition the feature maps into non-overlapping facial blocks and task each block to predict the expression independently. This results in more diverse and discriminative features, enabling the expression recognition system to recover even though the face is partially occluded. Depending on the synergistic effects of the two branches, our occlusion-adaptive deep network significantly outperforms state-of-the-art methods on two challenging in-the-wild benchmark datasets and three real-world occluded expression datasets.
研究の動機と目的
- 部分的閉塞が生じる現実世界の状況において、顔の感情認識の耐障害性を高めるための挑戦に取り組むこと。
- 閉塞領域からの汚損された特徴を除外し、非閉塞領域に注目することで、モデルの耐障害性を向上させること。
- 重複しない顔の領域ブロックに対して独立した分類器を訓練することで、特徴の多様性と識別能を向上させること。
- 小規模な感情認識データセットにおける過学習を、領域ベースの分類器からの複数の監視信号によって軽減すること。
- アテンションと領域ベース学習を統合的に組み合わせた、閉塞に強い認識を実現する統合的な深層学習フレームワークを構築すること。
提案手法
- ランドマークガイドド・アテンションブランチは、検出された顔のキーポイントからの信頼度スコアを用いて、閉塞領域からの特徴を抑圧するアテンションマップを生成する。
- 生成されたアテンションマップを用いて、グローバル特徴を調整することで、表現学習中に非閉塞で識別に有用な顔領域に注目できるようにする。
- 顔領域ブランチは、最終の畳み込み特徴マップをK個の重複しないブロックに分割し、それぞれを独立に表情を予測するように訓練する。
- ネットワークは、ランドマークガイドド・アテンションブランチからの損失と顔領域ブランチからの損失の両方を同時に最適化し、両者の寄与度を調整するための学習可能な重みλを用いる。
- 目の周辺や口元といった顔の重要な部位に関するドメイン知識を活用し、感情に関連する領域に注目するアテンションをガイドする。
- FerPlus、RAF-DB、および野生環境下の閉塞ベンチマークなどのデータセット上で、エンドツーエンドに訓練を行い、部成分の寄与度をアブレーションスタディで検証した。
実験結果
リサーチクエスチョン
- RQ1顔の閉塞によって汚損された特徴を、感情認識の過程で効果的に抑圧するための深層学習モデルはどのように設計できるか?
- RQ2顔のキーポイントによってガイドされるアテンション機構は、感情認識における閉塞への耐性をどの程度向上させられるか?
- RQ3重複しない顔領域に独立した分類器を訓練することで、部分的閉塞下におけるモデルの耐障害性は向上するか?
- RQ4アテンションと領域ベース学習の相乗効果は、単一ブランチアプローチと比較して、性能をどの程度向上させるか?
- RQ5閉塞された表情認識データセットにおいて最適なパフォーマンスを発揮するハイパーパrameter設定(例:信頼度しきい値T、領域数K、損失重みλ)は何か?
主な発見
- OADNはPose-FERPlusデータセットで88.52%の正確度を達成し、RANを6.29ポイント上回った。
- Occlusion-FERPlusデータセットでは、OADNは84.57%の正確度を記録し、Pose>45サブセットにおいてRANよりも7.10ポイント高い性能を示した。
- アブレーションスタディの結果、最適なランドマーク信頼度しきい値Tは0.6であり、これより高いまたは低い値では性能が低下した。
- 顔領域ブランチにおける最良の性能はK=4の領域数で達成され、領域数が少ない場合や多すぎる場合に正確度が低下した。
- λ=1(アテンションブランチのみ)の最適化では、両ブランチを組み合わせた場合に比べて性能が劣ったことから、2つのコンponentsの相補的利点が確認された。
- 可視化結果から、OADNはgACNNよりも大規模な頭部ポーズや重度の閉塞下でも一般化性能に優れており、gACNNが誤って予測する状況でも正しく予測していることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。