[論文レビュー] From Facial Expression Recognition to Interpersonal Relation Prediction
本稿では、欠損ラベルを伴う異種のデータセット上でトレーニングされたマルチタスク畳み込みネットワークを活用して、顔画像から細分化された人間関係的特徴(親しみやすさ、優位性、温かさなど)を予測する、新しいシames型ディープラーニングフレームワークを提案する。この手法は、マルコフ確率場を用いた属性伝播により、ばらばらなデータソースを統合し、顔の表情認識および実世界の画像における文脈を考慮した正確な人間関係的特徴予測において、最先端の性能を達成する。
Interpersonal relation defines the association, e.g., warm, friendliness, and dominance, between two or more people. Motivated by psychological studies, we investigate if such fine-grained and high-level relation traits can be characterized and quantified from face images in the wild. We address this challenging problem by first studying a deep network architecture for robust recognition of facial expressions. Unlike existing models that typically learn from facial expression labels alone, we devise an effective multitask network that is capable of learning from rich auxiliary attributes such as gender, age, and head pose, beyond just facial expression data. While conventional supervised training requires datasets with complete labels (e.g., all samples must be labeled with gender, age, and expression), we show that this requirement can be relaxed via a novel attribute propagation method. The approach further allows us to leverage the inherent correspondences between heterogeneous attribute sources despite the disparate distributions of different datasets. With the network we demonstrate state-of-the-art results on existing facial expression recognition benchmarks. To predict inter-personal relation, we use the expression recognition network as branches for a Siamese model. Extensive experiments show that our model is capable of mining mutual context of faces for accurate fine-grained interpersonal prediction.
研究の動機と目的
- 野生の状況下で、親しみやすさ、優位性、温かさといった細分化された人間関係的特徴が顔画像から予測可能かどうかを調査すること。
- 性別、年齢、アングル、表情などの属性ラベルが不完全または欠落している異種の顔データセットからの学習の課題に対処すること。
- 単一の人物の表情認識を越えて、高レベルの関係的推論を可能にする、ペアワイズの顔の相互作用を統合的にモデル化するディープラーニングフレームワークの開発。
- マルチタスク顔認識ネットワークで初期化されたシアンス型アーキテクチャを用いて、人間関係的特徴予測のエンドツーエンド学習を可能にすること。
提案手法
- 既存のデータセットと、9万枚を超えるWeb画像を含む新規に収集された大規模なExpWデータセットを組み合わせて、顔の表情、性別、年齢、頭部ポーズを同時に認識するマルチタスクディープ畳み込みネットワークをトレーニングする。
- トレーニング中に欠落している属性ラベルを推定するために、マルコフ確率場(MRFs)に基づく新しい属性伝播法を導入し、分布が異なる、ラベルが不完全なデータセット間での有効な学習を可能にする。
- 顔認識ネットワークを、2つの顔入力を並列に処理し、重みを共有し、特徴を統合して共同関係推論を行うシアンス型アーキテクチャの共有トランクとして使用する。
- 2つの顔画像を入力として受け取り、8つの人間関係的特徴(例:親しみやすさ、競争的、優位性)を予測するように、エンドツーエンドでシアンスネットワークをトレーニングする。
- 相対的な顔の位置などの空間的文脈手がかりを最終モデルに組み込み、複雑な社会的相互作用の認識性能を向上させる。
- 客観的なアノテーションが付与された映画フレームサブセットを用いてフレームワークを評価し、実世界の環境下でも頑健で信頼性の高い性能を示した。
実験結果
リサーチクエスチョン
- RQ1テキスト的または文脈的手がかりなしに、顔画像から親しみやすさ、優位性、温かさといった人間関係的特徴を正確に予測可能か?
- RQ2欠損または一貫性のない属性ラベルを伴う異種の顔データセット上で、ディープニューラルネットワークをどのように効果的にトレーニングできるか?
- RQ3ペアワイズの2人の顔を同時にモデル化することで、単一顔分析に比べて高レベルの関係的特徴予測がどの程度向上するか?
- RQ4MRFsによる属性伝播は、統計的分布やラベルの完全性に差があるデータセット間のドメインギャップを効果的に埋め合わせられるか?
主な発見
- 提案されたS-DCNモデルは、映画テストサブセットにおいて人間関係的特徴予測で70.20%のバランス精度を達成し、すべてのアブレーションバリアントを上回った。
- 空間的手がかりを含む完全なS-DCNモデルが最高の性能を示し、空間的文脈が関係推論を顕著に向上させることを示した。
- 表情ラベルで事前学習されたDCNを用いたモデルが、ベースラインのバリエーションの中で最高の性能(65.36%)を示し、強力な顔認識表現学習の重要性を強調した。
- 定性的な結果から、モデルは友好的な会話や対立といった動的な社会的相互作用をうまく捉えており、『アイアンマン』のシーンで期待される特徴と高い確率で一致した。
- 誤検出は、文脈情報の欠如に起因することが多く(例:真剣な本を読んでいるシーンを競争的と誤解)、マルチモーダルな文脈統合の必要性を示唆している。
- モデルはオバマと彼の娘の間で高い優位性を予測し、メルケルとオバマの間で高い競争的特徴を予測しており、現実の社会的認識と整合的であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。