[論文レビュー] Non-Volume Preserving-based Feature Fusion Approach to Group-Level Expression Recognition on Crowd Videos.
本稿では、空間的および時間的関係をモデル化するための深層特徴レベルの統合を活用して、群の感情認識のための非体積保存統合(NVPF)フレームワークを提案する。この手法は、新しい群レベルの感情認識動画データセット(GECV)上で最先端の性能を達成し、個々の人物、群、フレームレベルの感情認識においても頑健であることを示している。
Group-level emotion recognition (ER) is a growing research area as the demands for assessing crowds of all sizes is becoming an interest in both the security arena as well as social media. This work extends the earlier ER investigations, which focused on either group-level ER on single images or within a video, by fully investigating group-level expression recognition on crowd videos. In this paper, we propose an effective deep feature level fusion mechanism to model the spatial-temporal information in the crowd videos. In our approach, the fusing process is performed on deep feature domain by a generative probabilistic model, Non-Volume Preserving Fusion (NVPF), that models spatial information relationship. Furthermore, we extend our proposed spatial NVPF approach to spatial-temporal NVPF approach to learn the temporal information between frames. In order to demonstrate the robustness and effectiveness of each component in the proposed approach, three experiments were conducted: (i) evaluation on AffectNet database to benchmark the proposed EmoNet for recognizing facial expression; (ii) evaluation on EmotiW2018 to benchmark the proposed deep feature level fusion mechanism NVPF; and, (iii) examine the proposed TNVPF on an innovative Group-level Emotion on Crowd Videos (GECV) dataset composed of 627 videos collected from publicly available sources. GECV dataset is a collection of videos containing crowds of people. Each video is labeled with emotion categories at three levels: individual faces, group of people and the entire video frame.
研究の動機と目的
- 単一の画像や孤立したフレームを超えて、完全な群の動画における群レベルの感情認識のギャップを埋める。
- 群の動画における空間的および時間的関係を効果的にモデル化する深層特徴レベルの統合メカニズムを開発する。
- 個々の人物、群、およびフレームレベルの感情ラベルを備えた、新たなベンチマークデータセットGECVを構築し、公開する。
- 実世界の群の動画データに対して、提案されたNVPFおよび時間的NVPF(TNVPF)手法の評価を実施し、感情認識の向上を図る。
- 複数のデータセットにおける削減実験および比較実験を通じて、統合メカニズムの有効性を実証する。
提案手法
- 空間的関係を保持する非体積保存統合(NVPF)を提案。これは、群の動画における深層特徴を統合する生成的確率的モデルである。
- 空間的NVPFを時間的ダイナミクスをモデル化できる空間的・時間的NVPF(TNVPF)に拡張する。
- NVPFメカニズムを深層特徴ドメインに適用し、複数のフレームおよび顔領域からの表現を統合する。
- 体積保存を仮定しない確率的フレームワークを用いて特徴の相互作用をモデル化し、柔軟で表現力のある統合を可能にする。
- GECVデータセットでは、学習および評価のため、個々の人物、群、フレームレベルの3段階のラベル付けを採用する。
- AffectNet(顔の感情認識用)、EmotiW2018(特徴統合用)、および新規のGECVデータセット(群レベル認識用)の3つのベンチマークで手法を検証する。
実験結果
リサーチクエスチョン
- RQ1提案されたNVPFメカニズムは、群の動画における深層特徴統合の観点から、群レベルの感情認識にどの程度効果的か?
- RQ2空間的・時間的拡張(TNVPF)により、フレーム間の時間的依存性を捉えることで、性能が向上するか?
- RQ3多段階の感情ラベルが付与された実世界の群の動画データに対して、既存の手法と比較して本手法はどのように性能を発揮するか?
- RQ4空間的モデリングと時間的モデリングの各コンポonentが、全体の認識性能にどの程度寄与しているか?
- RQ5多様で公開済みの群の動画に対して評価した場合、本手法はどの程度の頑健性を示すか?
主な発見
- 提案されたNVPF手法は、深層特徴レベルの統合のためのEmotiW2018ベンチマークで最先端の性能を達成し、複雑な特徴相互作用のモデル化の有効性を示している。
- TNVPFの拡張により、群の動画におけるフレーム間の時間的依存性を捉えることで、認識精度が顕著に向上した。
- 新たに導入されたGECVデータセットでは、個々の人物、群、フレームの3つの感情ラベルレベルすべてで優れた性能を発揮した。
- 削減実験の結果、空間的および時間的モデリングの両コンポーネントが最終的な認識精度に有意義に寄与していることが確認された。
- 多様な動画ソースに対して本手法は頑健であることが示され、実世界の群の動画データに対する汎用性の高さを示している。
- GECVデータセットは、今後の群レベルの感情認識研究のための貴重なベンチマークを提供しており、627本の動画と多段階のラベルが付与されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。