[論文レビュー] Two-stage Temporal Modelling Framework for Video-based Depression Recognition using Graph Representation
本稿では、複数スケールの顔面行動を捉えるためにグラフ表現を用いた、2段階の時系列モデリングフレームワークを提案する。まず、抑うつ関連特徴を強化するための抑うつ特徴強化(DFE)モジュールを用いて短期的特徴を向上させ、次にそれらを順次(SEG)およびスペクトル的(SPG)グラフ符号化によりビデオレベルのグラフ表現に変換する。AVEC 2013および2014データセットで最先端の性能を達成し、PCCは最大0.770、RMSEは8.18を記録した。
Video-based automatic depression analysis provides a fast, objective and repeatable self-assessment solution, which has been widely developed in recent years. While depression clues may be reflected by human facial behaviours of various temporal scales, most existing approaches either focused on modelling depression from short-term or video-level facial behaviours. In this sense, we propose a two-stage framework that models depression severity from multi-scale short-term and video-level facial behaviours. The short-term depressive behaviour modelling stage first deep learns depression-related facial behavioural features from multiple short temporal scales, where a Depression Feature Enhancement (DFE) module is proposed to enhance the depression-related clues for all temporal scales and remove non-depression noises. Then, the video-level depressive behaviour modelling stage proposes two novel graph encoding strategies, i.e., Sequential Graph Representation (SEG) and Spectral Graph Representation (SPG), to re-encode all short-term features of the target video into a video-level graph representation, summarizing depression-related multi-scale video-level temporal information. As a result, the produced graph representations predict depression severity using both short-term and long-term facial beahviour patterns. The experimental results on AVEC 2013 and AVEC 2014 datasets show that the proposed DFE module constantly enhanced the depression severity estimation performance for various CNN models while the SPG is superior than other video-level modelling methods. More importantly, the result achieved for the proposed two-stage framework shows its promising and solid performance compared to widely-used one-stage modelling approaches.
研究の動機と目的
- 既存の1段階手法が短期的および長期的抑うつ関連顔面行動を効果的にモデリングできないという限界に対処する。
- フレームレベルモデリングにおいて非抑うつ関連顔面属性(例:個人識別子)が優勢になる問題を克服し、抑うつサインからノイズを分離する。
- 複数スケールの短期的特徴を要約するグラフ構造としての新しいビデオレベル表現を構築する。
- 短期的特徴強化と長期的グラフベースのビデオ表現を統合することで、抑うつ重症度のエンドツーエンド学習を可能にする。
- 内部およびクロスデータセット評価において、1段階ベースラインと比較して提案フレームワークの優位性を実証する。
提案手法
- 顔面ダイナミクスを異なる時間スケールで捉えるために、マルチタスクボトルネック(MTB)モジュールを用いて短いビデオスライスから複数スケールの時系列特徴を抽出する。
- 各スケールに対して抑うつ特徴強化(DFE)モジュールを適用し、抑うつ関連の手がかりを強化するとともに、特徴表現内の非抑うつノイズを抑制する。
- スケール間で強化された特徴を連結し、非スパース(NS)サブモジュールを適用してさらに不要な属性を分離する。
- 2つの新しいグラフ符号化戦略、順次グラフ表現(SEG)およびスペクトル的グラフ表現(SPG)を構築し、全体のビデオをグラフとしてモデリングする。
- 得られたグラフ表現をグラフニューラルネットワーク(GNN)に供給し、抑うつ重症度スコアの回帰を実行する。
- DFEおよびGNNモジュール内にアテンション機構を組み込み、関連のある時系列的および空間的顔面パターンを優先する。

実験結果
リサーチクエスチョン
- RQ1短期的およびビデオレベルの顔面行動をモデリングする2段階フレームワークは、1段階手法と比較して抑うつ認識性能を向上させることができるか?
- RQ2提案されたDFEモジュールは、抑うつ関連特徴をどの程度向上させ、非抑うつ顔面属性からの干渉を軽減するか?
- RQ3異なるグラフ符号化戦略(SEG 対 SPG)は、複数スケールの短期的特徴を一貫性のあるビデオレベル表現に要約する際に、どの程度効果的か?
- RQ4グラフベースのビデオレベルモデリングの統合は、異なるデータセットおよび評価設定における一般化性能を向上させるか?
- RQ5提案されたフレームワークは、抑うつ検出を越えて、他のビデオレベル認識タスクへも拡張可能か?
主な発見
- 提案された2段階フレームワークは、MTB-DFE+SPG設定を用いてAVEC 2013テストセットでPCC 0.770、RMSE 8.18を達成し、多数の既存1段階手法を上回った。
- DFEモジュールは、全テスト対象のCNNモデルにおいて一貫して性能向上を示し、抑うつ関連の手がかりの強化と非抑うつノイズの抑制の有効性を裏付けた。
- スペクトル的グラフ表現(SPG)は、SEGおよび他のベースラインと比較して優れた性能を示し、任意長の短期的特徴シーケンスを符号化する有効性を示した。
- MTB-DFE+SPGモデルはドメイン内評価(例:AVEC 2013でPCC 0.770)において優れた性能を示したが、クロスデータセット設定では一般化が限定的であり、NorthWindおよびFreeformセットでは負のPCC値を示した。
- 2段階アプローチは、対応する1段階モデルを常に上回り、短期的および長期的行動の共同モデリングが予測のロバストネスを向上させることを確認した。
- フレームワークのモジュラー設計により、さまざまな短期的および長期的モデリングコンponentsとの統合が可能であり、将来的な応用への高い拡張性を示唆した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。