Skip to main content
QUICK REVIEW

[論文レビュー] Predicting Mood Disorder Symptoms with Remotely Collected Videos Using an Interpretable Multimodal Dynamic Attention Fusion Network

Tathagata Banerjee, Matthew Kollada|arXiv (Cornell University)|Sep 7, 2021
Digital Mental Health Interventions参考文献 12被引用数 5
ひとこと要約

本稿では、遠隔で収集されたスマートフォン動画の音声、映像、テキストを用いて、うつ病、不安、快楽喪失の症状を予測する、解釈可能なマルチモーダル動的アテンション融合ネットワークを提案する。CNNを用いて時間的埋め込みを学習し、トランスフォーマー・エンコーダーでそれらを統合することで、静的埋め込み手法を上回る性能を達成し、SHAPを用いた解釈可能性により重要なデジタルマーカーを同定した。全特徴量の25%のみで安定した性能を示した。

ABSTRACT

We developed a novel, interpretable multimodal classification method to identify symptoms of mood disorders viz. depression, anxiety and anhedonia using audio, video and text collected from a smartphone application. We used CNN-based unimodal encoders to learn dynamic embeddings for each modality and then combined these through a transformer encoder. We applied these methods to a novel dataset - collected by a smartphone application - on 3002 participants across up to three recording sessions. Our method demonstrated better multimodal classification performance compared to existing methods that employed static embeddings. Lastly, we used SHapley Additive exPlanations (SHAP) to prioritize important features in our model that could serve as potential digital markers.

研究の動機と目的

  • スマートフォンから遠隔で収集されたマルチメディアデータを用いて、スケーラブルで解釈可能な方法で気分障害の症状を検出すること。
  • 従来の研究の限界を克服するため、静的表現ではなく、音声、映像、テキストの時間的ダイナミクスを動的埋め込みでモデル化すること。
  • 時間経過に伴うクロスマodalな依存関係を捉えるトランスフォーマーに基づくアーキテクチャを活用して、マルチモーダル統合を改善すること。
  • SHapley Additive exPlanations (SHAP) を用いて、モデルの解釈性と検証を高め、臨床的に意味のあるデジタルマーカーを同定すること。
  • 臨床的監視なしに収集された大規模で現実世界のデータセットを用いて、ノイズが多くて変動の大きい遠隔データに対しても耐性を持つ性能を評価すること。

提案手法

  • モデルは、音声、映像、テキストの各モodalに対して、0.1秒解像度の動的時間的埋め込みを抽出するCNNベースのユニモーダルエンコーダーを採用する。
  • 各モダリティの特徴は独立して処理され、時間分解能の高い表現を学習する。これにより、時間的ダイナミクスが保持される。
  • トランスフォーマー・エンコーダーが、マルチモーダル間の動的埋め込みを統合し、時間経過に伴うクロスマodalな依存関係への注目を可能にする。
  • フレームワークは、SHapley Additive exPlanations (SHAP) を用いて特徴の重要度を順位付けし、各症状予測における最も影響力のある入力を同定する。
  • 低品質な録画や不誠実な反応を除外するために、遠隔スマートフォンデータにきめ細やかな品質管理プロトコルを適用した。
  • モデルは、3,002名の参加者からなる新規データセットを用いて訓練および評価された。参加者は最大3回の録画セッションに参加し、症状ラベルとしてPHQ-9、GAD-7、SHAPSが使用された。

実験結果

リサーチクエスチョン

  • RQ1動的埋め込みを用いるマルチモーダル深層学習モデルは、静的埋め込みに依存する従来の手法を上回り、気分障害の症状を予測する能力に優れるか?
  • RQ2SHAPを用いた解釈可能性を活用することで、マルチモーダル精神健康予測におけるモデルの解釈性をどのように向上させられるか?
  • RQ3低監視の遠隔スマートフォンデータから学習したモデルは、データのノイズやばらつきがあっても、高い性能を維持できるか、その程度はどの程度か?
  • RQ4どの具体的な音声、映像、テキスト特徴が、うつ病、不安、快楽喪失の症状を最も予測可能か?
  • RQ5影響力の高い特徴の少ないセットを用いても、近似的に最適なモデル性能を維持できるか? これにより、効率的なデジタルマーカーの同定が可能になるか?

主な発見

  • 提案された動的マルチモーダル統合モデルは、静的埋め込みに依存する従来の最先端手法を上回るF1スコアを達成した。
  • SHAPによって同定された最重要特徴の25%のみで、モデル性能が安定した。PHQ-9では、全特徴量と最小特徴量セットの間でF1スコアに1%の差にとどまった。
  • 各症状スケールの上位10個のSHAP順位特徴には、すべての3つのモダリティからの代表的要素が含まれており、予測にマルチモーダルな寄与があることが示された。
  • 複数の障害に共通する特徴には、テキストのポジティブネス・スコア、感情の価値、および口の動きに関連する顔面筋活動ユニットが含まれ、共通の行動的マーカーを示唆した。
  • 障害固有の特徴も顕在化した。たとえば、PHQ-9では感情的テキスト特徴(例:アーザル、支配性)が、SHAPSでは名詞タグが顕著に現れ、異なる症状プロファイルを強調した。
  • 包括的な品質管理パイプラインのおかげで、ノイズの多い遠隔データに対してもモデルは耐性を示し、現実世界のスマートフォンデータにおいても信頼性の高い性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。