[論文レビュー] Depression Detection and Analysis using Large Language Models on Textual and Audio-Visual Modalities
本論文は、E-DAICデータセットからのテキスト、音声、視覚的データを用いた大規模言語モデル(LLM)を用いたマルチモーダルなうつ病検出フレームワークを提案する。GPT-4を用いることで回帰ではRMSEが3.98、分類では71.43%の正確性を達成し、PHQ-8の重症度予測およびうつ病分類において、LLMがテキストモダリティにおいて優位であることを示している。
Depression has proven to be a significant public health issue, profoundly affecting the psychological well-being of individuals. If it remains undiagnosed, depression can lead to severe health issues, which can manifest physically and even lead to suicide. Generally, Diagnosing depression or any other mental disorder involves conducting semi-structured interviews alongside supplementary questionnaires, including variants of the Patient Health Questionnaire (PHQ) by Clinicians and mental health professionals. This approach places significant reliance on the experience and judgment of trained physicians, making the diagnosis susceptible to personal biases. Given that the underlying mechanisms causing depression are still being actively researched, physicians often face challenges in diagnosing and treating the condition, particularly in its early stages of clinical presentation. Recently, significant strides have been made in Artificial neural computing to solve problems involving text, image, and speech in various domains. Our analysis has aimed to leverage these state-of-the-art (SOTA) models in our experiments to achieve optimal outcomes leveraging multiple modalities. The experiments were performed on the Extended Distress Analysis Interview Corpus Wizard of Oz dataset (E-DAIC) corpus presented in the Audio/Visual Emotion Challenge (AVEC) 2019 Challenge. The proposed solutions demonstrate better results achieved by Proprietary and Open-source Large Language Models (LLMs), which achieved a Root Mean Square Error (RMSE) score of 3.98 on Textual Modality, beating the AVEC 2019 challenge baseline results and current SOTA regression analysis architectures. Additionally, the proposed solution achieved an accuracy of 71.43% in the classification task. The paper also includes a novel audio-visual multi-modal network that predicts PHQ-8 scores with an RMSE of 6.51.
研究の動機と目的
- テキスト、音声、視覚的データに大規模言語モデル(LLM)を活用したマルチモーダルなうつ病検出システムの開発を目的とする。
- PHQ-8スコア予測およびうつ病重症度分析における、既存の最先端(SOTA)回帰および分類モデルを上回ることを目的とする。
- GPT-4、GPT-3.5、LLaMA 3 8Bを含む、特許取得済みおよびオープンソースのLLMが、臨床的うつ病検出タスクにおいてどのように性能を発揮するかを評価することを目的とする。
- 精神保健AI分野におけるデータ不足およびプライバシー懸念に対処するため、E-DAICデータセットの限界を特定し、解決策を提案することを目的とする。
- 臨床的メンタルヘルス応用における回帰および分類タスクにおいて、LLMを用いたフェイシングプロンプティングの実現可能性を検討することを目的とする。
提案手法
- LLMへの入力として、音声をOpenAI Whisperを用いて文字起こしし、テキストトランスクリプトを抽出する。
- GPT-4、GPT-3.5、LLaMA 3 8Bを用いたフェイシングプロンプティングにより、テキストデータからのPHQ-8スコア予測およびうつ病状態の分類を実施する。
- WhisperとBiLSTMを組み合わせた新規な音声・視覚マルチモーダルネットワークを設計し、音声および視覚的キューからPHQ-8スコアを予測する。
- 臨床的インタビューのトランスクリプトにおける微調整されたテキスト表現学習に、RoBERTaおよびDepRoBERTaを用いる。
- PHQ-8スコア予測および二値分類(うつ病あり vs. なし)に特化した損失関数を用いた回帰および分類ヘッドを適用する。
- テストおよび検証セットにおいて、RMSE、MAE、CCC、正確性、F1スコア、適合率、再現率などの指標を用いて、モデルの性能をE-DAICデータセット上で評価する。
実験結果
リサーチクエスチョン
- RQ1大規模言語モデル(LLM)は、テキストデータを用いた回帰ベースのPHQ-8スコア予測において、既存のSOTAアーキテクチャを上回ることができるか?
- RQ2フェイシングプロンプティングを用いたLLMは、テキストトランスクリプトからのうつ病重症度分類において、どの程度効果的か?
- RQ3LLMを用いた音声および視覚的信号のマルチモーダル統合は、単一モダリティアプローチを上回るPHQ-8スコア予測を実現できるか?
- RQ4E-DAICデータセットには、サンプルサイズおよびプライバシーの観点でどのような限界があり、今後の研究でどのように対処できるか?
- RQ5特許取得済みLLM(例:GPT-4)とオープンソースモデル(例:LLaMA 3 8B)は、臨床的うつ病検出タスクにおいて、どのように比較されるか?
主な発見
- GPT-4は、テストセットでRMSE 3.975を達成し、AVEC 2019のベースラインおよび現在のSOTAモデルを上回る回帰性能を示した。
- 提案された音声・視覚マルチモーダルネットワークは、PHQ-8スコア予測においてRMSE 6.51を達成し、競合ベースラインを上回った。
- GPT-4は、71.43%の正確性と重み付きF1スコア71.44%を達成し、フェイシングプロンプティングにおける優れた性能を示した。
- LLaMA 3 8B Instructは、分類で73.21%の正確性を達成し、GPT-3.5(58.93%)を上回り、オープンソースLLMがメンタルヘルス応用分野において強い可能性を示した。
- テキストモダリティは、LLMによって強化された結果、音声および視覚モダリティを上回り、うつ病検出において言語的手がかりの優位性を示した。
- GPT-4はCCCスコア0.781を達成し、他のモデルを著しく上回り、PHQ-8予測における一致相関係数の新しいSOTAを確立した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。