Skip to main content
QUICK REVIEW

[论文解读] Significance of Speaker Embeddings and Temporal Context for Depression Detection

Sri Harsha Dumpala, Sebastián Rodríguez|arXiv (Cornell University)|Jul 24, 2021
Mental Health via Writing被引用 6
一句话总结

本论文表明,说话人嵌入能显著提升从语音中检测抑郁症的性能,在结合OpenSMILE与COVAREP特征时达到了最先进水平。研究进一步表明,通过考虑更多连续语音段以增加时间上下文,可提升模型性能,表明序列语音模式中包含识别抑郁症的关键线索。

ABSTRACT

Depression detection from speech has attracted a lot of attention in recent years. However, the significance of speaker-specific information in depression detection has not yet been explored. In this work, we analyze the significance of speaker embeddings for the task of depression detection from speech. Experimental results show that the speaker embeddings provide important cues to achieve state-of-the-art performance in depression detection. We also show that combining conventional OpenSMILE and COVAREP features, which carry complementary information, with speaker embeddings further improves the depression detection performance. The significance of temporal context in the training of deep learning models for depression detection is also analyzed in this paper.

研究动机与目标

  • 探究说话人嵌入在提升语音抑郁症检测性能中的重要性。
  • 分析时间上下文(即连续语音段的数量)对深度学习模型在抑郁症检测中性能的影响。
  • 评估说话人嵌入与传统声学特征(如OpenSMILE和COVAREP)之间的互补性。
  • 通过结合说话人嵌入与多模态声学特征,建立语音抑郁症检测的新最先进基线。

提出的方法

  • 使用基于LSTM网络的端到端非文本依赖说话人验证系统(如[30]所述)提取说话人嵌入。
  • 从OpenSMILE和COVAREP中提取声学特征,以表征语音的语调与频谱特性。
  • 使用说话人嵌入与声学特征联合训练深度学习模型(DNN、CNN与LSTM),进行抑郁症与非抑郁症的二分类。
  • 通过输入连续语音段序列(范围为4至16/20段)来建模时间上下文,以捕捉序列动态特性。
  • 使用加权准确率与F1分数对模型性能进行评估,分别针对抑郁症与健康人群。
  • 通过等错误率(EER)评估说话人分类性能,以验证所提取说话人嵌入的判别能力。

实验结果

研究问题

  • RQ1说话人嵌入如何提升基于语音的抑郁症检测模型性能?
  • RQ2将说话人嵌入与传统声学特征(OpenSMILE与COVAREP)结合,对抑郁症检测准确率有何影响?
  • RQ3时间上下文长度(连续语音段数量)如何影响深度学习模型在抑郁症检测中的性能?
  • RQ4说话人嵌入是否能单独实现与最先进方法相当的性能,用于从语音中检测抑郁症?

主要发现

  • 仅使用说话人嵌入的模型在DAIC-WoZ与FORBOW数据集上,均优于仅使用OpenSMILE或COVAREP特征的模型。
  • 将说话人嵌入与OpenSMILE特征结合,在FORBOW数据集上实现了0.76的加权准确率,超越了最先进结果。
  • LSTM与CNN模型的性能随时间上下文增加而提升,在FORBOW数据集上于16段时趋于饱和,在DAIC-WoZ数据集上于20段时趋于饱和。
  • 说话人分类的等错误率(EER)在DAIC-WoZ上为1.29,在FORBOW上为1.69,证实所提取的说话人嵌入有效捕捉了说话人特异性信息。
  • 在所有配置中,LSTM与CNN模型均优于DNN,其中LSTM D在性能上达到最佳或与CNN D相当。
  • 将说话人嵌入与OpenSMILE特征结合带来了显著的性能提升,表明说话人身份与声学特征之间存在互补信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。