Skip to main content
QUICK REVIEW

[论文解读] On the importance of normative data in speech-based assessment

Zeinab Noorian, Chloé Pou-Prom|arXiv (Cornell University)|Nov 30, 2017
Natural Language Processing Techniques参考文献 12被引用 22
一句话总结

本文通过整合威斯康星纵向研究(WLS)和Talk2Me(T2M)的规范数据,并采用ADASYN对少数类进行过采样,提升了稀疏阿尔茨海默病(AD)语音数据集的性能。数据融合显著提高了在DementiaBank数据集上对AD与对照组的二分类性能,采用梯度提升模型实现了91.68%的SOTA宏F1分数,优于仅使用患者数据训练的模型。

ABSTRACT

Data sets for identifying Alzheimer's disease (AD) are often relatively sparse, which limits their ability to train generalizable models. Here, we augment such a data set, DementiaBank, with each of two normative data sets, the Wisconsin Longitudinal Study and Talk2Me, each of which employs a speech-based picture-description assessment. Through minority class oversampling with ADASYN, we outperform state-of-the-art results in binary classification of people with and without AD in DementiaBank. This work highlights the effectiveness of combining sparse and difficult-to-acquire patient data with relatively large and easily accessible normative datasets.

研究动机与目标

  • 为解决阿尔茨海默病(AD)研究中语言评估相关稀疏且不平衡的语音数据集挑战。
  • 探究将DementiaBank的患者数据与大规模规范语音数据结合是否能提升分类性能。
  • 评估来自不同来源(WLS和Talk2Me)的规范数据对模型泛化能力与准确率的影响。
  • 评估基于ADASYN的过采样在缓解低资源AD数据集中类别不平衡问题方面的有效性。
  • 确定规范数据是否在二分类AD与对照组任务中优于仅使用患者数据的模型性能。

提出的方法

  • 将DementiaBank数据集与来自威斯康星纵向研究(WLS)和Talk2Me(T2M)的规范语音数据进行融合,两者均采用“曲奇盗窃”图片描述任务。
  • 采用基于Kaldi的自动语音识别(ASR)对T2M和WLS的规范语音数据进行转录,实现约12.5%的词错误率。
  • 从所有数据集中提取567个语言学、声学与语义特征,包括语法复杂度、词汇多样性与语音特征。
  • 采用ADASYN对DementiaBank数据集中的少数类进行过采样,以缓解类别不平衡问题。
  • 在原始数据集与增强数据集上训练并评估多种模型——随机森林、梯度提升、支持向量机(SVM)与深度神经网络(DNN)。
  • 使用宏F1与微F1分数作为评估指标,并通过Kruskal-Wallis与ANOVA检验进行显著性分析。

实验结果

研究问题

  • RQ1将WLS与Talk2Me的规范语音数据整合是否能提升机器学习模型在语音中识别阿尔茨海默病的性能?
  • RQ2在低资源AD数据集中,基于ADASYN的过采样与规范数据结合时,对分类性能有何影响?
  • RQ3尽管两者均为规范数据集,为何WLS在提升分类准确率方面优于T2M?
  • RQ4与仅基于患者数据提取的特征相比,规范数据中的语言学特征在区分能力上存在多大差异?
  • RQ5模型架构与任务复杂度(二分类与多分类)如何影响规范数据融合的有效性?

主要发现

  • 将WLS规范数据与DementiaBank融合,在二分类AD与对照组任务中,采用梯度提升模型实现了91.68%的SOTA宏F1分数。
  • 与仅使用DementiaBank相比,加入WLS数据使宏F1分数提升了超过12个百分点(79.49% → 91.68%)。
  • ADASYN过采样进一步将最佳宏F1分数提升至91.68%(梯度提升模型),表明其在缓解类别不平衡问题上的有效性。
  • WLS在性能提升方面优于T2M,可能归因于其更接近的人口统计学特征(尤其是年龄)以及对“曲奇盗窃”任务更一致的使用。
  • 在先前仅基于患者数据的研究中具有显著意义的词汇特征,在引入规范数据后其重要性下降,表明规范背景会改变特征的相关性。
  • 增强数据集上的微F1分数较高(例如,GB在DB+WLS+过采样数据集上为95.56%),但宏F1分数因类别不平衡问题更具可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。