[论文解读] The Effect of Heterogeneous Data for Alzheimer's Disease Detection from Speech
本文研究了来自多种认知任务(如图片描述、言语流畅性及对话言语)的异质性语音数据对阿尔茨海默病(AD)检测的影响。通过将单任务AD数据集与来自不同任务的正常人群数据相结合,作者展示了F1分数提高了9%,且在多任务数据上训练的模型表现出更好的泛化能力以及更低的跨任务误差,这是由于在不同认知领域间增强了归纳偏置。
Speech datasets for identifying Alzheimer's disease (AD) are generally restricted to participants performing a single task, e.g. describing an image shown to them. As a result, models trained on linguistic features derived from such datasets may not be generalizable across tasks. Building on prior work demonstrating that same-task data of healthy participants helps improve AD detection on a single-task dataset of pathological speech, we augment an AD-specific dataset consisting of subjects describing a picture with multi-task healthy data. We demonstrate that normative data from multiple speech-based tasks helps improve AD detection by up to 9%. Visualization of decision boundaries reveals that models trained on a combination of structured picture descriptions and unstructured conversational speech have the least out-of-task error and show the most potential to generalize to multiple tasks. We analyze the impact of age of the added samples and if they affect fairness in classification. We also provide explanations for a possible inductive bias effect across tasks using model-agnostic feature anchors. This work highlights the need for heterogeneous datasets for encoding changes in multiple facets of cognition and for developing a task-independent AD detection model.
研究动机与目标
- 为解决基于单任务语音数据(如图片描述任务)训练的阿尔茨海默病(AD)检测模型泛化能力有限的问题。
- 探究将来自多个任务的正常(健康)语音数据纳入是否能提升AD检测性能与模型鲁棒性。
- 评估添加的健康样本中年龄分布对模型公平性与性能的影响。
- 分析多任务数据如何引入特定领域的归纳偏置,从而增强模型在不同基于语音的认知任务中的泛化能力。
- 使用特征锚点(feature anchors)提供与模型无关的解释,以理解跨任务中归纳偏置的影响。
提出的方法
- 作者采用多任务学习框架,将AD专用数据集(Dementia Bank)与健康参与者执行各类任务的正常数据相结合:图片描述(HAPD)、言语流畅性与段落朗读(HAFP),以及对话言语(FP)。
- 从转录文本和音频中提取语言与声学特征(共297个语言特征,183个声学特征),包括句法复杂度、停顿时长、情感规范值及连贯性度量,所有特征均设计为任务无关。
- 在合并的数据集上训练一个黑箱分类器,并使用与模型无关的特征锚点识别在不同数据分布中稳定且高精度的特征谓词,以解释预测结果。
- 通过锚点覆盖率(即特征规则在数据分布中成立的概率)来衡量特征的泛化能力,覆盖率越高,表示归纳偏置越强。
- 性能评估采用F1微分值与宏分值、跨任务误差,以及按年龄组划分的平衡F1分数,以评估公平性与泛化能力。
- 通过将健康样本按15岁为一组进行分组,分析添加健康样本中年龄分布的影响。
实验结果
研究问题
- RQ1将来自多个任务的正常语音数据增强单任务AD语音数据集,是否能提升检测性能?
- RQ2添加的健康样本的年龄分布如何影响模型的公平性与性能?
- RQ3不同语音任务在多大程度上提供特定领域的归纳偏置,从而增强对未见任务的泛化能力?
- RQ4与模型无关的特征锚点能否揭示多任务数据如何提升决策边界稳定性与特征相关性?
- RQ5与单任务基线相比,结合多样化任务的数据是否能降低跨任务误差?
主要发现
- 将来自多个任务(如图片描述、言语流畅性、对话言语)的正常数据添加到AD专用数据集中,使F1分数最高提升9%,且在结合结构化与非结构化任务数据时提升最为显著。
- 在图片描述与对话言语数据组合上训练的模型表现出最低的跨任务误差,表明其在不同语音任务间具有更优的泛化能力。
- 性能提升在多数类(健康)与少数类(AD)中均保持一致,当使用多任务健康数据增强时,F1微分值与宏分值分别提升2%与5%。
- 添加60岁以上年龄组的健康样本带来的性能增益大于年轻年龄组,这可能是由于原始AD数据集中年龄分布本身更偏向老年人群。
- 尽管存在与年龄相关的性能趋势,模型仍保持公平性,参与者年龄低于60岁的平衡F1得分为75.6%,高于60岁的为76.1%。
- 当添加多任务健康数据(HA)时,特征锚点覆盖率提升了40.8%,表明模型在数据分布中学习到了更稳定、更具泛化能力的特征谓词。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。