[论文解读] Supervised Speech Representation Learning for Parkinson's Disease Classification
本文提出了一种基于对抗训练以抑制说话人身份信息、并联合训练帕金森病(PD)分类器以增强判别能力的监督语音表征学习方法。在西班牙语语音数据库上的实验表明,说话人不变且具有PD判别性的表征优于无监督基线方法,在准确率和AUC方面表现更优,同时显著降低了说话人身份识别性能,证实了所学习特征中说话人偏差的减少。
Recently proposed automatic pathological speech classification techniques use unsupervised auto-encoders to obtain a high-level abstract representation of speech. Since these representations are learned based on reconstructing the input, there is no guarantee that they are robust to pathology-unrelated cues such as speaker identity information. Further, these representations are not necessarily discriminative for pathology detection. In this paper, we exploit supervised auto-encoders to extract robust and discriminative speech representations for Parkinson's disease classification. To reduce the influence of speaker variabilities unrelated to pathology, we propose to obtain speaker identity-invariant representations by adversarial training of an auto-encoder and a speaker identification task. To obtain a discriminative representation, we propose to jointly train an auto-encoder and a pathological speech classifier. Experimental results on a Spanish database show that the proposed supervised representation learning methods yield more robust and discriminative representations for automatically classifying Parkinson's disease speech, outperforming the baseline unsupervised representation learning system.
研究动机与目标
- 为解决无监督自编码器表征在PD分类中的局限性,即可能保留说话人身份线索且缺乏病理判别性。
- 开发一种表征学习框架,通过对抗训练自编码器并引入说话人识别任务,生成鲁棒的、说话人不变的特征。
- 通过将自编码器与病理语音分类器联合训练,提升表征在PD检测中的判别能力。
- 在真实世界西班牙PD语音数据库上评估这些监督方法的有效性,并与无监督基线进行比较。
- 探究抑制与病理无关的线索(如说话人身份)是否能提升PD分类中的泛化能力和性能。
提出的方法
- 使用重建损失训练自编码器以保留输入语音谱图,形成瓶颈表征。
- 通过联合最小化自编码器重建损失和说话人识别(ID)损失,应用对抗训练策略,仅使用正常神经发育者进行ID任务,以抑制非病理相关的说话人变异性。
- 在瓶颈表征上使用二元交叉熵损失,与自编码器并行训练PD分类器,促使模型学习对PD与正常语音具有判别性的特征。
- 通过融合说话人不变性和PD判别性训练目标,进一步增强表征,结合两种监督信号。
- 所有模型均使用随机梯度下降(SGD)和标准优化设置进行训练。
- 通过PD分类准确率和AUC评估所学习表征的性能,同时使用说话人ID性能作为衡量说话人身份线索抑制程度的代理指标。
实验结果
研究问题
- RQ1通过在自编码器上联合训练说话人ID任务,能否有效抑制语音表征中的说话人身份信息,以用于PD分类?
- RQ2将自编码器与PD分类器联合训练,是否能提升所学习表征在病理语音检测中的判别性?
- RQ3所提出的监督表征学习方法在PD分类性能上与无监督自编码器基线相比如何?
- RQ4所提出的方法在多大程度上减少了所学习表征中与病理无关的线索(如说话人身份)的存在?
- RQ5融合说话人不变性和PD判别性训练目标是否能产生优于单一方法的更优表征?
主要发现
- 所提出的对抗性说话人不变训练将说话人ID准确率降低至2.31±0.27%,AUC降低至0.54±0.01,证实了说话人身份线索的有效抑制。
- PD判别性训练将说话人ID准确率降低至18.15±14.27%,AUC降低至0.76±0.08,表明与病理相关的特征本身具有抑制说话人身份信息的能力。
- 融合两种辅助任务的表征在PD分类准确率上达到最高,优于单独方法和无监督基线。
- 无监督基线表征的说话人ID准确率为34.71±11.94%,AUC为0.90±0.06,表明其包含强烈的说话人身份信息,这会损害PD分类中的泛化能力。
- 对抗性说话人不变表征在PD分类中表现最佳,其准确率和AUC均高于融合表征,表明该方法的超参数调优达到最优。
- 总体而言,所提出的监督表征学习方法在PD分类中显著优于无监督基线,证明了利用病理特异性与鲁棒性导向的辅助任务指导表征学习的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。