[论文解读] Robustness against the channel effect in pathological voice detection
本文提出了一种使用双向LSTM与领域对抗训练(DAT)的鲁棒病理语音检测系统,以减轻来自不同录音设备的信道效应。通过利用无监督领域自适应,该模型在未标注的智能手机数据上实现了0.9455的PR-AUC——显著优于无自适应时的0.8448,使其成为该任务中首个无监督领域自适应方法。
Many people are suffering from voice disorders, which can adversely affect the quality of their lives. In response, some researchers have proposed algorithms for automatic assessment of these disorders, based on voice signals. However, these signals can be sensitive to the recording devices. Indeed, the channel effect is a pervasive problem in machine learning for healthcare. In this study, we propose a detection system for pathological voice, which is robust against the channel effect. This system is based on a bidirectional LSTM network. To increase the performance robustness against channel mismatch, we integrate domain adversarial training (DAT) to eliminate the differences between the devices. When we train on data recorded on a high-quality microphone and evaluate on smartphone data without labels, our robust detection system increases the PR-AUC from 0.8448 to 0.9455 (and 0.9522 with target sample labels). To the best of our knowledge, this is the first study applying unsupervised domain adaptation to pathological voice detection. Notably, our system does not need target device sample labels, which allows for generalization to many new devices.
研究动机与目标
- 解决由于录音设备不同导致的信道失配在病理语音检测中的挑战。
- 开发一种鲁棒模型,使其在无需目标设备标注数据的情况下仍能跨设备泛化。
- 通过无监督领域自适应提升在低资源、未标注目标设备(如智能手机)上的性能。
- 评估不同预处理方式与网络架构下MFCC与滤波器组的性能表现。
- 证明在消费级移动设备上部署高精度语音病理检测的可行性。
提出的方法
- 系统使用26维MFCC和40维滤波器组作为输入特征,采用32ms的窗长与半窗长帧移,以减少边界效应。
- 双向LSTM(BLSTM)网络将输入特征编码为潜在表示,随后通过全连接层进行病理语音分类。
- 通过梯度反转层(GRL)应用领域对抗训练(DAT),通过最小化领域分类器性能来解耦领域不变特征。
- 模型在高质量麦克风数据(源域)上进行训练,并在未标注的智能手机数据(目标域)上进行测试,从而实现无监督自适应。
- 损失函数结合了用于分类的交叉熵损失与用于领域对齐的对抗损失,实现端到端优化。
- 特征归一化被评估为超参数,最终设置中未归一化的滤波器组表现更优。
实验结果
研究问题
- RQ1无监督领域自适应能否提升在低资源、未标注智能手机数据上的病理语音检测性能?
- RQ2前端特征选择(MFCC与滤波器组)及归一化处理如何影响模型鲁棒性?
- RQ3双向LSTM在建模语音病理检测的序列模式方面是否优于多层感知机(MLP)?
- RQ4领域对抗训练在多大程度上减轻了高质量录音与智能手机录音之间的信道失配影响?
- RQ5该模型能否在无需目标设备标注样本的情况下泛化到新设备?
主要发现
- 所提出的无监督领域自适应系统在未标注的智能手机数据上实现了0.9455的PR-AUC,显著优于无自适应时的0.8448。
- 在拥有目标设备标注数据的情况下,系统PR-AUC达到0.9522,证明了领域对抗训练的有效性。
- 双向LSTM优于MLP,使用归一化MFCC时PR-AUC达到0.9415,而MLP仅为0.9154。
- 未归一化的滤波器组性能优于归一化版本,PR-AUC达0.9478,而归一化MFCC的PR-AUC为0.9415。
- 在高质量麦克风数据上训练的模型无需任何目标设备标注样本即可有效泛化至智能手机录音,证明了对信道效应的强鲁棒性。
- 该方法是首个将无监督领域自适应应用于病理语音检测的工作,实现了在多种移动设备上的部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。