[论文解读] Pretraining Respiratory Sound Representations using Metadata and Contrastive Learning
本文提出了一种监督对比学习框架,结合人口统计学元数据(性别和年龄)与呼吸音数据,以提升异常分类的表征学习效果。通过在多头对比学习设置中同时使用类别标签和元数据进行模型训练,该方法在 ICBHI 和 SPRSound 数据集上实现了最先进性能,相较于交叉熵训练,在敏感性和整体分类准确率方面表现更优,尤其在低数据量和类别不平衡设置下优势明显。
Methods based on supervised learning using annotations in an end-to-end fashion have been the state-of-the-art for classification problems. However, they may be limited in their generalization capability, especially in the low data regime. In this study, we address this issue using supervised contrastive learning combined with available metadata to solve multiple pretext tasks that learn a good representation of data. We apply our approach on respiratory sound classification. This task is suited for this setting as demographic information such as sex and age are correlated with presence of lung diseases, and learning a system that implicitly encode this information may better detect anomalies. Supervised contrastive learning is a paradigm that learns similar representations to samples sharing the same class labels and dissimilar representations to samples with different class labels. The feature extractor learned using this paradigm extract useful features from the data, and we show that it outperforms cross-entropy in classifying respiratory anomalies in two different datasets. We also show that learning representations using only metadata, without class labels, obtains similar performance as using cross entropy with those labels only. In addition, when combining class labels with metadata using multiple supervised contrastive learning, an extension of supervised contrastive learning solving an additional task of grouping patients within the same sex and age group, more informative features are learned. This work suggests the potential of using multiple metadata sources in supervised contrastive settings, in particular in settings with class imbalance and few data. Our code is released at https://github.com/ilyassmoummad/scl_icbhi2017
研究动机与目标
- 为解决监督深度学习在呼吸音分类中因数据稀缺和类别不平衡导致的泛化能力有限的问题。
- 探究在对比学习中将性别和年龄等元数据作为辅助监督信号,是否能够改善表征学习。
- 开发并评估一种多头监督对比学习框架,联合优化诊断类别标签和人口统计学元数据。
- 比较对比学习与交叉熵训练的性能,并评估在对比学习框架中结合元数据与类别标签对模型泛化能力的影响。
- 在标准评估协议下,于两个公开的呼吸音数据集 ICBHI 和 SPRSound 上验证该方法的有效性。
提出的方法
- 该方法采用监督对比学习(SCL)框架,其中正样本对基于共享的类别标签形成,模型被训练以使相似样本在潜在空间中更接近。
- 提出一种多头 SCL 变体(M-SCL),其中一个分支处理诊断类别标签,另一个分支处理元数据(性别和年龄组),从而实现解耦的表征学习。
- 模型在 AudioSet 上进行预训练,并在 ICBHI 和 SPRSound 上进行微调,使用一种对比损失函数,以促进正样本对的聚类和负样本对的分离。
- 元数据被编码为离散组别(如男性/年轻、女性/年长),并独立于类别标签形成正样本对,以生成额外的监督信号。
- 采用混合训练策略,将 SCL 与交叉熵损失结合,以进一步提升下游分类任务的性能。
- 在预训练阶段应用数据增强,以生成同一呼吸音的不同视图,增强模型的鲁棒性。
实验结果
研究问题
- RQ1与标准交叉熵训练相比,使用元数据的监督对比学习是否能提升呼吸音分类的表征学习效果?
- RQ2在对比学习中将元数据作为辅助监督信号,是否能提升泛化能力,特别是在低数据量和类别不平衡设置下?
- RQ3与单头 SCL 或交叉熵训练相比,联合优化类别标签和元数据的多头对比学习(M-SCL)在分类性能上表现如何?
- RQ4仅使用元数据学习的表征(不依赖类别标签)是否能达到与使用类别标签学习的表征相当的性能?
- RQ5在对比学习框架中结合元数据与类别标签,对检测呼吸异常的敏感性和特异性有何影响?
主要发现
- 在 ICBHI 数据集上,所提出的 M-SCL 方法取得了 58.04 ± 0.94 的调和分数,优于最佳交叉熵结果(57.55 ± 0.81),并超过 SimCLR 基线(48.34 ± 0.87)。
- 在 SPRSound 数据集上,M-SCL 取得了 85.27 ± 0.88 的调和分数,优于交叉熵(83.90 ± 0.25)和 SCL(85.29 ± 0.56),且敏感性更高(82.24 ± 2.24 vs. 76.89 ± 0.80)。
- 仅使用元数据进行 SCL(不使用类别标签)在 ICBHI 上取得了 55.29 ± 0.80 的分数,与交叉熵训练结果相当,且显著优于 SimCLR 基线。
- 当同时使用元数据和类别标签时,多头 SCL 框架(M-SCL)优于单头 SCL(55.81 ± 0.88),表明对元数据和类别信息进行解耦学习可提升特征质量。
- 对比学习方法在敏感性方面始终优于交叉熵训练,表明异常呼吸音在潜在空间中聚类效果更好。
- 该方法对类别不平衡具有鲁棒性,M-SCL 在检测罕见异常方面表现尤为突出,尤其当结合元数据时优势更明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。