[论文解读] Listen2YourHeart: A Self-Supervised Approach for Detecting Murmur in Heart-Beat Sounds
该论文提出了一种自监督对比学习方法 Listen2YourHeart,用于在 PhysioNet 2022 挑战赛的音频数据上检测心音图(PCG)信号中的心杂音。通过在 2022 年和 2016 年数据集的增强 PCG 窗口上使用多种增强手段进行对比自监督预训练(contrastive SSL),该方法在心杂音检测任务中取得了 0.737 的加权准确率(排名第 13 位),在临床结局预测任务中取得了 11,946 的成本得分(排名第 7 位),优于完全监督的基线模型。
Heart murmurs are abnormal sounds present in heartbeats, caused by turbulent blood flow through the heart. The PhysioNet 2022 challenge targets automatic detection of murmur from audio recordings of the heart and automatic detection of normal vs. abnormal clinical outcome. The recordings are captured from multiple locations around the heart. Our participation investigates the effectiveness of selfsupervised learning for murmur detection. We train the layers of a backbone CNN in a self-supervised way with data from both this year's and the 2016 challenge. We use two different augmentations on each training sample, and normalized temperature-scaled cross-entropy loss. We experiment with different augmentations to learn effective phonocardiogram representations. To build the final detectors we train two classification heads, one for each challenge task. We present evaluation results for all combinations of the available augmentations, and for our multipleaugmentation approach. Our team's, Listen2YourHeart, SSL murmur detection classifier received a weighted accuracy score of 0.737 (ranked 13th out of 40 teams) and an outcome identification challenge cost score of 11946 (ranked 7th out of 39 teams) on the hidden test set.
研究动机与目标
- 开发一种自监督学习框架,以从有限且弱标注的 PCG 数据中学习鲁棒表征。
- 评估不同数据增强手段在提升下游 PCG 分类性能方面的有效性。
- 在低资源临床音频场景中提升模型泛化能力,并减少对完全监督微调的依赖。
- 通过在多样化增强数据上进行预训练,解决临床深度神经网络应用中的模型漂移与泛化能力差的问题。
- 在 PhysioNet 2022 挑战赛中实现心杂音检测与临床结局分类的最先进性能。
提出的方法
- 该方法采用基于 CNN 主干网络的对比自监督学习框架,使用 2022 年和 2016 年 PhysioNet 数据集中的 5 秒 PCG 窗口进行预训练。
- 每个输入窗口通过不同的变换方式被增强两次,包括高通/低通滤波(250–750 Hz)、倒放、反转、随机缩放(0.5–2.0)、噪声注入(均匀分布,范围 0.002–0.02),以及通过 2 倍上采样并结合对称裁剪的方式。
- 模型通过最小化正样本对(同一信号的增强)与负样本对(来自不同信号的增强)之间的归一化温度缩放交叉熵损失来优化,温度参数设为 0.1。
- 最终分类头通过在冻结的主干网络特征表示上使用线性投影头进行训练,并在下游任务上进行微调。
- 训练使用 LARS 优化器,前 5 个 epoch 采用线性热身,学习率上升至峰值 0.1,随后采用余弦衰减策略,若连续 5 个 epoch 无性能提升则提前停止。
- 通过聚合窗口级预测结果,获得记录级预测,再进一步聚合为患者级标签。
实验结果
研究问题
- RQ1当标注数据稀缺时,自监督对比学习能否提升心音图信号的表征学习能力?
- RQ2哪些数据增强组合能为 PCG 分类生成最具信息量且泛化能力最强的表征?
- RQ3在包含 2016 年挑战赛数据的更大、更异质的数据集上进行预训练,是否能提升在 2022 年挑战赛中的下游性能?
- RQ4与完全监督基线相比,自监督模型在隐藏测试集上的加权准确率与成本得分表现如何?
- RQ5模型能否在未见数据上实现有效泛化,这是否可通过挑战赛隐藏测试集上的表现来验证?
主要发现
- 自监督模型在心杂音检测任务中取得了 0.737 的加权准确率,在 PhysioNet 2022 挑战赛中排名第 13 位(共 40 支队伍)。
- 在临床结局预测任务中,模型取得了 11,946 的成本得分,排名第 7 位(共 39 支队伍),优于完全监督基线。
- 表现最佳的增强组合为:第一视角使用 250 Hz 高通滤波结合倒放与反转;第二视角使用均匀噪声(范围 0.02)结合上采样。
- 在心杂音检测任务中,该模型优于完全监督基线(0.700 vs. 0.558 的加权准确率);在结局预测任务中也表现更优(0.764 vs. 0.750 的加权准确率)。
- 使用多种增强手段,尤其是多样化组合(如反转+倒放,或低通滤波+噪声),可获得 0.84 的准确率,高于使用相同增强手段的 0.85,表明增强多样性有助于提升表征质量。
- 模型展现出强大的泛化能力,验证集准确率为 0.671,测试集准确率为 0.737,表明其对未见数据具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。