[论文解读] SleepPriorCL: Contrastive Representation Learning with Prior Knowledge-based Positive Mining and Adaptive Temperature for Sleep Staging
该论文提出 SleepPriorCL,一种用于睡眠分期的自监督对比学习方法,通过利用先验领域知识挖掘语义上相似的正样本,并引入自适应温度机制以提升表征学习效果。该方法在有限标注数据下实现了最先进性能,优于现有的自监督和有监督基线模型。
The objective of this paper is to learn semantic representations for sleep stage classification from raw physiological time series. Although supervised methods have gained remarkable performance, they are limited in clinical situations due to the requirement of fully labeled data. Self-supervised learning (SSL) based on contrasting semantically similar (positive) and dissimilar (negative) pairs of samples have achieved promising success. However, existing SSL methods suffer the problem that many semantically similar positives are still uncovered and even treated as negatives. In this paper, we propose a novel SSL approach named SleepPriorCL to alleviate the above problem. Advances of our approach over existing SSL methods are two-fold: 1) by incorporating prior domain knowledge into the training regime of SSL, more semantically similar positives are discovered without accessing ground-truth labels; 2) via investigating the influence of the temperature in contrastive loss, an adaptive temperature mechanism for each sample according to prior domain knowledge is further proposed, leading to better performance. Extensive experiments demonstrate that our method achieves state-of-the-art performance and consistently outperforms baselines.
研究动机与目标
- 解决自监督对比学习在睡眠分期中因随机或启发式负样本采样而导致大量语义上相似的正样本被遗漏的采样偏差问题。
- 在不依赖真实标签的前提下,减少因引入虚假正样本导致的性能下降。
- 通过将专家知识融入正样本挖掘并利用自适应温度动态调整梯度惩罚,提升表征学习效果。
- 仅使用原始脑电信号和极少标注数据,实现高性能的睡眠阶段分类,减轻临床标注负担。
提出的方法
- 提出一种基于先验知识的正样本挖掘策略,根据手工设计的特征(如功率谱密度、差异熵)检索最相似的前 K 个样本,而非依赖数据增强或时间邻近样本。
- 将对比学习构建为每个锚点样本对应多个正样本的形式,其中正样本集由特征相似的样本构成,而非单一增强视图。
- 提出一种自适应温度机制,其中每个样本的温度超参数根据其相似度置信度设定——置信度越高,损失中权重越大。
- 通过基于特征相似度的可学习函数动态调整温度,调节梯度惩罚强度,从而改善模型优化。
- 采用标准对比损失(如 InfoNCE),但对每个样本的温度调度进行修改,以突出可靠正样本并抑制噪声样本。
- 在有限标注数据下的线性评估协议和微调设置中进行评估,验证了方法的鲁棒性与泛化能力。
实验结果
研究问题
- RQ1在不依赖真实标签的前提下,先验领域知识能否提升自监督对比学习中正样本挖掘的效果?
- RQ2与标准数据增强或时间邻近样本策略相比,基于特征相似性的正样本挖掘对表征质量有何影响?
- RQ3基于置信度动态调整梯度惩罚强度的自适应温度机制,是否能通过调整样本间差异性权重来提升模型性能?
- RQ4当仅使用少量标注数据时,使用 SleepPriorCL 预训练的自监督模型在性能上能否达到或超越有监督基线?
- RQ5该方法对超参数(如检索正样本数 K 和温度边界 τ_min、τ_max)的敏感性如何?
主要发现
- SleepPriorCL 在三个基准数据集上均达到最先进性能:Sleep-EDF39(准确率 76.44±0.83%,F1 值 65.56±1.32%)、Sleep-EDF153(准确率 78.11±0.43%,F1 值 63.60±0.80%)、MASS-SS3(准确率 80.40±0.26%,F1 值 70.60±0.75%)。
- 该方法显著优于 SimCLR、DCL、CPC、TNC 和 T-Loss 等基线自监督方法,证明了基于先验知识的正样本挖掘的有效性。
- 仅使用 1% 的标注数据时,预训练的 SleepPriorCL 编码器在准确率上已超过在相同小规模标注集上训练的有监督模型,凸显其数据效率优势。
- 消融实验证实,基于先验知识的挖掘与自适应温度机制均对性能提升有贡献,完整方法(Basic+Feature+Adaptive)表现最佳。
- 敏感性分析表明,性能在 K 值范围(0.1 ≤ R ≤ 0.4)和温度边界内保持稳定,表明对超参数选择具有鲁棒性。
- 自适应温度机制在所有设置下均持续优于固定温度基线,尤其在结合知识挖掘时表现更优,证实其在缓解虚假正样本影响方面的重要作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。