[论文解读] Utilizing Expert Features for Contrastive Learning of Time-Series Representations
该论文提出ExpCLR,一种对比学习方法,通过用专家特征替代数据增强来学习时间序列表征。通过设计一种新颖的损失函数,强制使专家特征相近的样本在表征上相似,而特征相距较远的样本在表征上相异,ExpCLR在无需依赖数据增强的情况下,在三个真实世界时间序列数据集上实现了无监督和半监督设置下的最先进性能。
We present an approach that incorporates expert knowledge for time-series representation learning. Our method employs expert features to replace the commonly used data transformations in previous contrastive learning approaches. We do this since time-series data frequently stems from the industrial or medical field where expert features are often available from domain experts, while transformations are generally elusive for time-series data. We start by proposing two properties that useful time-series representations should fulfill and show that current representation learning approaches do not ensure these properties. We therefore devise ExpCLR, a novel contrastive learning approach built on an objective that utilizes expert features to encourage both properties for the learned representation. Finally, we demonstrate on three real-world time-series datasets that ExpCLR surpasses several state-of-the-art methods for both unsupervised and semi-supervised representation learning.
研究动机与目标
- 为解决时间序列对比学习中缺乏有效数据变换的问题,特别是在工业和医疗领域中专家特征可用的情况下。
- 定义基于专家特征的有用表征应满足的两个基本属性:相似专家特征应产生接近的表征,而相异专家特征应产生远离的表征。
- 提出一种新颖的对比损失函数,利用连续专家特征来强制实现这些属性,从而实现鲁棒的表征学习。
- 证明ExpCLR在无监督和半监督时间序列表征学习中均超越最先进方法。
- 提供一种通用方法,适用于任何包含专家特征的数据集,包括回归和非时间序列任务。
提出的方法
- 引入表征有用性的两个关键属性:(1) 相似专家特征应产生接近的表征;(2) 相异专家特征应产生远离的表征。
- 提出一种新颖的对比损失函数,利用专家特征之间的二次相似度度量来定义正样本对,替代传统基于数据增强的正样本对。
- 采用温度缩放的对比损失并结合难负样本挖掘,以提升表征质量,灵感来自MoCo和SimCLR,但针对专家特征进行了适配。
- 使用动量编码器和实例判别来稳定训练,类似于SimCLR,但以专家特征作为监督信号,而非数据增强。
- 在无监督和半监督设置下应用该方法,通过在部分标注数据上微调来评估标签效率。
- 采用基于专家特征平方差的相似度度量,确保损失函数可微分,适用于连续标签。
实验结果
研究问题
- RQ1专家特征能否在时间序列对比学习中有效用作监督信号,替代数据变换?
- RQ2通过专家特征学习到的表征是否满足相似特征应接近、相异特征应分离的期望属性?
- RQ3ExpCLR在无监督和半监督时间序列表征学习中的性能与最先进对比学习方法相比如何?
- RQ4当仅使用少量标签时,ExpCLR是否比现有方法具有更好的标签效率?
- RQ5所提出的损失函数能否推广到时间序列以外的其他领域,只要存在专家特征?
主要发现
- 在HAR、SleepEDF和Waveform数据集上,ExpCLR在所有标签比例的无监督和半监督设置中均优于所有对比方法。
- 仅使用20%标注数据时,ExpCLR(半监督)在HAR和SleepEDF数据集上超越所有其他方法,即使后者在100%标签数据上训练。
- 当仅使用5%标注数据时,ExpCLR的性能下降不足3.5%,而监督交叉熵预训练方法在相同条件下性能下降超过17.5%。
- 消融研究显示,二次相似度度量(公式5)优于先前工作中使用的线性相似度和高斯相似度。
- 采用递减温度τ的难负样本挖掘可提升性能,且随着τ增大,方法性能趋近于非难负样本挖掘的基线,验证了理论分析。
- 该方法对超参数选择具有鲁棒性,消融研究显示在不同嵌入维度、批量大小和Δ值下均保持稳定性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。