Skip to main content
QUICK REVIEW

[论文解读] CALDA: Improving Multi-Source Time Series Domain Adaptation with Contrastive Adversarial Learning

Garrett Wilson, Janardhan Rao Doppa|arXiv (Cornell University)|Sep 30, 2021
Domain Adaptation and Few-Shot Learning被引用 7
一句话总结

CALDA 提出了一种新颖的多源时间序列域自适应框架,通过协同结合对比学习与对抗训练,提升模型迁移性能,且无需依赖数据增强或伪标签。它利用跨源标签信息与弱监督,在真实世界及合成时间序列数据集上实现最先进性能,即使在标签噪声条件下亦表现优异。

ABSTRACT

Unsupervised domain adaptation (UDA) provides a strategy for improving machine learning performance in data-rich (target) domains where ground truth labels are inaccessible but can be found in related (source) domains. In cases where meta-domain information such as label distributions is available, weak supervision can further boost performance. We propose a novel framework, CALDA, to tackle these two problems. CALDA synergistically combines the principles of contrastive learning and adversarial learning to robustly support multi-source UDA (MS-UDA) for time series data. Similar to prior methods, CALDA utilizes adversarial learning to align source and target feature representations. Unlike prior approaches, CALDA additionally leverages cross-source label information across domains. CALDA pulls examples with the same label close to each other, while pushing apart examples with different labels, reshaping the space through contrastive learning. Unlike prior contrastive adaptation methods, CALDA requires neither data augmentation nor pseudo labeling, which may be more challenging for time series. We empirically validate our proposed approach. Based on results from human activity recognition, electromyography, and synthetic datasets, we find utilizing cross-source information improves performance over prior time series and contrastive methods. Weak supervision further improves performance, even in the presence of noise, allowing CALDA to offer generalizable strategies for MS-UDA. Code is available at: https://github.com/floft/calda

研究动机与目标

  • 解决时间序列数据中无监督域自适应的挑战,即目标域缺乏标注数据但存在多个源域的标注数据。
  • 通过利用跨源标签信息,更好地对齐跨域的特征表示,以提升迁移性能。
  • 开发一种不依赖数据增强或伪标签的方法——这两者在时间序列中常因时间结构而存在问题。
  • 通过目标域类别分布引入弱监督,进一步提升性能,尤其在噪声条件下。
  • 证明对抗训练与无标签目标域数据对实现最优域自适应性能至关重要。

提出的方法

  • 采用多源域对抗训练,通过在最小最大博弈中让域分类器与特征提取器相互对抗,学习域不变的特征表示。
  • 在源域之间应用对比学习,通过跨源样本对拉近相同标签样本的特征表示,同时推远不同标签样本的表示。
  • 设计对比学习时做出三项关键决策:(1) 使用跨源对以利用域间标签的一致性,(2) 仅在性能提升时将目标数据纳入对比学习,(3) 根据域复杂度优先选择困难样本。
  • 通过引入目标域类别分布作为先验,整合弱监督以指导学习过程并提升对标签噪声的鲁棒性。
  • 端到端训练模型,采用联合损失函数结合对抗损失、对比损失与分类损失,完全不依赖数据增强或伪标签。
  • 采用特征提取器后接任务分类器与域判别器,联合优化以最小化域偏移并最大化目标准确率。

实验结果

研究问题

  • RQ1跨源标签信息是否能超越仅依赖域不变特征学习的性能上限,从而提升多源时间序列域自适应?
  • RQ2在无数据增强或伪标签的情况下,对比学习是否能在时间序列域自适应中带来性能提升?
  • RQ3无标签目标域数据的引入在时间序列域自适应模型中如何影响性能?
  • RQ4通过目标类别分布实现的弱监督在多源域自适应中能在多大程度上提升对标签噪声的鲁棒性?
  • RQ5在对比学习中选择困难样本或混合使用域内与跨源对是否对时间序列具有优势?

主要发现

  • 在真实世界时间序列数据集上,CALDA 的性能优于先前方法,弱监督下平均准确率达 73.9% ± 5.8,无弱监督下为 73.1% ± 6.1,显著优于基线方法。
  • 在合成数据集上,CALDA 在弱监督下达到 74.5% ± 8.7 的准确率,无弱监督下为 71.4% ± 11.0,表明在各类数据中均保持一致的性能提升。
  • 引入无标签目标域数据显著提升了性能(p < 0.01),证实其在域自适应中的关键作用。
  • CALDA 对弱监督中的标签比例噪声表现出鲁棒性,在目标类别分布存在噪声时仍保持高性能。
  • 使用跨源对的对比学习优于域内对或随机配对,验证了跨域标签一致性的关键作用。
  • 域泛化基线方法(如 CALDG-Any,R)优于 CoDATS-DG 及其他域泛化方法,表明 CALDA 的设计具有超越标准域自适应的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。