Skip to main content
QUICK REVIEW

[논문 리뷰] CALDA: Improving Multi-Source Time Series Domain Adaptation with Contrastive Adversarial Learning

Garrett Wilson, Janardhan Rao Doppa|arXiv (Cornell University)|2021. 09. 30.
Domain Adaptation and Few-Shot Learning인용 수 7
한 줄 요약

CALDA는 데이터 증강 또는 가짜 레이블링에 의존하지 않고, 대비 학습과 적대적 훈련을 유기적으로 융합하여 다중 소스 시계열 도메인 적응을 향상시키는 새로운 프레임워크를 제안한다. 이는 교차 소스 레이블 정보와 약한 지도 학습을 활용하여 실제 및 합성 시계열 데이터셋에서 최신 기술 수준의 성능을 달성하며, 노이즈가 있는 레이블 조건에서도 유연하게 작동한다.

ABSTRACT

Unsupervised domain adaptation (UDA) provides a strategy for improving machine learning performance in data-rich (target) domains where ground truth labels are inaccessible but can be found in related (source) domains. In cases where meta-domain information such as label distributions is available, weak supervision can further boost performance. We propose a novel framework, CALDA, to tackle these two problems. CALDA synergistically combines the principles of contrastive learning and adversarial learning to robustly support multi-source UDA (MS-UDA) for time series data. Similar to prior methods, CALDA utilizes adversarial learning to align source and target feature representations. Unlike prior approaches, CALDA additionally leverages cross-source label information across domains. CALDA pulls examples with the same label close to each other, while pushing apart examples with different labels, reshaping the space through contrastive learning. Unlike prior contrastive adaptation methods, CALDA requires neither data augmentation nor pseudo labeling, which may be more challenging for time series. We empirically validate our proposed approach. Based on results from human activity recognition, electromyography, and synthetic datasets, we find utilizing cross-source information improves performance over prior time series and contrastive methods. Weak supervision further improves performance, even in the presence of noise, allowing CALDA to offer generalizable strategies for MS-UDA. Code is available at: https://github.com/floft/calda

연구 동기 및 목표

  • 타겟 도메인에서는 레이블이 제공되지 않지만 여러 소스 도메인에서는 레이블이 존재하는 시계열 데이터에서의 비지도 도메인 적응 문제를 해결한다.
  • 소스 도메인 간 레이블 정보를 활용하여 도메인 간 특징 표현을 더 잘 정렬함으로써 전이 성능을 향상시킨다.
  • 시간적 구조로 인해 문제가 되기 쉬운 데이터 증강 또는 가짜 레이블링에 의존하지 않는 방법을 개발한다.
  • 타겟 도메인의 클래스 분포를 통해 약한 지도 학습을 통합하여 성능을 추가로 향상시키며, 특히 노이즈가 많은 조건에서도 유연성을 확보한다.
  • 적대적 훈련과 비라벨 타겟 도메인 데이터가 최적의 도메인 적응 성능을 달성하는 데 필수적임을 입증한다.

제안 방법

  • 최소-최대 게임을 통해 도메인 분류기와 특징 추출기를 대립시켜 도메인 불변 특징 표현을 학습하는 다중 소스 도메인 적대적 훈련을 적용한다.
  • 동일한 레이블을 가진 샘플의 특징 표현을 가까이 모으고, 다른 레이블을 가진 샘플의 표현을 멀리 떼는 방식으로, 교차 소스 쌍을 사용해 소스 도메인 간 대비 학습을 수행한다.
  • 대비 학습을 설계할 때 세 가지 핵심 결정을 내린다: (1) 도메인 간 레이블 일관성을 활용하기 위해 교차 소스 쌍을 사용한다, (2) 성능 향상이 이루어질 경우에만 타겟 데이터를 대비 학습에 포함시킨다, (3) 도메인 복잡도에 따라 어려운 예제를 우선순위로 한다.
  • 타겟 도메인의 클래스 분포를 사전 지식으로 통합하여 학습 과정을 이끌고, 레이블 노이즈에 대한 강건성을 향상시킨다.
  • 데이터 증강이나 가짜 레이블링에 의존하지 않고, 적대적, 대비적, 분류 목적을 통합한 공동 손실을 통해 모델을 엔드 투 엔드로 훈련한다.
  • 특징 추출기와 작업 분류기, 도메인 식별기를 사용하며, 도메인 이동을 최소화하고 타겟 정확도를 최대화하도록 공동 최적화한다.

실험 결과

연구 질문

  • RQ1도메인 불변 특징 학습 외에 교차 소스 레이블 정보가 다중 소스 시계열 도메인 적응에 성능 향상을 가져올 수 있는가?
  • RQ2데이터 증강이나 가짜 레이블링 없이 대비 학습이 시계열 도메인 적응에서 성능 향상을 이끌 수 있는가?
  • RQ3비라벨 타겟 도메인 데이터의 포함 여부가 시계열 도메인 적응 모델의 성능에 어떤 영향을 미치는가?
  • RQ4타겟 클래스 분포를 통한 약한 지도 학습이 다중 소스 도메인 적응에서 레이블 노이즈에 대한 강건성을 얼마나 향상시킬 수 있는가?
  • RQ5대비 학습에서 어려운 예제를 선택하거나 내부 소스와 교차 소스 쌍을 혼합하여 사용할 경우 시계열 분야에서 성능 향상이 이루어지는가?

주요 결과

  • 실제 시계열 데이터셋에서 CALDA는 약한 지도 학습을 사용할 경우 평균 정확도 73.9% ± 5.8을 기록하며 기존 방법들을 압도적으로 뛰어넘었고, 약한 지도 학습 없이도 73.1% ± 6.1의 높은 성능을 유지했다.
  • 합성 데이터셋에서는 약한 지도 학습을 사용할 경우 74.5% ± 8.7의 정확도를 기록했고, 그렇지 않을 경우 71.4% ± 11.0으로, 다양한 데이터 유형에서 일관된 성능 향상을 입증했다.
  • 비라벨 타겟 도메인 데이터의 포함이 성능 향상에 유의미하게 기여했으며(p < 0.01), 도메인 적응에서의 핵심적 역할을 확인했다.
  • CALDA는 약한 지도 학습에서 레이블 비율 노이즈에 대해 강건성을 유지하며 높은 성능을 유지했다.
  • 내부 소스나 무작위 쌍 대비 교차 소스 쌍을 사용한 대비 학습이 성능 향상에 기여했으며, 이는 이종 도메인 간 레이블 일관성의 중요성을 입증한다.
  • 도메인 일반화 기반 방법(CALDG-Any,R 등)이 CoDATS-DG 및 기타 도메인 일반화 방법보다 뛰어난 성능을 보였으며, 이는 CALDA의 설계가 표준 도메인 적응을 넘어선 일반화 능력을 지닌다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.