[논문 리뷰] Contrast and Mix: Temporal Contrastive Video Domain Adaptation with Background Mixing
이 논문은 배경 혼합과 의사 레이블링을 사용하여 적대적 훈련 없이도 도메인 간에 변하지 않는, 구분 가능한 특징을 학습하는 시간적 대비 비디오 도메인 적응 프레임워크인 CoMix를 제안한다. 다속도 뷰 간 유사도를 최대화하고 배경이 혼합된 비디오를 추가 양성 샘플로 도입함으로써 CoMix는 UCF-HMDB 및 Jester 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 소스 전용 기반보다 최대 10.7% 향상된 성능을 기록한다.
Unsupervised domain adaptation which aims to adapt models trained on a labeled source domain to a completely unlabeled target domain has attracted much attention in recent years. While many domain adaptation techniques have been proposed for images, the problem of unsupervised domain adaptation in videos remains largely underexplored. In this paper, we introduce Contrast and Mix (CoMix), a new contrastive learning framework that aims to learn discriminative invariant feature representations for unsupervised video domain adaptation. First, unlike existing methods that rely on adversarial learning for feature alignment, we utilize temporal contrastive learning to bridge the domain gap by maximizing the similarity between encoded representations of an unlabeled video at two different speeds as well as minimizing the similarity between different videos played at different speeds. Second, we propose a novel extension to the temporal contrastive loss by using background mixing that allows additional positives per anchor, thus adapting contrastive learning to leverage action semantics shared across both domains. Moreover, we also integrate a supervised contrastive learning objective using target pseudo-labels to enhance discriminability of the latent space for video domain adaptation. Extensive experiments on several benchmark datasets demonstrate the superiority of our proposed approach over state-of-the-art methods. Project page: https://cvir.github.io/projects/comix
연구 동기 및 목표
- 비디오 동작 인식을 위한 효과적인 비지도 도메인 적응 방법의 부족, 특히 시간적 역학과 공유되는 동작 의미를 활용하는 방법의 부족을 해결하기 위해.
- 적대적 학습의 한계, 예를 들어 훈련의 불안정성과 수렴 성능 열 劣화를 해결하기 위해.
- 배경이 다를지라도 동작은 동일한 경우에 공 invariant한 동작 의미를 활용하여 도메인 간 특징 정렬을 향상시키기 위해.
- 타겟 도메인의 의사 레이블을 사용하여 잠재 공간에서의 구분 능력을 향상시키고, 진짜 레이블 없이도 자기 지도적 대비 학습을 가능하게 하기 위해.
제안 방법
- 시간적 의존성을 캡처하기 위해 비디오를 그래프로 표현하기 위해 그래프 컬러리션 네트워크(GCN)를 사용한다.
- 동일한 비디오의 다양한 속도 버전 간 유사도를 최대화하고, 다른 비디오 간의 유사도를 최소화하기 위해 시간적 대비 학습(TCL)을 적용한다.
- 소스 도메인과 타겟 도메인 간 배경를 교환하여 합성 비디오를 생성함으로써 배경 혼합을 도입하여 대비 학습을 위한 추가 양성 샘플을 생성한다.
- 타겟 도메인의 의사 레이블을 사용하여 동일한 동작 클래스의 특징들이 임베딩 공간에서 더 가까워지도록 하는 지도형 대비 학습 목표를 설정한다.
- 시간적 대비 손실, 배경 혼합 손실, 의사 레이블 대비 손실을 하나의 종단 간 훈련 목표로 통합한다.
- 배경 추출은 시간적 중앙값 필터링을 사용하며, 이는 더 복잡한 방법인 가우시안 혼합 모델(GMM)보다 성능이 뛰어나다는 게 입증되었다.
실험 결과
연구 질문
- RQ1적대적 훈련 없이도 시간적 대비 학습이 도메인 간 특징 정렬에 효과적으로 기여할 수 있는가?
- RQ2배경 혼합을 통해 도메인 간 공통되는 동작 의미를 반영하는 의미 있는 양성 샘플을 어떻게 생성할 수 있는가?
- RQ3타겟 도메인의 의사 레이블을 통합할 경우 비지도 비디오 도메인 적응에서 구분 능력 향상에 어느 정도 기여하는가?
- RQ4표준 RNN이나 MLP에 비해 그래프 표현이 도메인 적응에서 시간적 특징 학습에 얼마나 효과적인가?
- RQ5적대적 학습 및 특징 매칭 접근법에 비해 제안된 방법은 정확도와 강건성 측면에서 어떻게 비교되는가?
주요 결과
- CoMix는 UCF-HMDB에서 소스 전용 기반보다 5.2% 향상되었고, Jester에서는 10.7% 향상되어 강력한 도메인 적응 성과를 보였다.
- GCN를 사용할 경우 CoMix는 DANN보다 UCF-HMDB에서 7.1% 향상되었고, Jester에서는 1.8% 향상되어 적대적 훈련 대비 우수성을 입증했다.
- GCN를 사용한 그래프 표현은 UCF-HMDB에서 90.3%의 정확도를 기록하여 MLP(88.1%)와 LSTM(84.3%)를 능가하며 시간적 의존성을 효과적으로 캡처한다는 게 입증되었다.
- 시간적 중앙값 필터링을 통한 배경 추출은 GMM보다 평균 2.3% 높은 성능을 보이며 효율성과 효과성을 입증했다.
- t-SNE를 활용한 특징 시각화 결과, TCL, BGM, TPL 각 구성 요소가 순차적으로 적용될수록 도메인 정렬과 클래스의 구분 능력이 향상됨을 확인할 수 있었다.
- 제거 실험 결과, TCL, BGM, TPL의 모든 구성 요소를 조합했을 때 최고의 성능를 기록하여 각 모듈이 상호 보완적인 역할을 한다는 게 검증되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.