Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Video Domain Adaptation for Action Recognition: A Disentanglement Perspective

Pengfei Wei, Lingdong Kong|arXiv (Cornell University)|2022. 08. 15.
Anomaly Detection Techniques and Applications인용 수 9
한 줄 요약

이 논문은 비디오 표현을 도메인 특화 정적 요소와 도메인 불변 동적 요소로 분리하는 새로운 비지도 비디오 도메인 적응 프레임워크인 TranSVAE를 제안한다. 별도의 잠재 요소로 비디오 생성을 모델링하고 분리 제약 조건을 적용하여 공간적 및 시간적 도메인 이동을 효과적으로 줄이며, UCF-HMDB, Jester, Epic-Kitchens 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Unsupervised video domain adaptation is a practical yet challenging task. In this work, for the first time, we tackle it from a disentanglement view. Our key idea is to handle the spatial and temporal domain divergence separately through disentanglement. Specifically, we consider the generation of cross-domain videos from two sets of latent factors, one encoding the static information and another encoding the dynamic information. A Transfer Sequential VAE (TranSVAE) framework is then developed to model such generation. To better serve for adaptation, we propose several objectives to constrain the latent factors. With these constraints, the spatial divergence can be readily removed by disentangling the static domain-specific information out, and the temporal divergence is further reduced from both frame- and video-levels through adversarial learning. Extensive experiments on the UCF-HMDB, Jester, and Epic-Kitchens datasets verify the effectiveness and superiority of TranSVAE compared with several state-of-the-art approaches. Code is publicly available.

연구 동기 및 목표

  • 공간적 및 시간적 도메인 이동이 모델 일반화를 저해하는 비지도 비디오 도메인 적응 문제를 해결하기 위해.
  • 공간적 및 시간적 도메인 갭을 함께 다루는 기존의 통합형 접근 방식이 명시적 분리 없이 처리하기 때문에 발생하는 한계를 극복하기 위해.
  • 생성 모델링을 통해 도메인 특화 정적 콘텐츠와 동작 관련 동적 운동을 명시적으로 분리함으로써 효과적인 도메인 적응을 가능하게 하기 위해.
  • 정적 요소를 분리하여 공간적 도메인 이동을 줄이고, 동적 요소의 프레임 수준 및 비디오 수준 적대적 정렬을 통해 시간적 도메인 이동을 줄이기 위해.
  • 소스 레이블 데이터와 타겟 비레이블 데이터만을 사용하여 분리된 도메인 불변 표현을 통해 최종 행동 인식 성능을 향상시키기 위해.

제안 방법

  • 정적 도메인 특화 요소와 동적 동작 관련 요소로 나누어진 두 개의 분리 잠재 요소에서 비디오를 생성하는 전이 순차 변동 자동인코더(TranSVAE)를 제안한다.
  • 정적 요소와 동적 요소 간의 상호 정보 최소화를 통해 두 요소 간의 독립성을 강제하여 효과적인 분리가 이루어지도록 한다.
  • 정적 요소에 대비 삼중조합 손실을 적용하여 도메인 특화되면서도 행동 콘텐츠에 영향을 받지 않는 요소를 만들고, 공간적 도메인 이동 제거를 용이하게 한다.
  • 프레임 수준 및 비디오 수준에서 적대적 학습을 구현하여 동적 요소를 서로 다른 도메인 간에 정렬함으로써 시간적 도메인 이동을 줄인다.
  • 소스 데이터의 작업별 보조 지도를 동적 요소에 통합하여 행동 인식을 위한 의미 정보를 유지한다.
  • 두 단계의 훈련 과정을 적용한다: 먼저 재구성 및 분리 목적 함수로 오토인코더를 사전 훈련하고, 이후 적대적 손실 및 분류 손실로 미세 조정한다.

실험 결과

연구 질문

  • RQ1비디오 표현에서 정적(도메인 특화) 요소와 동적(행동 관련) 요소를 분리하면 비디오 행동 인식을 위한 비지도 도메인 적응에 도움이 될 수 있는가?
  • RQ2정적 및 시간적 도메인 이동을 분리 기반으로 분리함으로써 통합 정렬 방법보다 더 나은 일반화 성능를 달성할 수 있는가?
  • RQ3정적 요소를 얼마나 잘 제거할 수 있는가? 이는 공간적 도메인 이동을 제거하면서도 동적 요소에 행동 의미 정보를 유지하는 데 얼마나 효과적인가?
  • RQ4프레임 수준 및 비디오 수준에서 동적 요소에 대한 적대적 정렬이 시간적 도메인 이동을 얼마나 효과적으로 줄이는가?
  • RQ5분리된 동적 요소를 활용하여 도메인 간 행동을 전이하면서 외관을 유지할 수 있는가? 이는 스타일 전이 유사 기능을 가능하게 하는가?

주요 결과

  • TranSVAE는 UCF-HMDB 데이터셋에서 최신 기술 수준의 성능을 달성하며, 이전 방법들보다 크게 뛰어나 H→U 설정에서 5.2%의 절대 성능 향상을 보였다.
  • Jester 데이터셋에서는 두 번째로 좋은 성능을 보인 방법보다 4.1% 향상되어 다양한 비디오 도메인에 걸쳐 강력한 일반화 능력을 입증했다.
  • Epic-Kitchens에서는 이전 최고 성능보다 3.8%의 정확도 향상을 기록하여 장시간 분포, 실제 세계 비디오 환경에서의 효과성을 확인했다.
  • 제거 실험 결과, 정적 요소에 대한 대비 삼중조합 손실이나 동적 요소에 대한 적대적 정렬을 제거할 경우 성능 저하가 심각하게 발생함을 확인하여 이들의 필요성을 검증했다.
  • 정성적 결과는 정적 요소가 도메인 특화된 외관(예: 캐릭터 스타일)을 포착하고, 동적 요소가 행동 의미를 캐릭터링하며, 도메인 간 요소 교환을 통해 외관을 유지하면서 행동 전이가 가능함을 확인했다.
  • 모델는 가짜 레이블 임계값 설정에 대해 강건성을 보였으며, 최적의 성능는 작업별 최적 임계값(η=0.93 for U→H, η=0.96 for H→U)에서 달성되어 하이퍼파rameter 변화에 대비한 안정적인 적응 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.