Skip to main content
QUICK REVIEW

[논문 리뷰] Leveraging Endo- and Exo-Temporal Regularization for Black-box Video Domain Adaptation

Yuecong Xu, Jianfei Yang|arXiv (Cornell University)|2022. 08. 10.
Domain Adaptation and Few-Shot Learning인용 수 6
한 줄 요약

이 논문은 원천 데이터 또는 모델 파라미터에 접근할 수 없음에도 불구하고, 내부 및 외부 시간 정규화를 활용하여 구분 가능한 시간 특징을 학습하는 새로운 블랙박스 비디오 도메인 적응 프레임워크 EXTERN을 제안한다. 마스크-믹스 전략과 블랙박스 예측기로부터의 지식 정복을 통해, EXTERN은 교차 도메인 행동 인식 벤치마크에서 최신 기술을 초월하는 성능을 달성하며, 기존 방법 대비 최대 23.1%의 상대적 향상률을 기록한다.

ABSTRACT

To enable video models to be applied seamlessly across video tasks in different environments, various Video Unsupervised Domain Adaptation (VUDA) methods have been proposed to improve the robustness and transferability of video models. Despite improvements made in model robustness, these VUDA methods require access to both source data and source model parameters for adaptation, raising serious data privacy and model portability issues. To cope with the above concerns, this paper firstly formulates Black-box Video Domain Adaptation (BVDA) as a more realistic yet challenging scenario where the source video model is provided only as a black-box predictor. While a few methods for Black-box Domain Adaptation (BDA) are proposed in image domain, these methods cannot apply to video domain since video modality has more complicated temporal features that are harder to align. To address BVDA, we propose a novel Endo and eXo-TEmporal Regularized Network (EXTERN) by applying mask-to-mix strategies and video-tailored regularizations: endo-temporal regularization and exo-temporal regularization, performed across both clip and temporal features, while distilling knowledge from the predictions obtained from the black-box predictor. Empirical results demonstrate the state-of-the-art performance of EXTERN across various cross-domain closed-set and partial-set action recognition benchmarks, which even surpassed most existing video domain adaptation methods with source data accessibility.

연구 동기 및 목표

  • 원천 데이터 및 모델 파라미터에 접근할 수 없는 개인정보가 민감한 환경에서 비디오 모델 이식의 핵심 과제를 해결하기 위해.
  • 강력하고 이식 가능한 비디오 모델 배포를 위한 현실적이지만 도전적인 시나리오로 블랙박스 비디오 도메인 적응(BVDA)을 정의하고 연구하기 위해.
  • 원천 도메인 정보에 의존하지 않고 자기지도 정규화를 통해 목표 비디오 특징의 구분 가능성과 시간적 일관성을 향상시키기 위해.
  • 원천 데이터 또는 모델에 접근할 수 없음에도 불구하고, 닫힌 집합 및 부분 집합 레이블 이동 설정 모두에서 효과적인 도메인 적응을 가능하게 하기 위해.

제안 방법

  • 가상의 시간 특징을 마스크된 클립 특징을 조합함으로써 생성하는 새로운 마스크-믹스 전략을 제안하여 시간 특징의 다양성과 강건성을 향상시킨다.
  • 클립 특징을 시간 특징과 정렬함으로써, 마스크된-시간 가설과 군집 가정을 준수하도록 돕는 내부 시간 정규화를 도입한다.
  • 다른 시간 세그먼트 간의 일관성을 장려함으로써 시간 특징의 구분 가능성을 향상시키기 위해 외부 시간 정규화를 적용한다.
  • 원천 모델 가중치에 접근할 필요 없이, 블랙박스 원천 예측기로부터의 지식 정복을 활용해 목표 도메인 특징 학습을 안내한다.
  • 시간 특징 집약 과정에서 정보가 많은 클립을 동적으로 강조하기 위해 클립 수준의 주의 히트를 사용한다.
  • 클립 특징와 시간 특징 간의 상호 정보를 증가시켜 특징 표현을 향상시키기 위해 정보 최대화를 통합한다.

실험 결과

연구 질문

  • RQ1원천 데이터나 모델 파라미터에 접근할 수 없음에도 불구하고, 내부 및 외부 시간 정규화가 블랙박스 비디오 도메인 적응에서 특징의 구분 가능성을 효과적으로 향상시킬 수 있는가?
  • RQ2원천 데이터가 없는 상황에서 마스크-믹스 전략은 어떻게 강건하고 일반화 가능한 시간 특징을 학습하는 데 기여하는가?
  • RQ3블랙박스 예측기로부터의 지식 정복은 원천 모델 접근이 없는 비디오 도메인 적응에서 어떤 정도의 보완 효과를 낼 수 있는가?
  • RQ4제안된 방법은 원천 도메인과 목표 도메인 간 레이블 이동이 발생하는 부분 집합 도메인 적응 상황에서도 강력한 성능을 유지하는가?
  • RQ5정규화 강도 및 가상 특징 혼합 비율과 같은 하이퍼파rameter 설정에 대해 제안된 프레임워크의 성능는 얼마나 민감한가?

주요 결과

  • EXTERN은 여러 교차 도메인 행동 인식 벤치마크에서 최신 기술을 초월하는 성능을 달성하며, 원천 데이터에 접근 가능한 기존 비디오 도메인 적응 방법들조차도 뛰어넘는다.
  • UCF-HMDB 부분 벤치마크에서 EXTERN은 기존 최고의 BDA 방법 대비 23.1%의 상대적 향상률을 기록하여, 레이블 이동 상황에서도 강력한 강건성을 입증한다.
  • 제거 실험 결과, 제안된 모든 학습 목표—내부 시간 정규화, 외부 시간 정규화, 가상 특징 구축, 예측 정복, 정보 최대화—가 성능 향상에 기여하고 있음을 확인한다.
  • 모델은 광범위한 하이퍼파rameter 설정 범위에서 일관된 성능을 유지하며, 정확도 변화가 0.83% 이내로 매우 낮아 강건성을 입증한다.
  • t-SNE 시각화 결과, EXTERN은 더 뭉쳐 있고 구분 가능한 클립 및 시간 특징을 생성함을 확인하여 군집 가정과 마스크된-시간 가설 준수를 검증한다.
  • 내부 시간 정규화만으로도 기존 모든 BDA 방법의 성능 향상률을 초월하며, 시간 특징 학습에서의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.