Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Domain Adaptation for Video Transformers in Action Recognition

Victor G. Turrisi da Costa, Giacomo Zara|arXiv (Cornell University)|2022. 07. 26.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 시공간 트랜스포머 백본과 정보 볼록함 원리에 기반한 새로운 도메인 정렬 손실을 활용하는 비지도 도메인 적응(UbDAV) 프레임워크인 UDAVT를 제안한다. 공간 및 시간 트랜스포머를 도메인 불변 특징 학습과 함께 공동으로 미세조정함으로써, UDAVT는 도메인 간 큰 차이가 있는 HMDB→UCF 및 더 도전적인 Kinetics→NEC-Drone 벤치마크에서 최신 기술 수준의 성능을 달성하며, 도메인 이동에 대한 강건성을 입증한다.

ABSTRACT

Over the last few years, Unsupervised Domain Adaptation (UDA) techniques have acquired remarkable importance and popularity in computer vision. However, when compared to the extensive literature available for images, the field of videos is still relatively unexplored. On the other hand, the performance of a model in action recognition is heavily affected by domain shift. In this paper, we propose a simple and novel UDA approach for video action recognition. Our approach leverages recent advances on spatio-temporal transformers to build a robust source model that better generalises to the target domain. Furthermore, our architecture learns domain invariant features thanks to the introduction of a novel alignment loss term derived from the Information Bottleneck principle. We report results on two video action recognition benchmarks for UDA, showing state-of-the-art performance on HMDB$\leftrightarrow$UCF, as well as on Kinetics$ ightarrow$NEC-Drone, which is more challenging. This demonstrates the effectiveness of our method in handling different levels of domain shift. The source code is available at https://github.com/vturrisi/UDAVT.

연구 동기 및 목표

  • 원본 도메인(예: HMDB)에서 학습된 모델가 다른 관련 도메인(예: UCF 또는 NEC-Drone)에서 성능이 떨어지는 도메인 이동 문제를 해결하기 위해.
  • 이미지 분야에서 잘 발전한 비지도 도메인 적응(UDA) 기법을 시간적 동적 특성을 지닌 더 복잡한 비디오 도메인으로 확장하기 위해.
  • 비디오 트랜스포머에서 도메인 불변 표현을 학습함으로써 일반화 능력을 향상시키는 강력한 엔드 투 엔드 학습 가능한 UDA 프레임워크를 개발하기 위해.
  • 표준 UDA 벤치마크, 특히 교차 데이터셋 설정이 어려운 상황에서도 제안된 방법의 효과성을 평가하기 위해.

제안 방법

  • 이 방법은 이중 단계 학습 전략을 사용한다: 첫 번째로 전체 트랜스포머를 원본 데이터만으로 미세조정하고, 두 번째 단계에서 공간 트랜스포머를 고정한 후, 새로운 도메인 정렬 손실을 사용하여 시간 트랜스포머만 추가로 미세조정한다.
  • 핵심 혁신은 정보 볼록함(IB) 원리에서 유도된 새로운 도메인 정렬 손실로, 이는 행동 클래스에 관련된 정보만 유지하고 도메인 특화된 변형은 제거하도록 모델을 유도한다.
  • 이 손실은 두 번째 학습 단계에서 타겟 데이터에 원본 모델의 의사 레이블을 사용하여 도메인 간 특징 분포를 정렬하는 데 적용된다.
  • 아키텍처는 시공간 주의 메커니즘(STAM) 기반 공유 인코더를 사용하며, 공간 특징 추출을 위한 비전 트랜스포머(ViT)와 시간적 집계를 위한 다층 트랜스포머를 조합한다.
  • 도메인 정렬 구성 요소의 학습을 안정화시키기 위해 타겟 특징의 모멘터리 업데이트 큐를 사용한다.
  • 감독 및 비감독 설정 모두에서 평가되었으며, 큐의 역할과 의사 레이블 품질에 대한 분석 실험도 수행되었다.

실험 결과

연구 질문

  • RQ1원본 데이터만 사용하고 타겟 데이터는 레이블 없이, 트랜스포머 기반 비디오 모델이 새로운 도메인에 효과적으로 적응할 수 있는가?
  • RQ2기존의 UDA 손실과 비교해 볼 때, 정보 볼록함 기반 손실이 비디오 행동 인식에서 도메인 불변 특징를 정렬하는 데 얼마나 효과적인가?
  • RQ3원본 데이터에서 사전 학습한 후 시간 스트림만 도메인 정렬을 통해 미세조정하는 이중 단계 학습 전략이 도메인 이동 상황에서 모델 일반화 능력을 향상시키는가?
  • RQ4타겟 의사 레이블의 품질이 도메인 적응 과정의 성능에 어떤 영향을 미치는가?
  • RQ5재사용된 자기지도 학습 대비 대비 기반 방법(SimCLR, VICReg 등)이 비디오 행동 인식에서 도메인 적응에 응용되었을 때, 제안된 IB 기반 손실보다 성능이 열등한가?

주요 결과

  • UDAVT는 HMDB→UCF 벤치마크에서 최신 기술 수준의 성능을 달성하며, 이전 방법들보다 뚜렷한 성능 향상을 보였다.
  • 더 도전적인 Kinetics→NEC-Drone 벤치마크에서는 65.3%의 정확도를 기록했으며, 두 번째로 우수한 성능을 낸 방법보다 16% 이상 높은 성능 향상을 보였다.
  • 분석 실험 결과, 특히 비감독 설정에서 모멘터리 큐와 고품질 의사 레이블이 최적의 성능을 내기 위해 필수적임을 확인했다.
  • 재사용된 자기지도 대비 대비 기반 방법(SimCLR, VICReg 등)은 도메인 적응에 응용되었지만, 여전히 제안된 IB 기반 손실에 비해 성능이 열등했다.
  • 시각화된 주의 맵을 통해 UDAVT는 시공간 정렬 능력을 향상시켰으며, 모델이 시퀀스 내 행동 관련 프레임에 더 정확하게 집중함을 확인했다.
  • 결과적으로 정보 볼록함 기반 손실이 도메인 특화된 노이즈를 제거하면서도 클래스 정보를 유지하는 분리된 표현을 학습함으로써 도메인 이동을 효과적으로 줄임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.