Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Domain Adaptation for Spatio-Temporal Action Localization

Nakul Agarwal, Yi‐Ting Chen|arXiv (Cornell University)|2020. 10. 19.
Human Pose and Action Recognition참고 문헌 22인용 수 4
한 줄 요약

이 논문은 영상 수준 및 인스턴스 수준에서 공간적 및 시간적 특징을 동시에 보정함으로써 도메인 간 차이를 줄이는 엔드 투 엔드 비지도 도메인 적응 프레임워크를 제안한다. Faster R-CNN에 시간적 및 공간적 특징을 영상 수준에서, 시간적 특징을 인스턴스 수준에서 적응시키는 세 가지 적대적 적응 모듈을 통합함으로써, UCF-Sports, UCF-101, JHMDB 데이터셋에서 유의미한 성능 향상을 달성하였으며, 특히 시각적 및 시간적 차이가 큰 교차 도메인 설정에서 뛰어난 성능을 보였다.

ABSTRACT

Spatio-temporal action localization is an important problem in computer vision that involves detecting where and when activities occur, and therefore requires modeling of both spatial and temporal features. This problem is typically formulated in the context of supervised learning, where the learned classifiers operate on the premise that both training and test data are sampled from the same underlying distribution. However, this assumption does not hold when there is a significant domain shift, leading to poor generalization performance on the test data. To address this, we focus on the hard and novel task of generalizing training models to test samples without access to any labels from the latter for spatio-temporal action localization by proposing an end-to-end unsupervised domain adaptation algorithm. We extend the state-of-the-art object detection framework to localize and classify actions. In order to minimize the domain shift, three domain adaptation modules at image level (temporal and spatial) and instance level (temporal) are designed and integrated. We design a new experimental setup and evaluate the proposed method and different adaptation modules on the UCF-Sports, UCF-101 and JHMDB benchmark datasets. We show that significant performance gain can be achieved when spatial and temporal features are adapted separately, or jointly for the most effective results.

연구 동기 및 목표

  • 학습 데이터와 테스트 데이터 간의 도메인 간 차이로 인한 일반화 성능 열악함 문제를 해결한다.
  • 타겟 레이블이 제공되지 않는 새로운 비지도 도메인 적응 프레임워크를 개발한다.
  • 다양한 도메인 간 공간적 및 시간적 특징을 동시에 정렬하기 위해 여러 도메인 적응 모듈을 설계하고 통합한다.
  • 기존 벤치마크에서 이러한 평가 프로토콜이 부족한 점을 감안해, 시공간 행동 로컬라이제이션에서의 도메인 적응을 평가하기 위한 새로운 실험 설정을 수립한다.
  • 공간적 및 시간적 특징을 별도로 또는 함께 적응시키는 것이 도메인 간 차이 상황에서 로컬라이제이션 성능 향상에 크게 기여함을 입증한다.

제안 방법

  • I3D 백본을 사용해 영상 특징을 추출할 수 있도록 Faster R-CNN 프레임워크를 확장하여 시공간 행동 로컬라이제이션을 지원한다.
  • 세 가지 도메인 적응 모듈을 도입한다: (1) 영상 수준에서의 시간적 특징 정렬, (2) 인스턴스 수준에서의 시간적 특징 정렬, (3) 영상 수준에서의 공간적 특징 정렬.
  • 도메인 분류기를 사용한 적대적 훈련을 통해 영상 수준 및 인스턴스 수준에서 도메인 불변 특징을 학습한다.
  • 탐지 헤드와 함께 적응 모듈을 엔드 투 엔드로 훈련시켜 로컬라이제이션과 도메인 정렬을 동시에 최적화한다.
  • 영상 수준의 시간적 적응에서는 전경 환경의 전역적 맥락을 활용하고, 인스턴스 수준의 적응에서는 액터/행동의 다이내믹스를 반영하여 특징 일반화를 향상시킨다.
  • 예를 들어 UCF-101 → JHMDB와 같은 교차 데이터셋 적응을 사용하여 도메인 간 차이 상황에서의 성능을 검증하기 위한 새로운 평가 프로토콜을 설계한다.

실험 결과

연구 질문

  • RQ1타겟 애너테이션이 제공되지 않는 상황에서 비지도 도메인 적응이 시공간 행동 로컬라이제이션에서 도메인 간 차이를 효과적으로 줄일 수 있는가?
  • RQ2영상 수준과 인스턴스 수준의 시간적 특징 정렬은 로컬라이제이션 성능 향상에 어떻게 다른 영향을 미치는가?
  • RQ3공간적 특징 정렬은 로컬라이제이션 오류를 줄이고 프포지얼 품질을 향상시키는 데 어떤 기여를 하는가?
  • RQ4공간적 및 시간적 특징을 함께 적응시키는 것이 개별 적응보다 더 높은 성능을 내는가?
  • RQ5예를 들어 UCF-101과 JHMDB 간의 시각적 및 시간적 차이가 모델의 일반화에 어떤 영향을 미치며, 적응 기법이 이를 완화할 수 있는가?

주요 결과

  • 제안된 방법은 UCF-Sports, UCF-101, JHMDB 데이터셋에서 비지도 도메인 적응 설정에서 뚜렷한 성능 향상을 보였으며, 기준 모델 대비 mAP 향상을 확인하였다.
  • 공간적 및 시간적 특징을 함께 적응시키는 것이 개별 적응 모듈보다 뛰어난 성능을 내며, 특히 시각적 및 시간적 도메인 간 차이가 큰 경우에 두드러진다.
  • 인스턴스 수준의 시간적 적응은 잘못된 로컬라이제이션 및 잘못된 분류 오류를 감소시켜 행동 다이내믹스 모델링 향상의 증거가 된다.
  • 영상 수준의 공간적 적응은 영역 프포지얼 네트워크(RPN) 품질 향상을 통해 잘못된 로컬라이제이션 오류를 크게 감소시켜 직접적으로 로컬라이제이션 정확도를 향상시킨다.
  • 모든 세 가지 적응 모듈을 통합한 모델는 상위 1000개 검출 결과의 오류 분석에서 가장 많은 정확한 검출 수와 가장 낮은 잘못된 로컬라이제이션 비율을 기록하였다.
  • 기준 모델은 대규모 학습 데이터(예: UCF-101)를 사용했음에도 불구하고 JHMDB에서 성능이 열악하게 나타났으며, 이는 도메인 간 차이—특히 Walk 및 Basketball 클래스에서—의 영향을 잘 보여주며, 적응 기법이 이 격차를 크게 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.