Skip to main content
QUICK REVIEW

[논문 리뷰] Tracking Persons-of-Interest via Unsupervised Representation Adaptation

Shun Zhang, Jia‐Bin Huang|arXiv (Cornell University)|2017. 10. 05.
Face recognition and analysis참고 문헌 44인용 수 6
한 줄 요약

이 논문은 사전 훈련된 CNN을 시공간적 및 맥락적 제약 조건을 사용하여 미세조정하여 영상 전용, 구분력 있는 얼굴 특징를 생성함으로써 제약 조건이 없는 영상에서 다중 얼굴 추적을 위한 비지도 표현 적응 방법을 제안한다. 자기 생성된 훈련 샘플에 대해 대칭 트리플릿 손실을 최적화함으로써 촬영 간 외형 변화가 큰 상황에서도 얼굴 재식별 성능을 향상시키며, 티브이 시트콤과 유튜브 음악 영상에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Multi-face tracking in unconstrained videos is a challenging problem as faces of one person often appear drastically different in multiple shots due to significant variations in scale, pose, expression, illumination, and make-up. Existing multi-target tracking methods often use low-level features which are not sufficiently discriminative for identifying faces with such large appearance variations. In this paper, we tackle this problem by learning discriminative, video-specific face representations using convolutional neural networks (CNNs). Unlike existing CNN-based approaches which are only trained on large-scale face image datasets offline, we use the contextual constraints to generate a large number of training samples for a given video, and further adapt the pre-trained face CNN to specific videos using discovered training samples. Using these training samples, we optimize the embedding space so that the Euclidean distances correspond to a measure of semantic face similarity via minimizing a triplet loss function. With the learned discriminative features, we apply the hierarchical clustering algorithm to link tracklets across multiple shots to generate trajectories. We extensively evaluate the proposed algorithm on two sets of TV sitcoms and YouTube music videos, analyze the contribution of each component, and demonstrate significant performance improvement over existing techniques.

연구 동기 및 목표

  • 티브이 시트콤과 음악 영상와 같은 제약 조건이 없는 영상에서 촬영 간 큰 외형 변화가 발생하는 다중 얼굴 추적 문제를 해결한다.
  • 학습 데이터와 테스트 데이터 간 분포의 차이로 인해 사전 훈련된 CNN 특징가 실패하는 도메인 이동 문제를 극복한다.
  • 정체성에 대한 수동 레이블이 필요 없이 영상 전용, 구분력 있는 얼굴 표현을 학습하는 방법을 개발한다.
  • 맥락적 및 시공간적 제약 조건을 활용하여 촬영 경계를 넘는 얼굴 재식별 및 궤적 연결을 향상시킨다.
  • 복잡한 촬영 전환과 외형 변화가 존재하는 실제 영상 데이터셋에서 제안된 방법의 유효성을 입증한다.

제안 방법

  • 시공간적 및 맥락적 제약 조건을 사용하여 주어진 영상에서 양성 및 음성 얼굴 쌍을 포함한 대량의 훈련 샘플을 자동으로 생성한다.
  • 자기 생성된 샘플에 대해 사전 훈련된 얼굴 CNN을 미세조정하여 영상의 특정 시각 도메인에 적응시킨다.
  • 유클리드 거리가 의미론적 얼굴 유사도를 반영하도록 임bedding 공간을 최적화하는 대칭 트리플릿 손실 함수(SymTriplet)를 제안한다.
  • 적응된 구분력 있는 특징를 사용하여 계층적 클러스터링을 적용하여 촬영 간 트랙렛을 연결하여 완전한 궤적을 형성한다.
  • 주요 캐릭터가 에피소드 간 일관성을 유지하므로, 한 에피소드에서 적응된 특징를 다른 에피소드로 전이하여 재훈련 시간을 줄인다.
  • 시아모이즈/트리플릿 네트워크 아키텍처를 활용하여 내부 인물 간 거리 최소화와 외부 인물 간 거리 최대화를 통해 정체성 유지 표현을 학습한다.

실험 결과

연구 질문

  • RQ1비지도 표현 적응이 큰 외형 변화가 발생하는 제약 조건이 없는 영상에서 얼굴 재식별 성능을 향상시킬 수 있는가?
  • RQ2맥락적 및 시공간적 제약 조건에서 자동 생성된 훈련 데이터가 사전 훈련된 CNN을 특정 영상에 적응시키는 데 얼마나 효과적인가?
  • RQ3제안된 대칭 트리플릿 손실 함수가 표준 트리플릿 손실보다 더 나은 구분력 있는 특징 학습을 이끌어낼 수 있는가?
  • RQ4실제 영상 데이터셋에서 복잡한 촬영 전환과 외형 변화가 존재하는 상황에서 최신 기술 수준의 기법들과 비교해 본다면 이 방법이 다중 얼굴 추적 성능을 얼마나 향상시키는가?
  • RQ5동일한 티브이 시리즈의 다른 에피소드 간에 적응된 특징를 전이하여 훈련 비용을 줄일 수 있는가, 성능 저하 없이 가능한가?

주요 결과

  • 제안된 방법인 Ours-SymTriplet-Contx는 티브이 시트콤 데이터셋에서 66.7%의 IDF1을 달성하여 이전 최신 기술 수준의 방법들을 능가한다.
  • 유튜브 음악 영상 데이터셋에서는 64.8%의 MOTA와 69.6%의 MOTA를 기록하여 도전적인 제약 조건이 많은 시퀀스에서도 뛰어난 성능을 보였다.
  • 기본 방법 대비 정체성 전환(_IDS)과 분할(Frag)을 크게 줄였으며, 시트콤 데이터셋에서 각각 802개의 IDS와 2018개의 Frag을 기록하여 기준 방법보다 높은 값에서 유의미하게 낮아졌다.
  • 한 에피소드(BBT02)에서 적응된 특징를 사용한 전이 학습이 다른 에피소드에서 66.3%의 IDF1을 달성하여 적응된 특징의 강력한 일반화 능력과 재사용 가능성을 입증했다.
  • 절단 실험을 통해 맥락 제약 조건 생성과 대칭 트리플릿 손실이 성능 향상에 필수적임을 확인하였으며, 각각 IDF1이 5% 이상 감소하는 것으로 나타났다.
  • 실패 사례는 주로 단일 인물 촬영에서 발생하며, 유사한 외형을 가진 사람들을 구분하기 위해 음성 쌍이 부족한 경우가 대부분이어서 다중 모odal 감시가 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.