Skip to main content
QUICK REVIEW

[논문 리뷰] CycAs: Self-supervised Cycle Association for Learning Re-identifiable Descriptions

Zhongdao Wang, Jingwei Zhang|arXiv (Cornell University)|2020. 07. 15.
Video Surveillance and Tracking Methods참고 문헌 49인용 수 13
한 줄 요약

이 논문은 자기지도 학습 방법인 CycAs를 제안하며, 라벨이 없는 영상 프레임 간 순환 연관을 사전 과제로 사용하여 가짜 레이블 없이도 재식별 가능한 임베딩을 학습한다. 정방향 및 역방향 데이터 연관 일관성을 강제함으로써 모델은 견고하고 카메라 간 호환 가능한 표현을 학습하며, 공개 벤치마크에서 최신 기술 수준의 성능을 달성하고, 큰 도메인 갭이 존재하는 실제 영상에서 학습한 경우에도 경쟁력 있는 성능을 보인다.

ABSTRACT

This paper proposes a self-supervised learning method for the person re-identification (re-ID) problem, where existing unsupervised methods usually rely on pseudo labels, such as those from video tracklets or clustering. A potential drawback of using pseudo labels is that errors may accumulate and it is challenging to estimate the number of pseudo IDs. We introduce a different unsupervised method that allows us to learn pedestrian embeddings from raw videos, without resorting to pseudo labels. The goal is to construct a self-supervised pretext task that matches the person re-ID objective. Inspired by the \emph{data association} concept in multi-object tracking, we propose the extbf{Cyc}le extbf{As}sociation ( extbf{CycAs}) task: after performing data association between a pair of video frames forward and then backward, a pedestrian instance is supposed to be associated to itself. To fulfill this goal, the model must learn a meaningful representation that can well describe correspondences between instances in frame pairs. We adapt the discrete association process to a differentiable form, such that end-to-end training becomes feasible. Experiments are conducted in two aspects: We first compare our method with existing unsupervised re-ID methods on seven benchmarks and demonstrate CycAs' superiority. Then, to further validate the practical value of CycAs in real-world applications, we perform training on self-collected videos and report promising performance on standard test sets.

연구 동기 및 목표

  • 트랙릿 또는 클러스터링에서 유도된 오류 발생 가능성이 높은 가짜 레이블에 의존하는 기존 비지도 재식별 방법의 한계를 해결하기 위해.
  • 카메라 간 재식별 목표와 밀접하게 일치하는 자기지도 사전 과제를 설계하기 위해.
  • 약간의 외관 변화를 수용할 수 있는 탄력 있는 순환 일관성 목표를 사용하여, 미분 가능하고 유연한 엔드 투 엔드 학습을 가능하게 하기 위해.
  • 실제로 수집한 영상에서 학습하고 큰 도메인 갭이 존재하는 표준 벤치마크에서 평가함으로써, 방법의 실용성을 검증하기 위해.
  • 자기지도 표현 학습이 도메인 이동 조건에서도 지도 학습 모델과 경쟁 가능한 성능을 달성할 수 있음을 보여주기 위해.

제안 방법

  • CycAs 사전 과제는 순환 일관성을 강제한다: 프레임 A에서 B로 데이터 연관을 수행한 후, B에서 다시 A로 연관을 수행하며, 각 사람의 매칭이 자기 자신이 되도록 목표로 한다.
  • 이 방법은 이산적인 연관 과정을 미분 가능한 정렬 기법을 사용해 유연한 근사화하여 엔드 투 엔드 학습이 가능하도록 한다.
  • 프레임 쌍 간의 약간의 비대칭성을 수용할 수 있도록 유연한 최적화 목표를 도입하여, 더 큰 외관 변화가 있는 프레임의 사용을 가능하게 한다.
  • 이중 단계 학습 전략을 사용한다: 먼저 동일 영상 내 프레임 쌍(연속 프레임)에서 학습하여 수렴을 확보하고, 이후 시야가 겹치는 다른 카메라의 프레임 쌍으로 미세 조정하여 내성적 강도를 향상시킨다.
  • 모델은 동일 영상 내(인라인 샘플링) 및 다른 카메라 간(인터 샘플링)의 프레임 쌍을 조합하여 학습하며, 미니배치당 8개의 프레임 쌍을 사용한다.
  • 프레임은 원시 영상에서 매 7 프레임 간격으로 보행자 검출기로 바운딩 박스를 추출하고 자르며, 이는 정제되지 않은 실제 영상 자료에서의 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1영상 프레임 간 순환 일관성에 기반한 자기지도 사전 과제가 가짜 레이블에 의존하지 않고 효과적인 보행자 재식별 특징을 학습할 수 있는가?
  • RQ2순환 일관성 제약을 완화하면 모델이 큰 외관 변화 조건에서 일반화 능력에 어떤 영향을 미치는가?
  • RQ3제안된 방법은 도메인 갭이 큰 실제 영상 자료에서 수집한 영상에 대해 표준 벤치마크로 일반화 가능한가?
  • RQ4내영상 학습을 시작으로 외카메라 프레임 쌍을 추가하는 이중 단계 학습 전략이 수렴과 성능 향상에 기여하는가?
  • RQ5실제로 수집한 라벨이 없는 데이터에서 학습한 경우, CycAs는 지도 학습 및 비지도 기준 모델과 비교해 어떻게 성능을 내는가?

주요 결과

  • 일곱 개인 공개 벤치마크에서 CycAs는 기존 비지도 재식별 방법보다 뛰어난 성능을 보이며, 자기지도 표현 학습의 우수성을 입증한다.
  • 자신이 수집한 6시간의 실제 영상에서 학습한 결과, Market-1501에서 mAP 23.3%, R1 50.8%를 기록하여, 비지도 기준 모델 BUC(+21.0% R1)와 UGA(+13.6% R1)를 모두 능가한다.
  • DukeMTMC-ReID에서 CycAs는 mAP 19.2%, R1 34.6%를 기록했으며, CUHK03에서 학습한 지도 학습 모델 IDE보다 mAP 6.0% 높고 R1 8.4% 높다.
  • 자신이 수집한 영상에서 학습한 경우, DukeMTMC에서 mAP 19.2%를 기록했으며, 이는 DukeMTMC에서 학습한 지도 학습 모델 IDE보다 2.6% 높다.
  • 자신이 수집한 영상에서 학습한 모델가 다른 도메인에서 학습한 지도 학습 모델보다 성능이 뛰어나, 강력한 도메인 일반화 능력과 비라벨 데이터의 효과적 활용을 시사한다.
  • 제거 분석 결과, 내선 샘플링 데이터만으로 학습할 경우 의미 있는 수렴이 이루어지지 않으며, 내선 및 외선 샘플링 데이터를 병합하면 빠르고 안정적인 수렴이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.