Skip to main content
QUICK REVIEW

[논문 리뷰] DCDLearn: Multi-order Deep Cross-distance Learning for Vehicle Re-Identification

Rixing Zhu, Jianwu Fang|arXiv (Cornell University)|2020. 03. 25.
Video Surveillance and Tracking Methods참고 문헌 37인용 수 8
한 줄 요약

이 논문은 실물 이미지, 스타일 전이 이미지, 재구성 이미지를 포함한 다중 순서 증강 데이터를 생성하기 위해 효율적인 일자형 CycleGAN을 활용하는 다중 순서 딥 크로스거리 학습 프레임워크인 DCDLearn를 제안한다. 다중 순서 증강 트리플릿 손실과 센터 손실을 최적화함으로써 모델은 카메라에 영향을 받지 않는, 신원 일관성 있는 표현을 학습하여, 특히 Tunnel-VReID와 같이 소규모 데이터셋에서 이전 방법 대비 13.1% 향상된 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Vehicle re-identification (Re-ID) has become a popular research topic owing to its practicability in intelligent transportation systems. Vehicle Re-ID suffers the numerous challenges caused by drastic variation in illumination, occlusions, background, resolutions, viewing angles, and so on. To address it, this paper formulates a multi-order deep cross-distance learning ( extbf{DCDLearn}) model for vehicle re-identification, where an efficient one-view CycleGAN model is developed to alleviate exhaustive and enumerative cross-camera matching problem in previous works and smooth the domain discrepancy of cross cameras. Specially, we treat the transferred images and the reconstructed images generated by one-view CycleGAN as multi-order augmented data for deep cross-distance learning, where the cross distances of multi-order image set with distinct identities are learned by optimizing an objective function with multi-order augmented triplet loss and center loss to achieve the camera-invariance and identity-consistency. Extensive experiments on three vehicle Re-ID datasets demonstrate that the proposed method achieves significant improvement over the state-of-the-arts, especially for the small scale dataset.

연구 동기 및 목표

  • 조명, 가림, 시점 변화로 인한 카메라 간 외관 변화 문제를 해결하기 위해.
  • 기존의 GAN 기반 데이터 증강 기법이 첫 번째 순서의 생성 이미지만 사용하고 두 번째 순서의 재구성 이미지를 忽略하는 한계를 극복하기 위해.
  • 다중 쌍방향 CycleGAN을 단일 일자형 CycleGAN에 의한 신원 제약 조건으로 대체하여 계산 복잡도를 감소시키기 위해.
  • 다중 순서 이미지 표현을 활용하여 소규모 데이터셋에서 모델의 강건성과 일반화 능력을 향상시키기 위해.
  • 새로운 심층 크로스거리 학습 프레임워크를 통해 카메라에 영향을 받지 않는 표현과 신원 일관성 있는 특징 학습을 달성하기 위해.

제안 방법

  • 학습 데이터를 무작위로 두 부분으로 나누어, 신원 유지 조건 하에 효율적인 쌍방향 카메라 스타일 전이를 가능하게 하는 일자형 CycleGAN을 도입한다.
  • 실물 이미지(0차 순서), CycleGAN에 의해 생성된 이미지(1차 순서), 재구성된 이미지(2차 순서)를 다중 순서 증강 데이터로 간주하여 학습에 활용한다.
  • 다양한 신원의 다중 순서 이미지 집합 간의 크로스거리 학습을 위한 다중 순서 증강 트리플릿 손실을 제안한다.
  • 모든 세 가지 이미지 순서에서의 내부 클래스 변동을 압축하기 위해 다중 순서 증강 센터 손실을 통합한다.
  • 학습 중에 하드 양성 및 음성 샘플에 집중하기 위해 자동으로 크로스거리 선택을 수행한다.
  • 일자형 CycleGAN에 신원 제약 조건을 적용하여 전달된 이미지와 재구성된 이미지가 원본과 동일한 신원을 유지하도록 보장한다.

실험 결과

연구 질문

  • RQ1단일이고 효율적인 일자형 CycleGAN이 다중 카메라 차량 재식별에서 다중 쌍방향 CycleGAN을 대체하여 계산 비용을 줄일 수 있는가?
  • RQ2첫 번째 순서의 생성 이미지와 두 번째 순서의 재구성 이미지를 모두 활용하면 특징의 강건성과 모델의 일반화 능력이 향상되는가?
  • RQ3결합된 트리플릿 손실과 센터 손실을 갖춘 다중 순서 증강 데이터가 더 나은 카메라 불변성과 신원 일관성을 이끌 수 있는가?
  • RQ4자료 부족이 주요 과제인 소규모 데이터셋에서 제안된 방법의 성능은 어떠한가?
  • RQ5저조도, 운동 왜곡, 가림 조건 하에서 최신 기술 수준의 방법보다 모델이 뛰어난 성능을 보이는가?

주요 결과

  • VeRi 데이터셋에서 DCDLearn는 랭크-1 정확도 92.8%와 mAP 70.4%를 달성하여 비교된 모든 최신 기술 수준의 방법들을 능가한다.
  • VehicleID 데이터셋에서, 소규모, 중간 규모, 대규모 버전 모두에서 최고의 성능을 기록하였으며, 전체 모델(Ours-T-C)이 가장 뛰어난 결과를 보였다.
  • 소규모 Tunnel-VReID 데이터셋에서 랭크-1 정확도 81.3%를 기록하여 다음으로 좋은 방법(PRND) 대비 13.1% 향상되었으며, 제한된 데이터에서의 강력한 일반화 능력을 입증했다.
  • 절단 실험을 통해 센터 손실의 최적 하이퍼파라미터 λ = 0.001이 성능와 안정성의 균형을 이끌어내는 데 최적임을 확인했다.
  • 정성적 결과에서는 운동 왜곡과 어두운 조명 조건에서도 정상적으로 상위 랭크의 양성 매칭을 올바르게 검색하는 것으로 나타났다.
  • 다중 순서 데이터 증강을 적용한 모델는 증강 없이 학습한 베이스라인 대비 소규모 데이터셋에서 뚜렷한 성능 향상을 보였으며, 다중 순서 학습의 必要성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.