Skip to main content
QUICK REVIEW

[논문 리뷰] DARI: Distance metric And Representation Integration for Person Verification

Guangrun Wang, Liang Lin|arXiv (Cornell University)|2016. 04. 15.
Video Surveillance and Tracking Methods참고 문헌 38인용 수 13
한 줄 요약

이 논문은 사람 재식별을 위한 엔드 투 엔드 딥 러닝 프레임워크인 DARI를 제안한다. DARI는 특징 표현과 마할라노비스 거리 메트릭을 동시에 최적화한다. 컨volutional 네트워크 내부에 요소 분해된 완전 연결층으로 마할라노비스 행렬을 통합함으로써, 백프로파게이션 기반의 동시 최적화를 가능하게 하여 CUHK03, CUHK01, iLIDS 데이터셋에서 최신 기술 수준의 성능을 달성한다. 각각 순위-1 정확도는 55.4%, 65.95%, 42.8%를 기록한다.

ABSTRACT

The past decade has witnessed the rapid development of feature representation learning and distance metric learning, whereas the two steps are often discussed separately. To explore their interaction, this work proposes an end-to-end learning framework called DARI, i.e. Distance metric And Representation Integration, and validates the effectiveness of DARI in the challenging task of person verification. Given the training images annotated with the labels, we first produce a large number of triplet units, and each one contains three images, i.e. one person and the matched/mismatch references. For each triplet unit, the distance disparity between the matched pair and the mismatched pair tends to be maximized. We solve this objective by building a deep architecture of convolutional neural networks. In particular, the Mahalanobis distance matrix is naturally factorized as one top fully-connected layer that is seamlessly integrated with other bottom layers representing the image feature. The image feature and the distance metric can be thus simultaneously optimized via the one-shot backward propagation. On several public datasets, DARI shows very promising performance on re-identifying individuals cross cameras against various challenges, and outperforms other state-of-the-art approaches.

연구 동기 및 목표

  • 사람 재식별에서 특징 표현과 거리 메트릭 학습을 별도의 단계로 다루는 데서 비롯하는 한계를 해결한다.
  • 자세, 조명, 시점 변화에 대한 강건성을 향상시키기 위해 딥 특징 학습과 메트릭 학습 간의 상호보완적 상호작용을 탐색한다.
  • 표현과 거리 메트릭을 동시에 최적화하는 엔드 투 엔드 학습 가능한 프레임워크를 개발하여 일반화 능력을 향상시킨다.
  • 마할라노비스 행렬 최적화의 계산 비용 문제를 해결하기 위해, 컨volutional 네트워크 아키텍처 내에 학습 가능한 완전 연결층으로 행렬을 요소 분해한다.
  • 피팅 조정 없이도 다양한 데이터셋에 일반화 가능함을 입증함으로써 도메인 이동에 대한 모델의 강건성을 검증한다.

제안 방법

  • 학습 이미지를 삼중체 단위로 구성하며, 각 삼중체는 기준 이미지, 동일 인물(양성) 샘플, 다른 인물(음성) 샘플로 구성된다.
  • 목표를 임베딩 공간에서 양성 쌍과 음성 쌍 간의 거리 차이를 최대화하는 것으로 정의한다.
  • 컨볼루션 네트워크 상단에 마할라노비스 거리 메트릭 행렬을 요소 분해된 완전 연결층으로 통합하여, 백프로파게이션을 통한 동시 최적화를 가능하게 한다.
  • 대규모 데이터셋에 대응하기 위해 미니배치 삼중체 샘플링을 사용한 확률적 경사 하강법을 적용한다.
  • 삼중체 수가 세제곱적으로 증가함에도 불구하고, 삼중체가 아닌 이미지 기반으로 기울기를 계산하여 계산 비용을 절감한다.
  • 과적합을 완화하고 일반화 능력을 향상시키기 위해 무작위 자르기 기반 데이터 증강을 적용한다.

실험 결과

연구 질문

  • RQ1특징 표현과 마할라노비스 거리 메트릭을 동시에 최적화하는 것이 별도의 학습 방식보다 사람 재식별 성능을 향상시킬 수 있는가?
  • RQ2학습 가능한 마할라노비스 행렬을 컨볼루션 네트워크 아키텍처에 통합할 경우 모델 성능과 학습 효율성에 어떤 영향을 미치는가?
  • RQ3제안된 엔드 투 엔드 프레임워크는 피팅 조정 없이 다양한 데이터셋에 얼마나 잘 일반화되는가?
  • RQ4데이터 증강 및 삼중체 샘플링 전략이 모델 수렴과 정확도에 어떤 영향을 미치는가?
  • RQ5특징을 고정하거나 메트릭을 고정하는 방법과 비교해 복합 최적화가 표현과 메트릭을 동시에 최적화하는 데 어떤 차이를 보이는가?

주요 결과

  • DARI는 CUHK03 데이터셋에서 순위-1 재식별 정확도 55.4%를 기록하여 새로운 최신 기술 수준을 수립한다.
  • CUHK01 데이터셋에서 DARI는 순위-1 정확도 65.95%를 달성하여 이전 최고 성능 방법보다 약 8.25%p 높은 성능을 보였다.
  • iLIDS에서의 교차 데이터셋 평가에서, DARI는 CUHK03에서 학습하고 iLIDS에서 테스트할 때 피팅 조정 없이도 순위-1 정확도 42.8%를 기록하여 강력한 일반화 능력을 입증했다.
  • 제거 실험 결과, 동시 최적화를 제거한 경우(Ours-nj) CUHK03에서 45.4%, CUHK01에서 57.7%로 성능이 떨어져 동시 학습의 중요성을 확인했다.
  • 데이터 증강 없이 학습할 경우 순위-1 정확도가 약 30% 감소하여 증강 전략이 과적합을 줄이는 데 효과적임을 입증했다.
  • 60명의 사람으로부터 4800개의 삼중체를 생성하는 삼중체 생성 전략이 단지 60개의 삼중체만 생성하는 전략보다 더 빠르게 수렴하고 더 높은 성능을 달성하여, 고밀도 삼중체 샘플링의 유용성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.