Skip to main content
QUICK REVIEW

[논문 리뷰] Fast Training of Triplet-based Deep Binary Embedding Networks

Bohan Zhuang, Guosheng Lin|arXiv (Cornell University)|2016. 03. 09.
Advanced Image and Video Retrieval Techniques참고 문헌 37인용 수 6
한 줄 요약

이 논문은 삼중항 기반 딥 이진 해싱의 훈련을 가속화하기 위해 이진 코드 추론을 딥 네트워크 훈련에서 분리하는 이단계 프레임워크를 제안한다. 고차수 삼중항 손실을 그래프 컷을 통해 해결할 수 있는 이진 이차계획문제(BQP)로 공식화한 후, 유추된 코드에 대해 점진적으로 딥 컨volution 네트워크(CNN)를 훈련시켜, 이전 방법 대비 최대 100배 빠른 훈련 속도를 달성하면서 CASIA 및 IJB-A를 포함한 벤치마크 데이터셋에서 최신 기술 수준의 검색 정확도를 유지하거나 초월한다.

ABSTRACT

In this paper, we aim to learn a mapping (or embedding) from images to a compact binary space in which Hamming distances correspond to a ranking measure for the image retrieval task. We make use of a triplet loss because this has been shown to be most effective for ranking problems. However, training in previous works can be prohibitively expensive due to the fact that optimization is directly performed on the triplet space, where the number of possible triplets for training is cubic in the number of training examples. To address this issue, we propose to formulate high-order binary codes learning as a multi-label classification problem by explicitly separating learning into two interleaved stages. To solve the first stage, we design a large-scale high-order binary codes inference algorithm to reduce the high-order objective to a standard binary quadratic problem such that graph cuts can be used to efficiently infer the binary code which serve as the label of each training datum. In the second stage we propose to map the original image to compact binary codes via carefully designed deep convolutional neural networks (CNNs) and the hashing function fitting can be solved by training binary CNN classifiers. An incremental/interleaved optimization strategy is proffered to ensure that these two steps are interactive with each other during training for better accuracy. We conduct experiments on several benchmark datasets, which demonstrate both improved training time (by as much as two orders of magnitude) as well as producing state-of-the-art hashing for various retrieval tasks.

연구 동기 및 목표

  • 훈련 데이터 크기에 따라 세제곱적으로 증가하는 삼중항 기반 딥 이진 해싱의 훈련 비용이 지나치게 높다는 문제를 해결하기 위해.
  • 랭킹 성능을 희생시키지 않고 대규모 훈련을 효율적으로 수행할 수 있도록 하기 위해.
  • 이진 코드 추론과 딥 특징 학습을 분리하여 계산 효율성을 향상시키는 확장 가능한 프레임워크를 개발하기 위해.
  • 훈련 시간을 수십 배에서 수백 배 감소시키면서도 높은 검색 정확도를 유지하기 위해.
  • 점진적 최적화가 코드 품질과 모델 성능 향상에 기여하는지 검증하기 위해.

제안 방법

  • 삼중항 기반 랭킹 손실을 고차수 이진 추론 문제로 공식화하여, 효율적인 최적화를 위한 이차이차계획문제(BQP)로 변환한다.
  • 블록좌표강하와 함께 그래프 컷을 사용해 BQP를 해결함으로써, 삼중항 제약 조건에서 이진 코드를 스케일러블하게 추론할 수 있도록 한다.
  • 이미지에서 압축된 이진 코드로 매핑하는 딥 컨volution 네트워크(CNN)를 설계하고, 유추된 코드에 기반한 이진 분류를 통해 훈련한다.
  • 이진 코드와 딥 해시 함수가 상호작용적으로 업데이트되는 점진적이고 교차 최적화 전략을 적용하여 상호 성능을 향상시킨다.
  • 특징 초기화를 위해 VGG-16에 대한 지도 미세조정을 수행한 후, 제안된 이단계 프레임워크를 통해 훈련을 진행한다.
  • 얼굴 검색 실험에서 강인성과 차원 축소를 위해 데이터 증강(수평 반전)과 주성분 분석(PCA)을 적용한다.

실험 결과

연구 질문

  • RQ1고차수 삼중항 기반 손실 함수는 대규모 이진 코드 학습에 대해 효율적으로 최적화될 수 있는가?
  • RQ2딥 네트워크 훈련에서 이진 코드 추론을 분리함으로써 훈련 시간을 크게 줄일 수 있을까? 이로 인해 검색 정확도가 떨어지지 않는가?
  • RQ3코드 추론과 딥 특징 학습 간의 점진적 최적화가 코드 품질과 모델 성능 향상에 기여하는가?
  • RQ4대규모 벤치마크에서 제안된 방법은 최신 기술 수준의 해싱 방법과 비교해 속도와 검색 정확도 측면에서 어떻게 성능을 내는가?
  • RQ5단일 딥 모델을 사용하면서도 128비트 이진 코드만으로도 경쟁 가능한 성능을 달성할 수 있는가?

주요 결과

  • 제안된 방법은 기존의 삼중항 기반 방법들인 FaceNet 대비 최대 100배 빠른 훈련 속도를 달성하여, 훈련 시간을 수개월에서 수일로 단축시켰다.
  • IJB-A 얼굴 검색 벤치마크에서 128비트에서 CMC@1 정확도가 0.645±0.058를 기록하며 기존 최신 기술 수준의 방법들을 능가했다.
  • 128비트 코드를 사용할 때 LFW 데이터셋에서 평균 평균 정밀도(Mean Average Precision)가 0.889±0.020를 기록하여 뛰어난 검색 성능를 입증했다.
  • 점진적 학습에서 그룹 길이가 작을수록 더 높은 검색 정확도를 기록하여, 상호작용적인 최적화 전략의 효과를 확인했다.
  • 사전 훈련된 VGG-16 모델만으로도 LFW 검증에서 97.03%±0.98%의 정확도를 기록하여, 해싱 이전에 매우 강력한 기준 성능을 확보했다.
  • 단일 딥 모델을 사용함으로써 128비트 이진 코드만으로도 고속의 얼굴 검색을 가능하게 하였으며, 고속과 낮은 스토리지 요구량을 동시에 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.