Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Training of Very Deep Neural Networks for Supervised Hashing

Ziming Zhang, Yuting Chen|arXiv (Cornell University)|2015. 11. 14.
Advanced Image and Video Retrieval Techniques참고 문헌 54인용 수 7
한 줄 요약

이 논문은 감독 학습 히싱을 위한 매우 깊은 신경망(최대 64층, 1층당 1024개 노드)의 효율적 훈련을 가능하게 하는 새로운 ADMM 기반 훈련 알고리즘인 Very Deep Supervised Hashing(VDSH)을 제안한다. 역전파와는 달리, VDSH는 보조 변수를 통해 각 층의 독립적인 업데이트를 가능하게 하여 선형 계산 복잡도를 달성하고, 단일 GPU에서 약 3시간 내에 수렴한다. 이는 MNIST, CIFAR-10, NUS-WIDE에서 최신 기법들을 능가한다.

ABSTRACT

In this paper, we propose training very deep neural networks (DNNs) for supervised learning of hash codes. Existing methods in this context train relatively "shallow" networks limited by the issues arising in back propagation (e.e. vanishing gradients) as well as computational efficiency. We propose a novel and efficient training algorithm inspired by alternating direction method of multipliers (ADMM) that overcomes some of these limitations. Our method decomposes the training process into independent layer-wise local updates through auxiliary variables. Empirically we observe that our training algorithm always converges and its computational complexity is linearly proportional to the number of edges in the networks. Empirically we manage to train DNNs with 64 hidden layers and 1024 nodes per layer for supervised hashing in about 3 hours using a single GPU. Our proposed very deep supervised hashing (VDSH) method significantly outperforms the state-of-the-art on several benchmark datasets.

연구 동기 및 목표

  • 감독 학습 히싱을 위한 매우 깊은 네트워크 훈련 시 기울기 소실과 계산 비효율성 문제를 해결하기 위해.
  • 단일 GPU를 사용하여 최대 64개의 은닉층과 1층당 1024개의 노드를 가진 깊은 네트워크의 훈련을 가능하게 하기 위해.
  • 특히 매우 깊은 아키텍처에서도 안정적이고 신속하게 수렴하는 계산적으로 효율적인 훈련 알고리즘 개발을 위해.
  • 유사성 유지 특징 표현을 통해 해시 코드 품질을 향상시켜 검색 성능을 향상시키기 위해.
  • VDSH가 기존의 감독 학습 히싱 기법들보다 벤치마크 데이터셋에서 뛰어난 성능을 보임을 입증하기 위해.

제안 방법

  • VDSH의 훈련을 ℓ₂ 정규화 최소제곱 문제로 공식화하여, 인코딩된 특징과 레이블 벡터 간의 차이를 최소화한다.
  • 각 은닉층의 출력을 나타내는 보조 변수를 도입함으로써 깊은 네트워크 특징의 순차적 모델링을 가능하게 한다.
  • 등등식 제약 조건을 최적화에 통합하기 위해 확장된 라그랑주 승수를 사용하며, 이로 인해 국소적 층별 업데이트로 분해할 수 있다.
  • 이웃한 층 간의 가중치를 저장하기 위해 추가 보조 변수를 도입하여, 독립적이고 효율적인 국소 최적화를 가능하게 한다.
  • ADMM 기반 알고리즘은 네트워크 파라미터, 보조 변수, 이중 변수를 번갈아 업데이트하며 수렴을 보장한다.
  • 해시 코드는 최종 은닉층의 출력을 반올림하여 생성되며, 해밍 공간에서 유사성을 유지한다.

실험 결과

연구 질문

  • RQ1기울기 소실과 계산 병목 현상 문제를 해결하면서, 매우 깊은 신경망을 위한 감독 학습 히싱을 위한 효율적인 훈련 알고리즘을 설계할 수 있는가?
  • RQ2ADMM 기반 접근법이 매우 깊은 네트워크의 히싱 훈련에서 안정적이고 신속한 수렴을 가능하게 하는가?
  • RQ3VDSH가 매우 깊은 아키텍처를 사용하여 벤치마크 데이터셋에서 최신 성능을 달성할 수 있는가?
  • RQ4VDSH의 계산 복잡도는 백프로파게이션 대비 네트워크 깊이와 너비에 따라 어떻게 변화하는가?
  • RQ5기존 방법들과 비교해 VDSH는 더 컴팩트하고 잘 분리된 해시 코드 클러스터를 생성하는가?

주요 결과

  • VDSH는 단일 GTX TITAN GPU를 사용하여 약 3시간 내에 64층, 1층당 1024개 노드를 가진 깊은 신경망을 감독 학습 히싱에 성공적으로 훈련시켰다.
  • 훈련 알고리즘이 매끄럽게 수렴하며, 네트워크의 간선 수에 비례하는 선형 계산 복잡도를 보였다.
  • 190K개 샘플로 구성된 데이터베이스에서 128노드, 32층 네트워크를 사용한 NUS-WIDE 데이터셋에서 VDSH는 샘플당 31.4밀리초 내에 검색을 수행했다.
  • ILSVRC2012에서 64비트 해시 코드를 사용하고 해밍 반경 2 이내에서 VDSH는 정밀도 7.73%와 재현율 4.82%를 달성했으며, 이는 SDH(2.67% 정밀도)와 FastHash(0.29% 정밀도)를 크게 능가하는 성능이었다.
  • 시각화 결과 VDSH는 SDH보다 더 깔끔하고 컴팩트한 클러스터를 생성하여, 더 우수한 유사성 유지 성능을 보였다.
  • VDSH는 다양한 해밍 반경에서 뛰어난 성능을 유지하며 안정성과 강건성을 보였고, 반면 SDH와 FastHash는 작은 반경에서 성능이 크게 떨어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.