Skip to main content
QUICK REVIEW

[논문 리뷰] Siamese Capsule Networks

James O’ Neill|arXiv (Cornell University)|2018. 05. 18.
Face recognition and analysis참고 문헌 25인용 수 16
한 줄 요약

이 논문은 $€$2-정규화된 캡슐 포즈 특징과 대비 손실을 활용하여 캡슐 네트워크를 쌍별 학습 작업, 예를 들어 얼굴 인식에 확장하는 새로운 아키텍처인 시앙세이 캡슐 네트워크(Siamese Capsule Networks, SCN)를 소개한다. SCN은 소수의 샘플이 있는 경우에도 최신 기술 수준의 성능을 달성하며, 특히 새로운 주제에 대한 테스트에서 AlexNet과 ResNet-34와 같은 강력한 기준 모델보다 25% 적은 파라미터로도 슈퍼리아이어 성능을 기록한다.

ABSTRACT

Capsule Networks have shown encouraging results on extit{defacto} benchmark computer vision datasets such as MNIST, CIFAR and smallNORB. Although, they are yet to be tested on tasks where (1) the entities detected inherently have more complex internal representations and (2) there are very few instances per class to learn from and (3) where point-wise classification is not suitable. Hence, this paper carries out experiments on face verification in both controlled and uncontrolled settings that together address these points. In doing so we introduce extit{Siamese Capsule Networks}, a new variant that can be used for pairwise learning tasks. The model is trained using contrastive loss with $\ell_2$-normalized capsule encoded pose features. We find that extit{Siamese Capsule Networks} perform well against strong baselines on both pairwise learning datasets, yielding best results in the few-shot learning setting where image pairs in the test set contain unseen subjects.

연구 동기 및 목표

  • 클래스당 샘플 수가 적은 소수의 샘플 학습 및 쌍별 학습 환경에서 표준 캡슐 네트워크의 한계를 해결하기 위해.
  • 표준 이미지 분류가 아닌, 전체 엔티티 간의 관계 학습이 필요한 작업, 예를 들어 얼굴 인식과 같은 작업에 캡슐 네트워크를 확장하기 위해.
  • 통제된 조건과 비통제된 조건에서 모두 복잡한 실제 얼굴 인식 작업에 캡슐 네트워크를 평가하기 위해.
  • 낮은 데이터 환경에서 캡슐 기반 표현이 공간적 관계와 시점 불변성을 얼마나 잘 유지하는지 입증하기 위해.

제안 방법

  • 동일한 가중치를 공유하는 이중 브랜치 아키텍처인 시앙세이 캡슐 네트워크(SCN)를 제안하여 이미지 쌍을 병렬로 처리하고 공동 임베딩을 학습한다.
  • 공간적 관계와 시점 정보를 유지하기 위해 $€$2-정규화된 캡슐 인코딩된 포즈 벡터를 특징 표현으로 사용한다.
  • 이미지 쌍 간의 내부 클래스 간격을 최소화하고 외부 클래스 간격을 최대화하기 위해 대비 손실을 사용하여 모델을 훈련한다.
  • 반복적인 동적 라우팅을 통해 캡슐 간의 일치를 계산하여 부분-전체 관계와 이동 등변성을 가능하게 한다.
  • 훈련 손실 분산을 줄이고 수렴을 향상시키기 위해 초기 합성곱 레이어에 배치 정규화를 적용한다.
  • 성능 최적화를 위해 유클리드 거리, 맨하탄 거리 등의 거리 측정법과 다양한 손실 변형(이중 마진 포함)을 평가한다.

실험 결과

연구 질문

  • RQ1표준 분류가 실패하는 쌍별 학습 작업, 예를 들어 얼굴 인식과 같은 작업에 캡슐 네트워크가 효과적으로 일반화될 수 있는가?
  • RQ2테스트 시 새로운 주제에 대해 소수의 샘플 학습 환경에서 시앙세이 캡슐 네트워크의 성능은 어떠한가?
  • RQ3표준 CNN에 비해 $€$2-정규화된 캡슐 포즈 특징 사용이 일반화 및 강건성 향상에 기여하는가?
  • RQ4낮은 데이터 환경에서 캡슐 특징과 함께 사용하는 대비 손실이 표준 크로스 엔트로피 손실보다 어떻게 비교되는가?

주요 결과

  • 소수의 샘플 학습 환경에서 AT&T 데이터셋에서 SCN은 특히 새로운 주제에 대해 테스트했을 때 최고의 성능을 기록했다.
  • 라벨이 부여된 얼굴들(Labeled Faces in the Wild, LFW) 데이터셋에서는 SCN이 AlexNet과 ResNet-34와 동일하거나 뛰어난 성능을 보였으며, 파라미터 수가 25% 적었다.
  • AT&T 데이터셋에서 SCN은 맨하탄 거리 사용 시 더 빠른 수렴을 보였고, 배치 정규화를 사용할 경우 손실 분산이 감소했다.
  • 대비 손실과 $€$2-정규화된 특징을 조합하면 다른 모델 대비 예측 분산이 낮고, 양성 쌍 매칭 정밀도가 높아졌다.
  • 이중 마진 사용은 표준 SCN의 LFW 성능을 향상시켰지만, 콘crete 드롭아웃과 조합할 경우 약간의 성능 저하를 초래했다.
  • 파라미터 수가 적음에도 불구하고, 훈련 중 반복적인 라우팅 연산으로 인해 CNN보다 느렸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.