Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Student Networks via Feature Embedding

Hanting Chen, Yunhe Wang|arXiv (Cornell University)|2018. 12. 17.
Advanced Neural Network Applications참고 문헌 31인용 수 6
한 줄 요약

이 논문은 국소성 유지 손실을 사용한 특성 임bedding를 통해 교사 네트워크의 지식을 학생 네트워크로 전이하는 지식 정련 방법을 제안한다. 이로 인해 추가 파라미터가 필요로 하지 않으며, 저차원 특성 공간에서의 샘플 간 관계를 유지함으로써 계산 및 저장 복잡도를 크게 낮추면서도 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Deep convolutional neural networks have been widely used in numerous applications, but their demanding storage and computational resource requirements prevent their applications on mobile devices. Knowledge distillation aims to optimize a portable student network by taking the knowledge from a well-trained heavy teacher network. Traditional teacher-student based methods used to rely on additional fully-connected layers to bridge intermediate layers of teacher and student networks, which brings in a large number of auxiliary parameters. In contrast, this paper aims to propagate information from teacher to student without introducing new variables which need to be optimized. We regard the teacher-student paradigm from a new perspective of feature embedding. By introducing the locality preserving loss, the student network is encouraged to generate the low-dimensional features which could inherit intrinsic properties of their corresponding high-dimensional features from teacher network. The resulting portable network thus can naturally maintain the performance as that of the teacher network. Theoretical analysis is provided to justify the lower computation complexity of the proposed method. Experiments on benchmark datasets and well-trained networks suggest that the proposed algorithm is superior to state-of-the-art teacher-student learning methods in terms of computational and storage complexity.

연구 동기 및 목표

  • 특성 정렬을 위해 추가적인 완전 연결 층을 필요로 하는 지식 정련 방법의 높은 계산 및 저장 비용 문제를 해결하기 위해.
  • 교사 네트워크의 고차원 특성 공간에서의 샘플 간 내재적 관계를 압축된 저차원 학생 네트워크로 전이할 때 유지하기 위해.
  • 성능을 유지하면서 복잡성을 줄이는 파라미터 없는 지식 정련 프레임워크를 개발하기 위해.
  • 국소성 유지 손실을 통한 특성 임bedding가 효율적이고 고성능인 학생 네트워크 압축을 가능하게 함을 보여주기 위해.

제안 방법

  • 이 방법은 지식 정련을 고차원 교사 특성에서 저차원 학생 특성로 매핑하는 특성 임bedding 작업으로 간주한다.
  • 샘플 간 상대적 관계가 임베딩된 공간에서 유지되도록 보장하기 위해 국소성 유지 손실을 도입한다.
  • 손실 함수는 학생 네트워크가 교사의 특성 표현에서 국소적 이웃 구조를 유지하도록 유도한다.
  • 임베딩을 통해 중간 특성을 직접 정렬함으로써 보조 파라미터를 도입하지 않아 계산 및 메모리 오버헤드를 감소시킨다.
  • 기존의 추가 완전 연결 층을 사용하는 방법보다 계산 복잡도가 낮다는 것을 이론적으로 입증한다.
  • 학습은 표준 역전파 알고리즘을 사용하여 엔드 투 엔드로 수행되며, 국소성 유지 손실이 정규화 요소로 작용한다.

실험 결과

연구 질문

  • RQ1완전 연결 층과 같은 추가 파라미터 없이 지식 정련을 달성할 수 있는가?
  • RQ2교사 네트워크의 특성 표현에서 내재된 기하학적 구조가 압축된 학생 네트워크로 어떻게 유지될 수 있는가?
  • RQ3특성 공간에서 국소적 이웃 관계를 유지하면 학생 네트워크의 일반화 및 성능 향상에 기여하는가?
  • RQ4정확도, 계산 및 메모리 효율성 측면에서 제안된 방법은 최신 기술 수준의 지식 정련 기법과 어떻게 비교되는가?
  • RQ5중간 레이어 선택이 제안된 방법의 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 ImageNet에서 93.13%의 Top-5 정확도를 달성하여 표준 역전파 기반 베이스라인(92.18%)과 다른 최신 기술 수준의 방법들을 능가했다.
  • CIFAR-10에서 이 방법은 92.89%의 Top-1 정확도를 기록하여 기존의 지식 정련 기법들을 초월했다.
  • 지식 전달을 위해 추가 파라미터가 전혀 필요로 하지 않았으며, FitNet는 약 5,035M의 추가 파라미터가 필요로 했다.
  • 이론적 분석을 통해 제안된 방법이 보조 완전 연결 층을 사용하는 방법보다 계산 복잡도가 낮다는 것이 확인되었다.
  • 실험 결과, 다양한 레이어 조합 간 정확도 변동이 0.2% 미만으로 매우 낮게 유지되어 레이어 선택에 대해 성능이 강건함을 입증했다.
  • 국소성 유지 손실을 사용해 훈련된 학생 네트워크는 모델 크기와 추론 비용을 크게 줄였음에도 불구하고 높은 성능을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.