Skip to main content
QUICK REVIEW

[논문 리뷰] Shapeshifter Networks: Cross-layer Parameter Sharing for Scalable and Effective Deep Learning

Bryan A. Plummer, Nikoli Dryden|arXiv (Cornell University)|2020. 06. 18.
Multimodal Machine Learning Applications참고 문헌 47인용 수 8
한 줄 요약

Shapeshifter Networks (SSNs)는 이질적인 레이어 간에 동적으로 최적의 파라미터 그룹화를 학습하는 크로스 레이어 파라미터 공유 프레임워크를 도입하여, 상당한 모델 압축과 향상된 일반화를 가능하게 한다. 서로 다른 크기, 연산, 모odalities를 가진 레이어에 공유된 가중치를 매핑함으로써 SSNs는 표준 모델 파라미터의 최소 1%로도 최신 기술 수준의 성능을 달성한다.

ABSTRACT

We present Shapeshifter Networks (SSNs), a flexible neural network framework that improves performance and reduces memory requirements on a diverse set of scenarios over standard neural networks. Our approach is based on the observation that many neural networks are severely overparameterized, resulting in significant waste in computational resources as well as being susceptible to overfitting. SSNs address this by learning where and how to share parameters between layers in a neural network while avoiding degenerate solutions that result in underfitting. Specifically, we automatically construct parameter groups that identify where parameter sharing is most beneficial. Then, we map each group's weights to construct layers with learned combinations of candidates from a shared parameter pool. SSNs can share parameters across layers even when they have different sizes, perform different operations, and/or operate on features from different modalities. We evaluate our approach on a diverse set of tasks, including image classification, bidirectional image-sentence retrieval, and phrase grounding, creating high performing models even when using as little as 1% of the parameters. We also apply SSNs to knowledge distillation, where we obtain state-of-the-art results when combined with traditional distillation methods.

연구 동기 및 목표

  • 과도하게 파rameter화된 딥 뉴럴 네트워크가 낭비되는 계산과 과적합을 초래하는 문제를 해결하기 위해.
  • 다양한 아키텍처, 크기, 모달리티를 가진 레이어 간에 효과적인 파라미터 공유를 가능하게 하는 방법을 개발하기 위해.
  • 과적합을 유도하는 열화된 해를 초래하는 파라미터 그룹화를 방지하고 유익한 그룹화를 자동으로 학습하기 위해.
  • 다양한 작업에서 성능을 유지하거나 향상시키면서 모델 크기를 크게 줄이기 위해.
  • 파라미터 공유를 통합함으로써 지식 증류를 향상시켜 학생 모델의 효율성과 정확도를 향상시키기 위해.

제안 방법

  • SSNs는 파라미터 공유가 가장 유익한 곳을 레이어 전반에 걸쳐 동적으로 학습하는 파라미터 그룹을 학습한다.
  • 공유된 파라미터 풀이 구성되며, 이로부터 학습된 그룹화 기반으로 가중치가 개별 레이어에 매핑된다.
  • 프레임워크는 서로 다른 크기, 연산, 입력 모달리티(예: 시각 및 언어 특징)를 가진 레이어 간의 파라미터 공유를 지원한다.
  • 공유된 가중치를 레이어 전용 파라미터로 매핑하는 방법을 학습하기 위해 미분 가능한 메커니즘이 사용되며, 이는 엔드 투 엔드 학습을 가능하게 한다.
  • 대표성 능력을 유지하기 위해 정규화 및 아키텍처 제약 조건을 통해 열화된 해를 방지한다.
  • SSNs는 지식 증류 파ipelines에 통합되어 파라미터 공유와 지식 전이를 결합함으로써 향상된 학생 모델을 달성한다.

실험 결과

연구 질문

  • RQ1크기와 연산이 다른 이질적인 레이어 간에 효과적으로 파라미터 공유를 학습할 수 있는가?
  • RQ2성능을 저하시키지 않고 다양한 모달리티(예: 시각 및 언어) 간에 파라미터 공유를 적용할 수 있는가?
  • RQ3동적 파라미터 공유가 모델 크기를 최대 99%까지 줄일 수 있으며, 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ4제안된 방법이 과도하게 파rameter화된 환경에서 과적합을 유도하는 열화된 해를 방지하는가?
  • RQ5SSNs는 지식 증류를 향상시켜 압축된 모델 훈련에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • SSNs는 표준 모델의 파라미터의 최소 1%만을 사용하여 이미지 분류, 양방향 이미지-문장 검색, 어휘 기반 지정 등에서 최신 기술 수준의 성능을 달성한다.
  • 이 프레임워크는 크기, 연산, 모달리티가 다른 레이어 간에 효과적인 파라미터 공유를 가능하게 하며, 시각 및 언어 특징을 포함한다.
  • SSNs는 모델 크기를 최대 99%까지 줄이며, 표준 모델과 비교해도 경쟁력 있거나 뛰어난 정확도를 유지한다.
  • 지식 증류와 결합했을 때 SSNs는 최신 기술 수준의 결과를 달성하여 효율성과 성능 향상을 입증한다.
  • 학습된 파라미터 그룹화를 통해 열화된 해를 성공적으로 방지하며, 모델 용량과 일반화 능력을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.