Skip to main content
QUICK REVIEW

[논문 리뷰] Spirit Distillation: A Model Compression Method with Multi-domain Knowledge Transfer

Zhiyuan Wu, Yu Jiang|arXiv (Cornell University)|2021. 04. 29.
Domain Adaptation and Few-Shot Learning참고 문헌 33인용 수 4
한 줄 요약

이 논문은 사전 훈련된 교사 네트워크에서 소형 학생 네트워크로의 교차 도메인 지식 전이를 가능하게 하는 새로운 지식 정련 프레임워크인 스피릿 정련(Spirit Distillation, SD)과 향상된 스피릿 정련(Enhanced Spirit Distillation, ESD)을 제안한다. 이는 소수의 학습 데이터에서 모델 압축과 강건성 향상을 동시에 달성한다. 교사의 전단부에서 일반적인 특징을 전이하고, 더 풍부한 특징 학습을 위해 유사 도메인을 도입함으로써 ESD는 mIOU를 1.4% 향상시키고 고정밀도 정확도를 8.2% 향상시키며, FLOPs는 41.8%로 줄였다.

ABSTRACT

Recent applications pose requirements of both cross-domain knowledge transfer and model compression to machine learning models due to insufficient training data and limited computational resources. In this paper, we propose a new knowledge distillation model, named Spirit Distillation (SD), which is a model compression method with multi-domain knowledge transfer. The compact student network mimics out a representation equivalent to the front part of the teacher network, through which the general knowledge can be transferred from the source domain (teacher) to the target domain (student). To further improve the robustness of the student, we extend SD to Enhanced Spirit Distillation (ESD) in exploiting a more comprehensive knowledge by introducing the proximity domain which is similar to the target domain for feature extraction. Results demonstrate that our method can boost mIOU and high-precision accuracy by 1.4% and 8.2% respectively with 78.2% segmentation variance, and can gain a precise compact network with only 41.8% FLOPs.

연구 동기 및 목표

  • 자원이 제한되고 데이터가 부족한 환경에서 모델 압축과 소수의 학습 데이터를 고려한 학습의 이중 과제를 해결한다.
  • 원천 도메인에서 사전 훈련된 교사 네트워크를 활용하여 목표 도메인의 학생 네트워크를 향상시킴으로써 효과적인 교차 도메인 지식 전이를 가능하게 한다.
  • 목표 도메인과 유사한 유사 도메인을 활용한 향상된 특징 학습을 통해 소형 학생 네트워크의 강건성과 일반화 능력을 향상시킨다.
  • 지식 정련과 다중 도메인 지식 전이를 통합한 단일 프레임워크를 개발하여 효율적이고 고성능의 모델 압축을 실현한다.

제안 방법

  • 스피릿 정련(SD)을 제안하며, 학생 네트워크가 교사 네트워크의 전단부와 동일한 표현을 학습함으로써 원천 도메인의 일반 지식을 전이한다.
  • 유사 도메인—목표 도메인과 유사한 데이터—을 도입하여 SD를 확장함으로써 더 포괄적인 특징 추출이 가능한 향상된 스피릿 정련(ESD)을 개발한다.
  • 중간 레이어의 표현을 전이하기 위해 특징 기반 정련을 사용하여 FLOPs를 최소화하면서도 성능 유지를 달성한다.
  • 원천 도메인(교사 통한)과 유사 도메인의 지식을 조합하여 학생 네트워크를 훈련함으로써 일반화 능력을 향상시키고 분산을 감소시킨다.
  • 유사 도메인 데이터 비율 $ r $ 를 조정함으로써 강건성과 성능 사이의 균형 조절이 가능한 훈련 과정을 최적화한다.
  • 출력 확률이 아닌 중간 특징에 지식 정련 손실을 적용함으로써 도메인 간의 구조적 및 의미적 지식을 유지한다.

실험 결과

연구 질문

  • RQ1지식 정련을 효과적으로 확장하여 교차 도메인 지식 전이를 지원하면서도 모델 압축을 달성할 수 있는가?
  • RQ2목표 도메인과 유사한 유사 도메인을 통합함으로써 소형 학생 네트워크의 강건성과 성능은 어떻게 향상되는가?
  • RQ3제한된 학습 데이터 하에서 스피릿 정련(SD)과 향상된 스피릿 정련(ESD)은 mIOU와 고정밀도 정확도를 얼마나 향상시킬 수 있는가?
  • RQ4유사 도메인 데이터 비율($ r $)을 변화시킬 경우 학생 네트워크의 세그멘테이션 분산과 강건성에 어떤 영향을 미치는가?

주요 결과

  • 스피릿 정련(SD)은 표준 훈련 대비 mIOU를 1.4% 향상시키고 고정밀도 정확도를 8.2% 향상시키며, FLOPs는 41.8%로 줄였다.
  • 향상된 스피릿 정련(ESD)은 표준 훈련 대비 세그멘테이션 분산을 21.8% 감소시키고 고정밀도 정확도를 8.2% 향상시켰다.
  • 비율 $ r = 0.5 $ 일 때 ESD는 89.2%의 고정밀도 정확도와 4.48 × 10⁻³의 분산을 달성하여 뛰어난 강건성을 입증했다.
  • 유사 도메인의 활용은 예측 일관성을 크게 향상시켜 매우 열 劣한 세그멘테이션 결과의 비율을 감소시켰다.
  • 시각적 비교 결과, ESD는 표준 훈련이나 SD만을 사용한 경우보다 그림자 및 도로 경계의 세그멘테이션 성능이 뛰어나다는 것을 보여주었다.
  • 제한된 목표 도메인 데이터 하에서도 높은 성능을 유지함으로써, 이 방법이 소수의 학습 데이터 환경에서 효과적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.