Skip to main content
QUICK REVIEW

[논문 리뷰] Masked Generative Distillation

Zhendong Yang, Zhe Li|arXiv (Cornell University)|2022. 05. 03.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 마스크된 학생 특징에서 교사의 전체 특징 맵을 재구성하도록 훈련시켜 학생 모델의 표현을 향상시키는 새로운 특징 기반 지식 정련 방법인 마스킹된 생성 정련(Masked Generative Distillation, MGD)을 제안한다. MGD는 간단한 생성 블록을 사용하여 무작위로 마스킹된 학생 특징에서 교사의 전체 특징 맵을 재구성하도록 훈련시킨다. MGD는 이미지 분류, 객체 검출, 세그멘테이션, 인스턴스 세그멘테이션 등 다양한 작업에서 최신 기술 수준(SOTA)의 성능 향상을 달성하였으며, ImageNet에서는 상위-1 정확도가 최대 1.79%p 향상되었고, 검출 및 세그멘테이션 작업에서는 mAP가 3.5점 이상 향상되었다.

ABSTRACT

Knowledge distillation has been applied to various tasks successfully. The current distillation algorithm usually improves students' performance by imitating the output of the teacher. This paper shows that teachers can also improve students' representation power by guiding students' feature recovery. From this point of view, we propose Masked Generative Distillation (MGD), which is simple: we mask random pixels of the student's feature and force it to generate the teacher's full feature through a simple block. MGD is a truly general feature-based distillation method, which can be utilized on various tasks, including image classification, object detection, semantic segmentation and instance segmentation. We experiment on different models with extensive datasets and the results show that all the students achieve excellent improvements. Notably, we boost ResNet-18 from 69.90% to 71.69% ImageNet top-1 accuracy, RetinaNet with ResNet-50 backbone from 37.4 to 41.0 Boundingbox mAP, SOLO based on ResNet-50 from 33.1 to 36.2 Mask mAP and DeepLabV3 based on ResNet-18 from 73.20 to 76.02 mIoU. Our codes are available at https://github.com/yzd-v/MGD.

연구 동기 및 목표

  • 기존 특징 기반 정련 방법이 교사 특징을 직접 모방하는 데 의존함으로써 학생의 표현 능력 향상이 최적화되지 않을 수 있는 한계를 해결하기 위해.
  • 마스킹된 입력에서 특징 재구성은 직접 모방보다 학생의 특징 표현 능력을 더 효과적으로 향상시킬 수 있는지 탐색하기 위해.
  • 분류, 검출, 세그멘테이션 등 다양한 비전 작업에 적용 가능한 단순하고 일반적인 정련 방법을 개발하기 위해.
  • 생성 재구성 목적이 학생과 교사의 특징 맵이 시각적으로 유사하지 않더라도 여전히 강건성과 성능 향상에 기여하는지 검증하기 위해.

제안 방법

  • 훈련 중에 학생의 특징 맵에서 무작위로 픽셀을 마스킹하여 재구성에 사용할 마스킹된 입력을 생성한다.
  • 마스킹된 학생 특징에서 교사의 전체 특징 맵을 재구성하도록 경량의 생성 블록(ReLU 활성화 함수를 갖는 두 개의 3×3 컨볼루션 레이어)을 훈련시킨다.
  • 생성된 특징 맵과 진짜 교사 특징 맵 간의 L2 차이를 최소화하는 재구성 손실을 사용한다.
  • 표준 정련 목표(예: 교차 엔트로피 또는 검출 헤드)와 MGD 손실을 함께 최적화하기 위해 통합한다.
  • 네트워크의 다양한 단계에 적용하며, 특히 더 깊은, 더 의미적인 레이어에서 최적의 성능를 관찰했다.
  • 손실 균형 계수 α와 마스킹 비율 λ라는 두 가지 하이퍼파라미터를 튜닝하였으며, 분석 실험에서 최소한의 민감도를 보였다.

실험 결과

연구 질문

  • RQ1학생 모델이 교사의 전체 특징을 마스킹된 입력에서 재구성하는 방식으로 표현 학습을 더 잘할 수 있는가, 아니면 교사 특징을 직접 모방하는 방식보다 더 나은가?
  • RQ2학생과 교사의 특징 맵이 시각적으로 다를 때조차도 생성 재구성 목적이 성능 향상에 기여하는가?
  • RQ3MGD는 이미지 분류, 객체 검출, 그리고 고밀도 예측 작업을 포함한 다양한 비전 작업에서 어떻게 성능을 내는가?
  • RQ4MGD의 생성 블록과 마스킹 비율에 최적의 아키텍처 및 하이퍼파라미터 설정은 무엇인가?
  • RQ5더 깊은 네트워크 단계에서 정련을 수행하면 浅층 단계보다 더 큰 성능 향상이 이루어지는가?

주요 결과

  • MGD는 ResNet-18의 ImageNet 상위-1 정확도를 69.90%에서 71.69%로 향상시켜 1.79%p 향상되었다.
  • 객체 검출 작업에서 ResNet-50 백본을 사용한 RetinaNet은 mAP를 37.4에서 41.0으로 3.6점 향상시켰다.
  • ResNet-50 백본을 사용한 SOLO는 마스크 mAP를 33.1에서 36.2로 3.1점 향상시켰다.
  • ResNet-18 백본을 사용한 DeepLabV3는 ADE20K에서 mIoU를 73.20%에서 76.02%로 향상시켰다.
  • 학생과 교사의 특징 맵이 시각적으로 다를 때조차도, MGD는 FGD나 KR과 같은 최신 기술 수준의 특징 기반 정련 방법보다 뛰어난 성능을 보였다.
  • 하이퍼파라미터 설정에 대해 강건하며, 특히 마스킹 비율 λ에 대해 최적의 성능는 중간 수준의 값(λ < 0.5)에서 관찰되었고, 손실 균형 계수 α에 대해서도 최소한의 민감도를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.