Skip to main content
QUICK REVIEW

[논문 리뷰] Correlation Congruence for Knowledge Distillation

Baoyun Peng, Jin Xiao|arXiv (Cornell University)|2019. 04. 03.
Domain Adaptation and Few-Shot Learning참고 문헌 39인용 수 3
한 줄 요약

이 논문은 Correlation Congruence Knowledge Distillation (CCKD)라는 새로운 지식 증류 프레임워크를 제안한다. 이 프레임워크는 교사에서 학생으로의 인스턴스 수준 지식과 인스턴스 간 상관관계를 모두 전달하여 학생 네트워크 성능을 향상시킨다. 타일러 급수 전개를 활용한 커널 방법을 통해 상관관계를 모델링하고 미니배치 샘플링 전략을 최적화함으로써, CCKD는 이미지 분류 및 메트릭 학습 벤치마크에서 최신 기술(SOTA) 성능을 달성하며, 표준 KD 및 이전 SOTA 방법을 능가한다.

ABSTRACT

Most teacher-student frameworks based on knowledge distillation (KD) depend on a strong congruent constraint on instance level. However, they usually ignore the correlation between multiple instances, which is also valuable for knowledge transfer. In this work, we propose a new framework named correlation congruence for knowledge distillation (CCKD), which transfers not only the instance-level information, but also the correlation between instances. Furthermore, a generalized kernel method based on Taylor series expansion is proposed to better capture the correlation between instances. Empirical experiments and ablation studies on image classification tasks (including CIFAR-100, ImageNet-1K) and metric learning tasks (including ReID and Face Recognition) show that the proposed CCKD substantially outperforms the original KD and achieves state-of-the-art accuracy compared with other SOTA KD-based methods. The CCKD can be easily deployed in the majority of the teacher-student framework such as KD and hint-based learning methods.

연구 동기 및 목표

  • 기존 지식 증류 방법이 인스턴스 수준의 일치성에만 초점을 맞추고 인스턴스 간 상관관계를 忽시하는 한계를 해결하기 위해.
  • 교사의 임bedding 공간의 내부 클래스 응집성과 외부 클래스 분리성을 유지함으로써 학생 네트워크의 일반화 성능을 향상시키기 위해.
  • 미니배치 내 인스턴스 간 복잡한 상관관계를 포괄하는 일반화된 커널 기반 방법을 개발하기 위해.
  • 상관관계 지식 전달을 향상시키는 데 효과적인 미니배치 샘플링 전략을 탐색하기 위해.
  • 이질적인 비전 작업, 즉 이미지 분류 및 메트릭 학습을 포함한 다양한 비전 작업에서 CCKD의 유효성을 검증하기 위해.

제안 방법

  • 교사와 학생 네트워크 간 인스턴스 수준과 상관관계 수준의 지식 전달을 동시에 최적화하는 Correlation Congruence Knowledge Distillation (CCKD)를 도입한다.
  • 일반화된 커널 방법을 사용하여 가우시안 RBF 커널의 타일러 급수 전개를 기반으로 하여 미니배치 내 인스턴스 간 고차원 상관관계를 모델링하고 포착한다.
  • 교사 및 학생 네트워크의 임베딩 공간을 일치시키기 위해 동일한 차원을 가진 완전 연결층을 적용함으로써 직접적인 상관관계 비교를 가능하게 한다.
  • 내부 클래스와 외부 클래스 상관관계 학습을 균형 있게 하기 위해 두 가지 새로운 미니배치 샘플링 전략—클래스 균형 무작위 샘플러(CUR-sampler)와 슈퍼클래스 균형 무작위 샘플러(SUR-sampler)—를 제안한다.
  • 코사인 유사도 히트맵을 활용하여 학생의 특징 공간 내에서 내부 클래스 응집성과 외부 클래스 분리성의 시각화 및 분석을 수행한다.
  • 표준 지식 증류 손실과 커널화된 상관관계 행렬에서 유도된 상관관계 일치 손실을 포함하는 병합 손실 함수를 사용하여 학생 네트워크를 훈련시킨다.

실험 결과

연구 질문

  • RQ1임베딩 공간 내 인스턴스 간 상관관계를 유지하면 인스턴스 수준의 모방을 넘어서 지식 증류 성능 향상이 가능할까?
  • RQ2커널 방법에서 타일러 급수 전개의 차수는 고차원 상관관계 모델링과 최종 성능에 어떤 영향을 미치는가?
  • RQ3다양한 미니배치 샘플링 전략은 상관관계 지식 전달의 품질에 어떤 영향을 미치는가?
  • RQ4CCKD는 학생 네트워크의 임베딩 공간에서 더 강한 내부 클래스 응집성과 분리된 외부 클래스 표현을 유도하는가?
  • RQ5다양한 비전 작업에서 CCKD는 최신 기술(SOTA) 지식 증류 방법과 비교해 어떻게 성능을 내는가?

주요 결과

  • CCKD는 CIFAR-100에서 최신 기술 성능을 달성하였으며, 표준 KD보다 상위-1 정확도에서 1.3% 향상되었고, 다른 SOTA 방법을 능가하였다.
  • ImageNet-1K에서 CCKD는 표준 KD보다 상위-1 정확도를 1.1% 향상시켰으며, ResNet-18를 사용해 74.5%의 상위-1 정확도를 기록하였다.
  • MSMT17 ReID 벤치마크에서 CCKD는 ResNet-18를 사용해 순위-1 정확도 59.6%와 mAP 31.1%를 달성하였으며, 표준 KD 및 다른 SOTA 방법을 크게 능가하였다.
  • 가우시안 RBF 커널의 3차 타일러 급수 전개가 가장 우수한 성능을 보였으며, 1차 전개보다는 0.7% 향상되고 2차 전개보다는 0.3% 향상되었다.
  • k=4인 SUR-sampler가 가장 높은 성능(순위-1 59.6%, mAP 31.1%)을 기록하였으며, 유사한 설정에서 UR-sampler 및 CUR-sampler를 모두 능가하였다.
  • 시각화 결과 CCKD는 표준 KD보다 학생의 임베딩 공간에서 훨씬 높은 내부 클래스 코사인 유사도를 보였으며, 이는 학생의 내부 클래스 응집성이 더 강하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.