Skip to main content
QUICK REVIEW

[논문 리뷰] Sampling to Distill: Knowledge Transfer from Open-World Data

Yuzheng Wang, Zhaoyu Chen|arXiv (Cornell University)|2023. 07. 31.
Domain Adaptation and Few-Shot LearningComputer Science인용 수 3
한 줄 요약

이 논문은 데이터 생성 모듈을 비용이 많이 들지 않게 하기 위해 개방형 세계의 레이블이 없는 데이터를 적응형 샘플링 모듈을 사용해 원래 데이터 분포에 가까이 샘플링하고, 낮은 노이즈, 대비 구조적 지식을 활용하여 도메인 이탈을 줄이고 샘플 간 관계를 활용함으로써 비생성적 지식 정련(ODSD)을 제안한다. ODSD는 기존 방법 대비 ImageNet 성능을 1.50%~9.59% 향상시켜 최신 기준 성능을 달성한다.

ABSTRACT

Data-Free Knowledge Distillation (DFKD) is a novel task that aims to train high-performance student models using only the pre-trained teacher network without original training data. Most of the existing DFKD methods rely heavily on additional generation modules to synthesize the substitution data resulting in high computational costs and ignoring the massive amounts of easily accessible, low-cost, unlabeled open-world data. Meanwhile, existing methods ignore the domain shift issue between the substitution data and the original data, resulting in knowledge from teachers not always trustworthy and structured knowledge from data becoming a crucial supplement. To tackle the issue, we propose a novel Open-world Data Sampling Distillation (ODSD) method for the DFKD task without the redundant generation process. First, we try to sample open-world data close to the original data's distribution by an adaptive sampling module and introduce a low-noise representation to alleviate the domain shift issue. Then, we build structured relationships of multiple data examples to exploit data knowledge through the student model itself and the teacher's structured representation. Extensive experiments on CIFAR-10, CIFAR-100, NYUv2, and ImageNet show that our ODSD method achieves state-of-the-art performance with lower FLOPs and parameters. Especially, we improve 1.50\%-9.59\% accuracy on the ImageNet dataset and avoid training the separate generator for each class.

연구 동기 및 목표

  • 생성 모듈의 계산 오버헤드를 제거하기 위해 생성을 효율적인 데이터 샘플링으로 대체함으로써 데이터 없는 지식 정련(DFKD)에서의 비용을 줄이는 것.
  • 원본 데이터와 대체 데이터 간의 도메인 이탈을 줄이기 위해 원본 데이터의 분포와 유사한 분포를 가진 개방형 세계의 데이터를 샘플링하는 것.
  • 샘플된 데이터의 낮은 노이즈 표현을 학습하여 정령 노이즈를 줄임으로써 정령 과정에서의 노이즈를 감소시키는 것.
  • 다양한 데이터 예제 간의 암묵적 관계를 구조적이고 대비적인 지식 정련을 통해 활용하는 것.
  • 원본 훈련 데이터나 생성 컴포onent에 의존하지 않고, CIFAR-10, CIFAR-100, NYUv2, ImageNet에서 최신 기준 성능을 달성하는 것.

제안 방법

  • 원본 데이터의 분포 유사성을 보장하기 위해 신뢰도(sc_i), 이방성(so_i), 클래스 밀도(sd_i)의 세 가지 점수를 기반으로 개방형 세계의 레이블이 없는 데이터를 선택하는 적응형 프로토타입 샘플링(APS) 모듈을 제안한다.
  • 교사 예측에서 기인하는 레이블 노이즈를 억제하기 위해 낮은 노이즈 표현을 학습하는 디노이징 대비 유사성 정련(DCRD) 모듈을 도입한다.
  • 교사 및 학생 네트워크 간의 대비 구조적 관계를 설정하여 다수의 데이터 예제 간 암묵적 지식을 모델링한다.
  • 지식 정련(L_KD), 노이즈 정규화(L_n), 대비 유사성 손실(L_c)을 포함하는 다목적 학습 손실을 활용하여 학생 성능을 향상시킨다.
  • 원본 훈련 데이터에 접근할 수 없더라도 사전 훈련된 교사 네트워크(예: ResNet-34/ResNet-50)를 사용하여 특징을 추출하고 샘플링 및 정련을 안내한다.
  • t-SNE 시각화를 통해 APS를 통해 샘플된 데이터의 특징 분포가 무작위 또는 기준 샘플링 방법보다 원본 데이터 도메인에 훨씬 더 가까운 것으로 확인한다.

실험 결과

연구 질문

  • RQ1생성 모델 없이 성능을 저하시키지 않고 데이터 샘플링이 데이터 없는 지식 정련에서 생성 모델을 대체할 수 있는가?
  • RQ2원본 데이터가 없는 상황에서 샘플된 데이터와 원본 데이터 분포 간의 도메인 이탈을 어떻게 최소화할 수 있는가?
  • RQ3개방형 세계의 레이블이 없는 데이터에서 낮은 노이즈 표현 학습이 정령 과정에서의 레이블 노이즈를 어느 정도 감소시킬 수 있는가?
  • RQ4구조적이고 샘플 간 유사성 기반 정련을 통해 개별 예제 정련을 넘어서 지식 전이 성능을 향상시킬 수 있는가?
  • RQ5적응형 샘플링과 대비 유사성 기반 정련을 조합하면 표준 벤치마크에서 최신 기준 성능을 달성할 수 있는가?

주요 결과

  • ODSD는 원본 훈련 데이터나 생성 모듈을 사용하지 않고도 CIFAR-10, CIFAR-100, NYUv2, ImageNet에서 최신 기준 정확도를 달성한다.
  • ImageNet에서 ODSD는 기존의 데이터 없는 지식 정련 방법 대비 정확도를 1.50%에서 9.59% 향상시킨다.
  • 제거 실험 결과, 세 가지 샘플링 점수(sc_i, so_i, sd_i) 중 어느 하나라도 제거하면 성능이 떨어지며, 이는 각 점수가 분포 유사성 확보에 기여한다는 것을 확인한다.
  • 모든 세 가지 학습 목표(L_KD, L_n, L_c)를 조합할 경우 최고의 성능을 기록하며, 50k 및 150k 샘플 데이터 설정에서 각각 75.26% 및 77.90%의 정확도를 달성한다.
  • t-SNE 시각화 결과, APS를 통해 샘플된 데이터의 특징 분포가 랜덤 또는 기준 샘플링 방법보다 원본 데이터 도메인에 훨씬 더 가까운 것으로 확인된다.
  • DCRD 모듈은 다수의 데이터 예제 간의 구조적 관계를 모델링함으로써 레이블 노이즈를 효과적으로 감소시키고 정련 성능을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.