Skip to main content
QUICK REVIEW

[논문 리뷰] Knowledge Squeezed Adversarial Network Compression

Changyong Shu, Peng Li|arXiv (Cornell University)|2019. 04. 10.
Advanced Neural Network Applications참고 문헌 46인용 수 13
한 줄 요약

이 논문은 지식 증류 기법인 지식 압축된 적대적 네트워크 압축(KSANC)을 제안한다. 이는 작업 기반 주의 메커니즘을 통해 중간 단계의 감독을 통합함으로써 대규모 교사 네트워크에서 지식을 압축하여 학생 네트워크 성능을 향상시키는 새로운 지식 증류 방법이다. 출력 분포와 중간 특징 표현을 모두 적대적으로 매칭함으로써, KSANC는 CIFAR-10, CIFAR-100, ImageNet에서 기존 최고 성능(SOTA)을 달성하며 극단적인 모델 압축 조건에서도 오차율을 크게 낮춘다.

ABSTRACT

Deep network compression has been achieved notable progress via knowledge distillation, where a teacher-student learning manner is adopted by using predetermined loss. Recently, more focuses have been transferred to employ the adversarial training to minimize the discrepancy between distributions of output from two networks. However, they always emphasize on result-oriented learning while neglecting the scheme of process-oriented learning, leading to the loss of rich information contained in the whole network pipeline. Inspired by the assumption that, the small network can not perfectly mimic a large one due to the huge gap of network scale, we propose a knowledge transfer method, involving effective intermediate supervision, under the adversarial training framework to learn the student network. To achieve powerful but highly compact intermediate information representation, the squeezed knowledge is realized by task-driven attention mechanism. Then, the transferred knowledge from teacher network could accommodate the size of student network. As a result, the proposed method integrates merits from both process-oriented and result-oriented learning. Extensive experimental results on three typical benchmark datasets, i.e., CIFAR-10, CIFAR-100, and ImageNet, demonstrate that our method achieves highly superior performances against other state-of-the-art methods.

연구 동기 및 목표

  • 기존 지식 증류 방법이 결과 중심 학습에만 집중하는 한계를 해결하기 위해 과정 중심의 중간 단계 감독을 통합한다.
  • 큰 교사 네트워크와 작은 학생 네트워크 사이의 표현 갭을 효과적인 지식 압축을 통해 줄인다.
  • 작업 기반 주의 메커니즘을 사용해 풍부한 중간 표현을 전달함으로써 압축된 고성능 학생 네트워크를 가능하게 한다.
  • 출력 및 중간 특징에 대한 적대적 정규화를 통해 훈련 안정성과 일반화 능력을 향상시킨다.
  • 표준 벤치마크에서 뛰어난 압축 성능를 달성하면서 정확도 손실를 최소화한다.

제안 방법

  • 교사 및 학생 네트워크 간의 출력 분포와 중간 특징 표현을 동시에 매칭하는 이중 적대적 훈련 프레임워크를 도입한다.
  • 깊은 층의 교사 네트워크에서 학생 네트워크로 지식을 선택적으로 압축하고 전달하기 위해 작업 기반 주의 메커니즘을 활용한다.
  • 고차원 중간 특징을 학생 네트워크의 능력에 맞는 압축된, 작업에 관련된 표현으로 압축한다.
  • 적대적 훈련의 안정성과 특징 정렬을 향상시키기 위해 카테고리 정규화와 디세크리미네이터 정규화를 통합한다.
  • 학습 중에 중간 단계의 감독을 통해 학생 네트워크를 이끌어, 지식 전달이 최종 레이어뿐만 아니라 전체 네트워크 파이프라인에 걸쳐 이루어지도록 보장한다.
  • 다중 수준에서 학생 및 교사 특징 간 분포 차이를 최소화하기 위해 적대적 손실를 적용함으로써 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1압축된 네트워크에서 결과 중심 매칭을 넘어서 중간 단계 감독이 지식 증류 성능을 향상시킬 수 있는가?
  • RQ2작업 기반 주의 메커니즘이 깊은 교사 네트워크에서 압축된 학생 네트워크로 지식을 효과적으로 압축하고 전달할 수 있는가?
  • RQ3적대적 훈련을 통해 과정 중심 학습과 결과 중심 학습을 조합하면, 모델 압축에서 더 나은 일반화와 더 낮은 정확도 손실를 달성할 수 있는가?
  • RQ4주의 메커니즘을 통한 지식 압축이 소형 네트워크 증류에서 훈련 안정성과 수렴을 향상시킬 수 있는가?
  • RQ5제안된 방법은 표준 벤치마크에서 최신 GAN 기반 증류 및 지식 증류 접근법과 비교해 어떻게 성능를 발휘하는가?

주요 결과

  • ResNet-20 학생 네트워크를 사용한 CIFAR-100에서 KSANC는 상위-1 오차율 31.42%를 기록하여 두 번째로 좋은 성능을 낸 TSCAN(32.57%)보다 1.15% 우수하다.
  • ResNet-18 학생 네트워크를 사용한 ImageNet에서 KSANC는 상위-1 오차율 31.47%를 기록하여 동일한 모델 크기 조건에서 TSCAN(32.72%)과 ANC(32.89%)를 크게 앞서며 성능을 뛰어넘었다.
  • ResNet-50 학생 네트워크를 사용한 ImageNet에서 KSANC는 상위-1 오차율 26.79%를 기록하여 두 번째로 좋은 성능을 낸 TSCAN(27.39%)을 초월했고, 오히려 교사 네트워크인 ResNet-152(27.63%)의 성능조차도 뛰어넘었다.
  • KSANC는 특히 학생 네트워크가 교사 네트워크보다 훨씬 작을 경우 중간 지식 전달을 효과적으로 통해 학생-교사 네트워크 간 정확도 격차를 줄였다.
  • 제거 분석 결과, 지식 압축을 통한 중간 단계 감독이 특히 저파rameter 환경에서 수렴 안정성과 일반화 능력을 향상시킨다는 점을 확인했다.
  • 여러 데이터셋과 모델 크기에서 일관된 우수성을 보이며, 적대적 훈련과 작업 기반 지식 압축을 조합한 방법의 효과성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.