[논문 리뷰] DisWOT: Student Architecture Search for Distillation WithOut Training
DisWOT는 학습이 필요 없는 신경망 아키텍처 탐색 프레임워크를 제안하며, 무작위로 초기화된 교사 및 학생 네트워크 간의 의미적 및 관계적 유사도를 측정하여 지식 정복에 최적의 학생 모델을 선택한다. 기울기 기반 활성화 맵과 특징 상관 행렬을 활용하여 표준 학습 대비 180배 이상 빠른 속도로 최신 기술 수준의 정복 성능을 달성하며, 기존의 제로비용 NAS 방법들을 능가한다.
Knowledge distillation (KD) is an effective training strategy to improve the lightweight student models under the guidance of cumbersome teachers. However, the large architecture difference across the teacher-student pairs limits the distillation gains. In contrast to previous adaptive distillation methods to reduce the teacher-student gap, we explore a novel training-free framework to search for the best student architectures for a given teacher. Our work first empirically show that the optimal model under vanilla training cannot be the winner in distillation. Secondly, we find that the similarity of feature semantics and sample relations between random-initialized teacher-student networks have good correlations with final distillation performances. Thus, we efficiently measure similarity matrixs conditioned on the semantic activation maps to select the optimal student via an evolutionary algorithm without any training. In this way, our student architecture search for Distillation WithOut Training (DisWOT) significantly improves the performance of the model in the distillation stage with at least 180$ imes$ training acceleration. Additionally, we extend similarity metrics in DisWOT as new distillers and KD-based zero-proxies. Our experiments on CIFAR, ImageNet and NAS-Bench-201 demonstrate that our technique achieves state-of-the-art results on different search spaces. Our project and code are available at https://lilujunai.github.io/DisWOT-CVPR2023/.
연구 동기 및 목표
- 교사 및 학생 모델 간 아키텍처 불일치로 인해 발생하는 지식 정복 성능 격차를 해소하기 위해.
- 모든 학습 없이도 최적의 성능을 내는 학생 아키텍처를 식별하여 기존의 기초 학습 기반 탐색의 한계를 극복하기 위해.
- 최종 정복 정확도와 강하게 상관관계를 가지는 제로비용 메트릭을 개발하여 효율적인 아키텍처 탐색을 가능하게 하기 위해.
- 교사 및 학생 네트워크 간 의미적 및 관계적 일치도를 향상시켜 정복 성능을 향상시키기 위해.
- 기존 NAS 방법에 비해 비용을 180배 이상 감소시키는 확장 가능한 학습이 필요 없는 정복 전용 대안을 제공하기 위해.
제안 방법
- 단일 순방향 및 역방향 전파를 통해 얻은 Grad-CAM 활성화 맵의 채널별 유사도를 사용하여 교사 및 학생 네트워크 간 의미적 유사도를 측정한다.
- 전역 평균 풀링 이전의 특징 활성화로부터 유도된 정규화된 샘플-관계 상관 행렬 간 L2 거리 비교를 통해 관계 유사도를 계산한다.
- 의미적 및 관계 유사도 메트릭을 적합도 점수로 사용하여 최적의 학생 아키텍처를 탐색하기 위해 유전 알고리즘을 적용한다.
- 모든 정밀조정이나 학습 없이도 무작위로 초기화된 네트워크(Gaussian 및 He 초기화)를 사용하여 메트릭을 계산한다.
- 깊이, 너비, 커널 크기가 변할 수 있는 ResNet 유사 아키텍처의 사전 정의된 탐색 공간에 메트릭을 적용하며, 채널 수는 8로 나누어떨어지며 최대 2048채널까지 제한된다.
- 변형 후 구조적 검사를 통해 아키텍처 후보의 타당성을 보장하여 탐색 제약 조건 내에서의 실행 가능성을 확보한다.
실험 결과
연구 질문
- RQ1특징의 의미적 특성과 샘플 간 관계에 기반한 학습이 필요 없는 메트릭이 기초 정확도 또는 기존의 제로비용 대체 지표보다 정복 성능을 더 정확하게 예측할 수 있는가?
- RQ2왜 더 높은 독립 정확도를 보이는 모델이 지식 정복에서는 성능이 열 劣하는가? 이러한 격차를 설명하는 아키텍처 요소는 무엇인가?
- RQ3무작위로 초기화된 교사 및 학생 네트워크 간의 의미적 및 관계적 유사도가 정복 성능의 신뢰할 수 있는 대체 지표가 될 수 있는가?
- RQ4학습이 필요 없는 아키텍처 탐색 프레임워크가 정복 정확도를 향상시키면서도 검색 비용을 얼마나 줄일 수 있는가?
- RQ5의미적 및 관계 유사도에 의해 이끌어진 경우, 깊이, 너비, 커널 크기 등의 다양한 아키텍처 구성이 정복 성능에 어떤 영향을 미치는가?
주요 결과
- 기초 학습을 통해 도출된 최적의 학생 아키텍처가 반드시 최고의 정복 성능을 내는 것은 아니며, 이는 독립 정확도와 정복 정확도 사이에 괴리가 있음을 시사한다.
- 기초 정확도는 최종 정복 성능과 85% 정도의 상관관계를 보이며, 더 나은 탐색 대체 지표의 필요성을 강조한다.
- ResNet[3,3,3]은 ResNet[7,1,3]보다 더 높은 독립 정확도를 기록했지만, 후자는 더 나은 수신 필드와 지식 매칭으로 인해 정복 성능에서 앞섰다.
- 의미적 및 관계 유사도 메트릭은 검색 공간 $S_0$ 에서 기존의 제로비용 NAS 방법보다 정복 정확도와 더 높은 순위 상관관계를 보였다.
- DisWOT는 CIFAR, ImageNet, NAS-Bench-201에서 표준 학습 대비 최소 180배 빠른 검색 속도로 최신 기술 수준의 정복 성능을 달성했다.
- 제안된 메트릭은 효과적인 정복 기반 메트릭이자 제로프록시로 기능하여, 어떤 학습 없이도 높은 정확도의 학생 모델을 선택할 수 있게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.