Skip to main content
QUICK REVIEW

[논문 리뷰] Filter Grafting for Deep Neural Networks

Fan‐Xu Meng, Hao Cheng|arXiv (Cornell University)|2020. 01. 15.
Advanced Neural Network Applications참고 문헌 27인용 수 9
한 줄 요약

이 논문은 깊이 신경망에서 중요도가 낮은 필터를 외부 네트워크의 가중치를 접목시켜 재활성화하는 새로운 학습 패러다임인 필터 그라프팅을 소개한다. 아키텍처를 변경하지 않고도 성능을 크게 향상시키며, 특히 MobileNetV2에서 CIFAR-100에서 최대 7%의 정확도 향상을 달성한다. 이 방법은 엔트로피 기반 기준과 적응형 가중치 전략을 사용하여 표현 능력을 향상시킨다.

ABSTRACT

This paper proposes a new learning paradigm called filter grafting, which aims to improve the representation capability of Deep Neural Networks (DNNs). The motivation is that DNNs have unimportant (invalid) filters (e.g., l1 norm close to 0). These filters limit the potential of DNNs since they are identified as having little effect on the network. While filter pruning removes these invalid filters for efficiency consideration, filter grafting re-activates them from an accuracy boosting perspective. The activation is processed by grafting external information (weights) into invalid filters. To better perform the grafting process, we develop an entropy-based criterion to measure the information of filters and an adaptive weighting strategy for balancing the grafted information among networks. After the grafting operation, the network has very few invalid filters compared with its untouched state, enpowering the model with more representation capacity. We also perform extensive experiments on the classification and recognition tasks to show the superiority of our method. For example, the grafted MobileNetV2 outperforms the non-grafted MobileNetV2 by about 7 percent on CIFAR-100 dataset. Code is available at https://github.com/fxmeng/filter-grafting.git.

연구 동기 및 목표

  • 깊이 신경망에서 중요도가 낮은(ℓ1 노름이 작은) 필터의 활용도가 낮은 문제를 해결한다. 이러한 필터들은 일반적으로 효율성을 위해 제거되지만 잠재적인 표현 능력을 지닐 수 있다.
  • 외부 정보를 통해 이러한 필터를 재활성화하는 것이 필터를 제거하는 것보다 모델 성능 향상에 기여하는지 조사한다.
  • 병렬 네트워크 간 지식 전달을 가능하게 하는 일괄적, 자기지도 학습 방법을 개발한다. 이는 필터 그라프팅을 통해 이루어진다.
  • 아키텍처를 유지하면서 그라프팅을 통해 유효한 필터 수를 늘림으로써 DNN의 표현 능력을 향상시킨다.
  • 필터 그라프팅이 다양한 작업, 즉 이미지 분류, 객체 인식, 인물 재식별 등에 일반화되는지 확인한다.

제안 방법

  • 기존 아키텍처를 유지하면서 외부 네트워크의 새로운 가중치를 할당하여 중요도가 낮은 필터를 재활성화하는 필터 그라프팅을 새로운 패러다임으로 제안한다.
  • 필터의 정보량을 측정하기 위해 엔트로피 기반 기준을 사용하여 중요도가 낮고 그라프팅에 적합한 필터를 식별한다.
  • 다양한 레이어와 네트워크 간에 그라프팅된 정보의 기여도를 균형 있게 조절하기 위해 적응형 가중치 전략을 구현한다.
  • 여러 네트워크를 동시에 훈련시키며, 훈련 도중 한 네트워크의 유의미한 필터를 다른 네트워크의 무효 필터에 주기적으로 그라프팅한다.
  • 감독 없이도 네트워크의 본질적 구조와 특징 표현을 기반으로 그라프팅 과정을 수행한다.
  • 그라프팅 과정에서 소스와 타겟 네트워크 간 레이어 및 채널 일관성을 유지하여 호환성과 효과적인 정보 전달을 보장한다.

실험 결과

연구 질문

  • RQ1깊이 신경망 내 중요도가 낮은 필터를 제거하는 대신 효과적으로 재활성화하여 모델 성능을 향상시킬 수 있는가?
  • RQ2그라프팅에 가장 적합한 정보의 원천은 무엇인가? 내부 네트워크 특징인지, 외부 네트워크인지?
  • RQ3그라프팅 과정을 안내하기 위해 필터의 정보량을 정량적으로 어떻게 측정할 수 있는가?
  • RQ4다양한 레이어와 네트워크 간에 그라프팅된 가중치의 기여도를 균형 있게 조절할 수 있는 전략은 무엇인가?
  • RQ5필터 그라프팅은 ImageNet, CIFAR-100, 인물 재식별과 같은 다양한 데이터셋과 작업에 일반화되는가?

주요 결과

  • 필터 그라프팅은 모델 정확도를 크게 향상시킨다: MobileNetV2는 CIFAR-100에서 78.32%의 상위-1 정확도를 달성하여 비그라프팅 기준보다 7% 향상되었다.
  • 기준 모델에서 무효 필터 수(ℓ1 노름 < 1e-3)가 약 50%에서 그라프팅된 네트워크에서는 극히 소수의 비율로 감소하여 효과적인 재활성화가 이루어졌음을 확인했다.
  • 그라프팅된 네트워크는 기준 모델 대비 더 높은 정보 엔트로피와 더 큰 정보 양을 보이며 표현 능력 향상을 시사한다.
  • 그라프팅 과정에 참여하는 병렬 네트워크 수가 많을수록 성능 향상이 증가하여, 여러 모델 간의 확장성과 양호한 상호보완 효과를 보였다.
  • ImageNet에서 ResNet18과 ResNet34는 각각 상위-1 정확도를 2.04%, 1.98% 향상시켜 대규모 데이터셋에서도 효과를 입증했다.
  • 인물 재식별 작업에서는 Market1501과 DukeMTMC-ReID 양쪽 모두에서 mAP와 랭크-1 정확도가 향상되었으며, 네 개의 네트워크를 사용할 경우 Market1501에서 mAP가 최대 6.7% 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.