Skip to main content
QUICK REVIEW

[논문 리뷰] Shapley Value as Principled Metric for Structured Network Pruning

Marco Ancona, Cengiz Öztireli|arXiv (Cornell University)|2020. 06. 02.
Advanced Neural Network Applications참고 문헌 36인용 수 6
한 줄 요약

이 논문은 구조적 신경망 프루닝을 위한 원칙적인 메트릭으로 셰플리 값(Shapley values)을 제안하며, 협력 게임 이론을 활용해 은닉 유닛의 기여도를 보다 정확히 평가한다. 프루닝 중 성능 저하를 최소화함으로써, 특히 피니테이닝이 제한된 저데이터 환경에서 테일러 전개나 무작위 프루닝과 같은 히우리스틱 메트릭보다 셰플리 값이 뛰어나다는 것을 입증한다.

ABSTRACT

Structured pruning is a well-known technique to reduce the storage size and inference cost of neural networks. The usual pruning pipeline consists of ranking the network internal filters and activations with respect to their contributions to the network performance, removing the units with the lowest contribution, and fine-tuning the network to reduce the harm induced by pruning. Recent results showed that random pruning performs on par with other metrics, given enough fine-tuning resources. In this work, we show that this is not true on a low-data regime when fine-tuning is either not possible or not effective. In this case, reducing the harm caused by pruning becomes crucial to retain the performance of the network. First, we analyze the problem of estimating the contribution of hidden units with tools suggested by cooperative game theory and propose Shapley values as a principled ranking metric for this task. We compare with several alternatives proposed in the literature and discuss how Shapley values are theoretically preferable. Finally, we compare all ranking metrics on the challenging scenario of low-data pruning, where we demonstrate how Shapley values outperform other heuristics.

연구 동기 및 목표

  • 피니테이닝이 불가능하거나 효과적이지 않은 경우에 히우리스틱 기여도 메트릭의 한계를 해결하기 위해.
  • 테일러 전개와 LRP와 같은 기존 메트릭이 단위 중요도를 추정할 때 가지는 이론적 결함을 규명하기 위해.
  • 협력 게임 이론에 기반한 잘 정의된 축약성과 바람직한 공리적 성질을 지닌 이론적으로 타당한 대안으로 셰플리 값을 제안하기 위해.
  • 저데이터 설정에서 성능 저하를 줄이고 정확도를 더 잘 유지하는 바탕이 되는 셰플리 기반 프루닝의 경험적 검증을 수행하기 위해.

제안 방법

  • 협력 게임 이론에서 유래한 셰플리 값을 활용해 각 은닉 유닛이 주어진 작업에서 네트워크 성능에 기여하는 정도를 정량화한다.
  • 각 유닛의 기여도를 게임으로 모델링하며, 유닛을 포함하거나 제거했을 때 성능 변화를 측정하는 값 함수를 정의한다.
  • 무작위로 선택된 다른 유닛의 부분집합을 기반으로 몬테카를로 근사를 사용해 셰플리 값을 효율적으로 추정한다.
  • 셰플리 값을 기반으로 유닛을 순위 매겨, 기여도가 가장 낮은 유닛부터 제거하는 구조적 프루닝을 수행한다.
  • 피니테이닝 없이 저데이터 환경을 시뮬레이션하기 위해 프루닝을 수행하고, 프루닝 비율에 따른 정확도 저하를 측정한다.
  • 표준 벤치마크(CIFAR-10, CUB-200)를 사용해 셰플리 값과 무작위 프루닝, 테일러 전개, LRP를 비교한다.

실험 결과

연구 질문

  • RQ1저데이터 구조적 프루닝 환경에서 기존의 히우리스틱 기여도 메트릭(예: 테일러, LRP)은 어떤 성능을 보이는가?
  • RQ2구조적 프루닝을 위한 이상적인 기여도 메트릭이 가져야 할 이론적 성질은 무엇이며, 현재의 방법들은 그 성질을 어떻게 충족하지 못하는가?
  • RQ3셰플리 값이 공리적 기반을 지닌 덕분에, 프루닝을 위한 더 원칙적이고 효과적인 유닛 순위 매기기 방법이 될 수 있는가?
  • RQ4피니테이닝이 불가능한 상황에서 셰플리 기반 프루닝은 히우리스틱 또는 무작위 프루닝보다 성능 저하를 줄일 수 있는가?

주요 결과

  • 셰플리 값은 여러 데이터셋(CIFAR-10 및 CUB-200)과 프루닝 비율에서 다른 메트릭—테일러 전개나 무작위 프루닝—을 일관되게 능가한다.
  • CIFAR-10에서 셰플리 값은 25% 및 50%의 유닛을 프루닝한 후 가장 높은 테스트 정확도를 기록했으며, 저프루닝 비율에서 조차도 두 번째로 좋은 방법(무작위 프루닝)을 능가했다.
  • 더 도전적인 CUB-200 데이터셋에서는 테일러 전개가 가장 잘 작동했지만, 셰플리 값이 여전히 뛰어난 성능을 유지해 다양한 설정에서의 강건성을 보였다.
  • 셰플리 값은 성능에 악영향을 미치는 유닛을 식별해 거의 손상 없이 제거할 수 있으며, 이는 히우리스틱 방법으로서는 신뢰성 있게 확보되지 않는다.
  • 피니테이닝이 불가능한 저데이터 환경에서 셰플리 값과 다른 메트릭 간의 성능 격차가 더욱 벌어지며, 이러한 환경에서 원칙적인 메트릭의 중요성을 부각시킨다.
  • 본 연구는 셰플리 값이 효율성, 대칭성, 드럼머 플레이어 성질 등의 바람직한 공리들로 특징지어지며 이론적으로 더 바람직하다는 것을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.