Skip to main content
QUICK REVIEW

[논문 리뷰] Collaboration of Experts: Achieving 80% Top-1 Accuracy on ImageNet with 100M FLOPs

Yikang Zhang, Zhuo Chen|arXiv (Cornell University)|2021. 07. 08.
Advanced Neural Network Applications참고 문헌 42인용 수 7
한 줄 요약

이 논문은 CoE(Collaboration of Experts)를 제안하며, 이는 하드웨어 친화적인 프레임워크로, ImageNet에서 194M FLOPs 시에 80.7%의 top-1 정확도를 달성하고, PWLU 및 CondConv와 결합할 경우 100M FLOPs 시에 80.0%의 정확도를 기록한다. CoE는 입력에 따라 전문가를 선택하는 딜리게이터를 사용하며, WGM(Weight Generation Module)과 LGM(Label Generation Module)를 통한 공통 적응 학습을 통해 동적이고 저지연 추론을 가능하게 한다.

ABSTRACT

In this paper, we propose a Collaboration of Experts (CoE) framework to pool together the expertise of multiple networks towards a common aim. Each expert is an individual network with expertise on a unique portion of the dataset, which enhances the collective capacity. Given a sample, an expert is selected by the delegator, which simultaneously outputs a rough prediction to support early termination. To fulfill this framework, we propose three modules to impel each model to play its role, namely weight generation module (WGM), label generation module (LGM) and variance calculation module (VCM). Our method achieves the state-of-the-art performance on ImageNet, 80.7% top-1 accuracy with 194M FLOPs. Combined with PWLU activation function and CondConv, CoE further achieves the accuracy of 80.0% with only 100M FLOPs for the first time. More importantly, our method is hardware friendly and achieves a 3-6x speedup compared with some existing conditional computation approaches.

연구 동기 및 목표

  • 다수의 순차적 순전파가 필요한 앙상블 모델의 높은 추론 비용을 해결하기 위해.
  • 높은 메모리 액세스 비용과 낮은 병렬성으로 인해 하드웨어 효율성이 떨어지는 동적 컨볼루션 방법의 문제를 해결하기 위해.
  • 딜리게이터와 다수의 전문가 간의 공통 적응 학습을 가능하게 하는 훈련 철학을 개발하여 일반화 능력과 효율성을 향상시키기 위해.
  • 최소한의 FLOPs로 최신 기술 수준의 정확도를 달성하면서도 실세계 구현을 위한 하드웨어 우수성을 유지하기 위해.
  • 신경망 기계 번역과 같은 다른 작업으로의 일반화 능력을 입증하기 위해.

제안 방법

  • 한 명의 딜리게이터와 다수의 전문가를 포함하는 CoE 프레임워크를 도입하며, 딜리게이터는 거친 예측을 하고 이를 바탕으로 보완을 위한 전문가를 선택한다.
  • 균형 잡힌 운반 문제를 해결하기 위해 WGM(Weight Generation Module)을 사용하여, 딜리게이터 출력 기반으로 훈련 데이터를 분할하고 전문가 손실을 재가중하여 각 전문가가 별도의 데이터 부분에 집중하도록 한다.
  • LGM(Label Generation Module)을 활용하여 균형 잡힌 운반 문제를 통해 one-hot 선택 레이블을 생성함으로써, 딜리게이터의 전문가 선택에 대한 지도 신호를 형성한다.
  • WGM은 전문가들이 데이터 부분에 특화되도록 하고, LGM은 딜리게이터가 가장 적합한 전문가를 선택하도록 이끄는 공통 적응 학습을 통해 딜리게이터와 전문가를 함께 훈련한다.
  • PWLU 및 CondConv와 같은 기존 기법과 통합하여 FLOP 증가를 최소화하면서도 정확도를 더욱 향상시킨다.
  • 추론 시에는 오직 선택된 전문가만 로드함으로써 하드웨어 효율성을 확보하며, 메모리 액세스 비용을 최소화하고 병렬성을 극대화한다.

실험 결과

연구 질문

  • RQ1협업 전문가 프레임워크는 낮은 FLOP 소비와 함께 높은 정확도를 달성하면서도 하드웨어 친화적인가?
  • RQ2훈련 중에 딜리게이터와 전문가가 공통 적응을 통해 과적합을 방지하고 일반화 능력을 향상시킬 수 있는가?
  • RQ3딜리게이터가 학습한 전문가 선택 패턴은 의미 있는 샘플 복잡도를 반영하는가(예: 더 어려운 샘플을 더 무거운 전문가에게 할당하는가)?
  • RQ4CoE는 이미지 분류를 넘어서 신경망 기계 번역과 같은 다른 작업으로 일반화될 수 있는가?
  • RQ5제안된 훈련 알고리즘은 게이트 값 기반 최적화와 비교해 정확도와 효율성 면에서 어떻게 다른가?

주요 결과

  • CoE는 194M FLOPs에서 ImageNet에서 80.7%의 top-1 정확도를 달성하였으며, 이는 920M FLOPs에서 79.6%를 기록한 앙상블 방법보다 뚜렷이 뛰어나다.
  • CoE를 PWLU 및 CondConv와 결합함으로써, 100M FLOPs에서 80.0%의 top-1 정확도를 달성하였으며, 이는 문헌상 최초의 사례이다.
  • CoE는 최신 동적 방법인 BasisNet(198M FLOPs에서 80.0%)를 초월하며, 낮은 메모리 액세스 비용 덕분에 하드웨어에서 3.1배의 속도 향상을 기록했다.
  • WMT 2014 영어-독일어 번역 작업에서 CoE-Transformer는 62.5M MAC와 138.2M 파라미터로 29.4 BLEU 점수를 기록하였으며, 이는 Transformer (big)의 성능을 유지하면서도 더 적은 자원을 사용하였다.
  • 분석 결과, 딜리게이터는 해석 가능한 선택 패턴을 학습한다: 더 무거운 전문가들이 더 복잡한 샘플(정확도 측정 기준인 TCP 기준)을 선택함으로써 효과적인 전문성 분담이 이루어지고 있음을 보여준다.
  • 절단 실험 결과, WGM과 LGM이 모두 필수적임을 확인하였다: 둘 중 하나를 제거하면 정확도가 1.9~2.9%p 감소하였으며, 이는 공통 적응에 이 둘의 핵심적 역할을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.