Skip to main content
QUICK REVIEW

[논문 리뷰] ParameterNet: Parameters Are All You Need

Kai Han, Yunhe Wang|arXiv (Cornell University)|2023. 06. 26.
Visual Attention and Saliency Detection인용 수 5
한 줄 요약

이 논문은 파라미터 수를 늘리되 FLOPs는 낮게 유지함으로써 대규모 시각 및 언어 미리 훈련을 향상시키는 새로운 설계 원칙인 ParameterNet을 소개한다. 동적 컨볼루션과 MoE 어댑터를 활용하여 '낮은 FLOPs 함정'을 극복하며, FLOPs가 7배 적은 0.6G임에도 ImageNet-1K에서 81.6%의 top-1 정확도를 달성(비교 모델인 Swin-T의 80.9% 대비)하고, LLaMA-1B에 MoE 확장을 적용했을 때 평균 2.37%의 정확도 향상을 기록한다.

ABSTRACT

The large-scale visual pretraining has significantly improve the performance of large vision models. However, we observe the \emph{low FLOPs pitfall} that the existing low-FLOPs models cannot benefit from large-scale pretraining. In this paper, we introduce a novel design principle, termed ParameterNet, aimed at augmenting the number of parameters in large-scale visual pretraining models while minimizing the increase in FLOPs. We leverage dynamic convolutions to incorporate additional parameters into the networks with only a marginal rise in FLOPs. The ParameterNet approach allows low-FLOPs networks to take advantage of large-scale visual pretraining. Furthermore, we extend the ParameterNet concept to the language domain to enhance inference results while preserving inference speed. Experiments on the large-scale ImageNet-22K have shown the superiority of our ParameterNet scheme. For example, ParameterNet-600M can achieve higher accuracy on ImageNet than the widely-used Swin Transformer (81.6\% \emph{vs.} 80.9\%) and has much lower FLOPs (0.6G \emph{vs.} 4.5G). In the language domain, LLaMA-1B enhanced with ParameterNet achieves 2\% higher accuracy over vanilla LLaMA. The code will be released at \url{https://parameternet.github.io/}.

연구 동기 및 목표

  • 작은 FLOPs를 가진 모델이 대규모 미리 훈련의 益을 얻지 못하는 '낮은 FLOPs 함정'을 해결하기 위해.
  • FLOPs를 낮게 유지하면서 파라미터를 늘임으로써 시각 및 언어 모델의 성능 향상 여부를 탐구하기 위해.
  • 자원 제약이 있는 모델을 위한 효율적이고 확장 가능한 미리 훈련을 가능하게 하는 일반화 가능한 설계 원칙을 개발하기 위해.
  • ParameterNet의 효과를 시각(예: ImageNet-22K) 및 언어(예: LLaMA) 모델 전반에 걸쳐 검증하기 위해.

제안 방법

  • 대규모 미리 훈련을 위해 FLOPs보다 파라미터 수를 우선시하는 설계 원칙인 ParameterNet을 도입한다.
  • 시각 모델에서 FLOPs 증가를 거의 유발하지 않으면서 추가 파라미터를 주입하기 위해 동적 컨볼루션을 사용한다.
  • 희소 활성화된 MoE(Mixture of Experts)를 적용하여 추론 시 FLOPs를 증가시키지 않고도 LLM에 파라미터를 추가한다.
  • 시각 미리 훈련을 위해 CNN(예: GhostNet)과 비전 트랜스포머(예: Swin-300M) 모두에 이 방법을 적용한다.
  • LLaMA-1B에 대해 각 FFN 선형 투영에 MoE 어댑터를 추가하여 FLOPs를 유지하면서도 능력 증가를 달성한다.
  • 대규모 데이터셋(ImageNet-22K, C4, Wikipedia, ArXiv)에서 모델을 훈련하고, 최종적으로 다운스트림 작업에서 평가한다.

실험 결과

연구 질문

  • RQ1FLOPs를 낮게 유지하면서 파라미터를 늘리는 것이 대규모 시각 미리 훈련에서 성능 향상에 의미 있게 기여할 수 있는가?
  • RQ2왜 낮은 FLOPs 모델은 대규모 미리 훈련의 益을 얻지 못하는가? 이 '낮은 FLOPs 함정'은 극복될 수 있는가?
  • RQ3동적 컨볼루션 또는 MoE를 통한 파라미터 확장을 통해 FLOPs 증가 없이 성능 향상이 가능할까?
  • RQ4ParameterNet 원칙은 대규모 언어 모델로 일반화되어 제로샷 및 피지테이닝 성능을 향상시킬 수 있는가?

주요 결과

  • ParameterNet-600M는 ImageNet-1K에서 81.6%의 top-1 정확도를 기록했으며, FLOPs가 7배 적은 0.6G(비교 대비 4.5G)임에도 불구하고 Swin-T(80.9%)를 초월한다.
  • 원본 GhostNet 모델은 낮은 FLOPs 함정에 빠지지만, ParameterNet-600M는 이를 극복하여 ImageNet-1K 미리 훈련에서 +2%의 정확도 향상을 달성한다.
  • ImageNet-22K에서 미리 훈련된 Swin-300M는 ParameterNet으로 향상된 후 +2.2%의 정확도 향상을 기록한다.
  • LLaMA-1B에 업프로젝션 레이어에 MoE(8개 전문가)를 적용한 경우, 제로샷 작업에서 기준 모델 대비 평균 2.37%의 정확도 향상을 기록한다.
  • 더 많은 파라미터를 가질수록 훈련 손실이 감소함으로써 학습 능력 향상과 데이터 이해도 향상이 가능하다는 것을 시사한다.
  • 이 방법은 아키텍처에 관계없이 일반화 가능하다: CNN에선 동적 컨볼루션, 트랜스포머/LLM에선 MoE 모두 FLOPs 증가 없이 유의미한 성능 향상을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.