Skip to main content
QUICK REVIEW

[論文レビュー] ParameterNet: Parameters Are All You Need

Kai Han, Yunhe Wang|arXiv (Cornell University)|Jun 26, 2023
Visual Attention and Saliency Detection被引用数 5
ひとこと要約

この論文では、パラメータ数を増やす一方でFLOPsを低く保つことで、大規模な視覚および言語事前学習を向上させる、新しい設計原則であるParameterNetを紹介する。動的畳み込みとMoEアダプタを用いることで、『低FLOPsの落とし穴』を克服し、FLOPsが低いモデルでも大規模事前学習の恩恵を受けることを可能にする。ImageNet-1Kでは81.6%のトップ1精度を達成(Swin-Tの80.9%を上回り、FLOPsは7倍少ない)、LLaMA-1BではMoE拡張により平均2.37%の精度向上を達成した。

ABSTRACT

The large-scale visual pretraining has significantly improve the performance of large vision models. However, we observe the \emph{low FLOPs pitfall} that the existing low-FLOPs models cannot benefit from large-scale pretraining. In this paper, we introduce a novel design principle, termed ParameterNet, aimed at augmenting the number of parameters in large-scale visual pretraining models while minimizing the increase in FLOPs. We leverage dynamic convolutions to incorporate additional parameters into the networks with only a marginal rise in FLOPs. The ParameterNet approach allows low-FLOPs networks to take advantage of large-scale visual pretraining. Furthermore, we extend the ParameterNet concept to the language domain to enhance inference results while preserving inference speed. Experiments on the large-scale ImageNet-22K have shown the superiority of our ParameterNet scheme. For example, ParameterNet-600M can achieve higher accuracy on ImageNet than the widely-used Swin Transformer (81.6\% \emph{vs.} 80.9\%) and has much lower FLOPs (0.6G \emph{vs.} 4.5G). In the language domain, LLaMA-1B enhanced with ParameterNet achieves 2\% higher accuracy over vanilla LLaMA. The code will be released at \url{https://parameternet.github.io/}.

研究の動機と目的

  • FLOPsが小さいモデルが大規模事前学習の恩恵を受けられない『低FLOPsの落とし穴』を解消すること。
  • FLOPsを低く保ちながらパラメータ数を増やすことで、視覚および言語モデルの性能向上が可能かどうかを調査すること。
  • リソース制約のあるモデル向けに、効率的でスケーラブルな事前学習を可能にする汎用的な設計原則を開発すること。
  • ParameterNetの有効性を、視覚(例:ImageNet-22K)および言語(例:LLaMA)モデルの両方で検証すること。

提案手法

  • 大規模事前学習においてFLOPsよりもパラメータ数を重視する設計原則として、ParameterNetを導入する。
  • 視覚モデルにおいて、追加のパラメータを導入する際のFLOPs増加を最小限に抑えるために、動的畳み込みを用いる。
  • 推論時におけるFLOPsを増加させないスパース活性化型MoE(Mixture of Experts)を用いて、LLMにパラメータを追加する。
  • 視覚事前学習において、CNN(例:GhostNet)および視覚変換器(例:Swin-300M)の両方へこの手法を適用する。
  • LLaMA-1Bに、各FFN線形投影にMoEアダプタを追加することで、FLOPsを維持したまま容量を拡張する。
  • 大規模データセット(ImageNet-22K、C4、Wikipedia、ArXiv)でモデルを学習し、下流タスクで評価する。

実験結果

リサーチクエスチョン

  • RQ1FLOPsを低く保ちながらパラメータ数を増やすことで、大規模視覚事前学習における性能向上が顕著に達成できるか?
  • RQ2なぜ低FLOPsモデルは大規模事前学習の恩恵を受けられないのか? そして、この『低FLOPsの落とし穴』は克服可能か?
  • RQ3動的畳み込みやMoEによるパラメータ拡張は、FLOPsの増加なしに性能向上をもたらすか?
  • RQ4ParameterNetの原則は大規模言語モデルへ一般化可能であり、ゼロショットおよび微調整性能を向上させられるか?

主な発見

  • ParameterNet-600MはImageNet-1Kで81.6%のトップ1精度を達成し、FLOPsは4.5GのSwin-T(80.9%)と比較して7倍少ない0.6Gで実現した。
  • 元のGhostNetモデルは低FLOPsの落とし穴に陥っていたが、ParameterNet-600Mはそれを克服し、ImageNet-1K事前学習で+2%の精度向上を達成した。
  • ImageNet-22Kで事前学習されたSwin-300Mは、ParameterNetを適用することで+2.2%の精度向上を示した。
  • LLaMA-1Bにアッププロージェクション層にMoE(8エキスパート)を適用した場合、ゼロショットタスクでベースライン比平均2.37%の精度向上を達成した。
  • パラメータ数が増えるにつれて学習損失が低下し、学習能力およびデータ理解力の向上が示された。
  • この手法はアーキテクチャに依存せず一般化可能である:CNNでは動的畳み込み、Transformer/LLMではMoEを適用した場合、いずれもFLOPsに増加なしに顕著な性能向上を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。