Skip to main content
QUICK REVIEW

[論文レビュー] PareCO: Pareto-aware Channel Optimization for Slimmable Neural Networks

R Chin, Ari S. Morcos|arXiv (Cornell University)|May 4, 2021
Advanced Neural Network Applications参考文献 58被引用数 8
ひとこと要約

本稿では、スリム可能なニューラルネットワーク向けに、FLOPsおよびメモリ制約下での精度を向上させるPareCOという、パレートに配慮したチャネル最適化手法を提案する。この手法は、層ごとの異種な幅乗数と共有重みを同時に学習し、MobileNetV2を用いたImageNet上でのFLOPs制約下で最大1.7%、メモリ制約下で最大8%のトップ1精度向上を達成した。

ABSTRACT

Slimmable neural networks provide a flexible trade-off front between prediction error and computational cost (such as the number of floating-point operations or FLOPs) with the same storage cost as a single model. They have been proposed recently for resource-constrained settings such as mobile devices. However, current slimmable neural networks use a single width-multiplier for all the layers to arrive at sub-networks with different performance profiles, which neglects that different layers affect the network's prediction accuracy differently and have different FLOP requirements. Hence, developing a principled approach for deciding width-multipliers across different layers could potentially improve the performance of slimmable networks. To allow for heterogeneous width-multipliers across different layers, we formulate the problem of optimizing slimmable networks from a multi-objective optimization lens, which leads to a novel algorithm for optimizing both the shared weights and the width-multipliers for the sub-networks. We perform extensive empirical analysis with 15 network and dataset combinations and two types of cost objectives, i.e., FLOPs and memory footprint, to demonstrate the effectiveness of the proposed method compared to existing alternatives. Quantitatively, improvements up to 1.7% and 8% in top-1 accuracy on the ImageNet dataset can be attained for MobileNetV2 considering FLOPs and memory footprint, respectively. Our results highlight the potential of optimizing the channel counts for different layers jointly with the weights for slimmable networks.

研究の動機と目的

  • 既存のスリム可能なネットワークにおける層間で一様な幅乗数を用いる手法の限界に対処する。これは、各層の精度および計算コストへの影響を適切に反映していない。
  • 共有重みと層固有の幅乗数を同時に最適化する、整合的なマルチオブジェクティブ最適化フレームワークを構築する。
  • 層間での異種なチャネルスケーリングを可能にすることで、スリム可能なネットワークの性能を向上させ、精度と計算コストのトレードオフを改善する。
  • FLOPsおよびメモリフットプリントという2つのコスト目的の下で、多様なアーキテクチャとデータセットに対してこの手法を評価する。

提案手法

  • 予測精度と計算コスト(FLOPsまたはメモリフットプリント)のバランスをとるマルチオブジェクティブ問題として、スリム可能なネットワークの最適化を定式化する。
  • パレートに配慮した最適化戦略を導入し、共有ネットワーク重みと層固有の幅乗数を同時に学習する。
  • 層の重要度とコスト感受性に基づいて、異種なスケーリングを可能にする、微分可能で勾配ベースのアプローチを用いて、層間の幅乗数を最適化する。
  • 外側のループで幅乗数を最適化し、内側のループで現在の乗数設定下での共有重みを学習する二段階最適化フレームワークを採用する。
  • パレートフロントを近似するために、目的関数の重み付き和を適用し、勾配降下法を用いたエンドツーエンドの学習を可能にする。
  • 最適な幅乗数設定を特定する勾配ベースの探索戦略を採用し、精度-計算コストのトレードオフを改善する。

実験結果

リサーチクエスチョン

  • RQ1層間で異種な幅乗数を用いることで、均一なスケーリングと比較して、スリム可能なニューラルネットワークの性能が向上するか?
  • RQ2重みと幅乗数を共同で最適化することで、スリム可能なネットワークにおける精度-FLOPsおよび精度-メモリのトレードオフにどのような影響を与えるか?
  • RQ3パレートに配慮した最適化は、異なる計算コスト制約下でトップ1精度にどのような影響を与えるか?
  • RQ4提案手法は、多様なネットワークアーキテクチャおよびデータセットに一般化できるか?

主な発見

  • FLOPs制約下でMobileNetV2を用いたImageNet上では、PareCOはベースラインのスリム可能なネットワークと比較して最大1.7%高いトップ1精度を達成した。
  • メモリフットプリントをコスト目的とした場合、PareCOはMobileNetV2を用いたImageNet上でのトップ1精度を最大8%向上させた。
  • 15通りの異なるネットワークとデータセットの組み合わせにおいて、一貫した性能向上を示し、優れた一般化性能を確認した。
  • 実験結果から、均一なスケーリングと比較して、異種な幅乗数が、特にメモリ制約下でより優れたトレードオフを実現することが確認された。
  • 重みと幅乗数の共同最適化により、パレートフロントが著しく改善され、同じ計算コストでより高い精度が達成可能となった。
  • アブレーションスタディの結果、提案されたマルチオブジェクティブ定式化が、多様な設定において精度と効率のバランスを効果的にとれていることが検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。